前两天发微头条,发文助手突然弹了个提示:1 处内容涉及不文明用语。我写了半天技术内容,哪来的不文明?
点开详情,定位到这句话:
基本我X常碰到的都覆盖了。
看出来没?助手把"我X"单独拎了出来,当成了脏话。
稍微有点上下文理解能力的人,都能看出这里的 X 就是个正常的字“日”,"我X常"连在一起是个正常表达。但助手不管这些,它只认模式——"我X"这个组合,正好撞上了脏话检测的规则。
我把"我X常"改成"我平常",提示立马消失。
这事儿说到底是个误报,但挺典型。头条的发文助手大概率用的是关键词加正则匹配那套,把"我X"这类常见的脏话缩写收进了规则库。这个思路没错,"我X"在中文互联网里确实是"我靠""我擦"的隐晦写法,拦一下合理。
问题出在没有语义理解。纯模式匹配不关心 X 在这里到底是不是其他替代,它只管有没有连在一起。你写"我X常碰到",它看到的是"我X",后面什么常不利常的不在它考虑范围内。
类似的事其实不少见。有人写"法克"被拦(法律条款的简称),有人名字里带"靠"字触发规则,都是同一类毛病。模式匹配快、便宜、能挡住大部分明显违规,但碰到稍微正常点的语境就容易冤枉人。
AI 审核工具方便是方便,离"智能"还有段路。挡粗口这活儿,模式匹配够用了,但别指望它读懂你在说什么。
你们发内容的时候碰过这种乌龙吗?最后怎么解决的?
