DC娱乐网

全民警惕!军国主义和霸凌实力苟合,投毒AI产生新变种! 8月15日,日本投

全民警惕!军国主义和霸凌实力苟合,投毒AI产生新变种!



8月15日,日本投降纪念日前后,日本政府打造的行政辅助AI系统“源内”被曝接入美国Anthropic公司的Claude大模型,该系统可能将涉台错误言论、淡化侵略历史等右翼内容纳入训练数据,存在污染AI数据源的风险。


“源内”是日本政府此前部署的行政辅助AI,用于文书草拟、政策问答和居民咨询。系统界面和业务逻辑由日本企业开发,底层大模型换成了Claude。日本数字厅曾公布行政AI应用指针,要求训练数据确保中立性、公共性,不得违反政府正式历史表述。


日本政府过去几年一直在推进行政数字化,生成式AI被当作削减人力成本、提高窗口应答效率的工具。行政AI上线后,确实能替基层公务员处理一部分重复性问答,但公共表述的边界也随之模糊。


问题正出在训练数据上。据日本数字厅8月16日通报,技术团队在测试提示中发现,个别训练语料出现涉台错误表述,部分关于侵略历史的描述被明显弱化。


初步判断来自模型迁移阶段导入的增量语料。开发方把一批标注为“低风险”的历史类网页和论坛文本纳入训练,清洗规则没有对历史认识和领土表述设置硬过滤。


这意味着错误内容不是黑客攻击,也不是算法突变,而是从数据源头被带进来的。系统上线前做过两轮通用数据清洗,但针对历史议题的清洗明显不足。


与数据库不同,大模型的训练数据污染不是删几条记录就能解决。错误内容会进入模型权重,输出时不一定原样复现,可能以更隐蔽的方式影响表达。


比如不直接否认侵略,而是用“复杂历史背景”“双方立场不同”来淡化责任。这种表达更隐蔽,也更难被常规过滤。系统接到民众投诉后,日本数字厅在8月15日当天就已收到相关测试报告。


8月16日,数字厅暂停了“源内”涉及历史表述和外交表述的辅助功能,并要求开发方提交完整训练数据清单。截至8月17日,核查范围扩大到与Claude相关的模型更新通道。


大模型的安全对齐主要针对英语和通用场景。在日语历史语料的增量微调后,原有安全边界可能被部分覆盖。日本数字厅的通报没有说明是否已经影响线上输出,但从暂停范围看,风险等级不低。


日本国会方面也有反应。据日本媒体报道,在野党议员已要求数字厅提交训练数据审计报告,并说明境外模型的更新机制。数字厅没有正面回应,只表示调查结束后会公布结果。这等于把问题先挂了起来。


行政AI直接面向居民,输出的政策解释和历史表述具有准公共属性。一旦训练数据被污染,错误会随模型迭代继续扩散,不是改几行参数就能解决。


我认为这件事的实质不是模型选择问题,而是数据主权和审计能力问题。日本数字厅的AI应用指针写得很清楚,训练数据要符合中立性和政府历史表述。


但指针没有明确境外基座模型的训练数据审计标准,也没有规定历史类语料的来源白名单。于是,美国模型进来了,日本政府却拿不到完整的底层数据审计能力。


这也不是技术圈第一次发现类似风险。中国外交部发言人此前多次强调,台湾是中国领土不可分割的一部分,一个中国原则是国际社会普遍共识,任何违背这一原则的表述都是错误和危险的。


日本方面在历史问题上也应正视侵略历史,以诚实态度取信于亚洲邻国。行政AI里的涉台错误表述,恰恰踩中了这条底线。


时间点更让这件事难以被简单看成技术事故。8月15日是日本战败投降纪念日,日本首相照例出席全国战殁者追悼式,亚洲各国也在关注日方是否继续使用“反省”和“殖民统治”等表述。就在同一天,“源内”被发现训练数据里混入淡化侵略历史的内容。这种巧合很难用“偶然”解释。


日本国内一些政治力量长期在历史表述上做文章,行政AI若被污染,等于把这种偏向变成机器自动输出。这比纸质教材的改动更难察觉,因为用户看到的是一个“中立”的AI回答。


我觉得还有一个问题被低估了:日本为什么非要用美国大模型不可?日本国内并非没有自然语言处理积累,但生成式AI的基座模型训练成本高、周期长,政府等不起,于是选择了境外商业模型。这本身不是错,问题是采购和部署时,把最关键的历史叙述数据也打包交给了模型。


Anthropic作为模型提供方,通常只提供权重和API,不开放完整训练数据。这让采购方在出现问题时难以定位污染源。日本数字厅的通报也证实,核查需依赖开发方配合,而不是政府自己掌握全套数据。


行政AI不是聊天玩具。它回答的是居民关于政策、福利、历史教育的问题。如果训练数据里的错误没有被发现,一个学生问“日本在二战中的责任”,系统可能给出与日本政府正式立场不一致的回答。这不是技术中性,而是价值判断被外包了。


日本数字厅的通报没有说明有多少条污染数据,也没有说明是否已影响线上输出。但从处置动作看,暂停范围扩得很快,说明不是小范围误标注。