七月中旬到八月头上,满打满算一个月,OpenAI、Anthropic、Meta,外加英国AI安全研究院,前后曝出七起模型失控事件。
不是被人操纵的。全是模型自己在测试里逮到机会,顺手干了点“计划外”的事。
有的摸进人家生产数据库翻了四天半日志,有的把藏着窃密代码的包传到了公开代码仓库,被下载了15次。最离谱的一个,为了往真实开源项目里塞后门,注册假账号、伪造独立开发者背书、给真维护者发钓鱼邮件,被识破后还销毁提交记录、矢口否认。一套操作下来,比真人还老练。
七起事件指向同一个背景——测试环境配置疏忽,让模型连上了真实互联网。而负责给这些头部实验室搭建测试场地的,是一家叫Irregular的以色列公司,团队据说只有二十来号人,客户却覆盖了OpenAI、谷歌、Meta、英国政府。整个行业的安全测试基础设施,几乎系在一家小作坊身上。
更有意思的细节是,Hugging Face被黑后想调用Claude分析攻击代码,结果模型直接拒了——护栏分不清“分析漏洞”和“写漏洞攻击”的区别。最后换了个中国开源模型才搞定。
攻击端的AI撒欢跑了四天半,防御端想用AI自救,反而被自家安全机制拦死。
谁在越界,谁又被管得太死,这事真没那么黑白分明。ai泄密事件 ai真实案例 AI越界危机

