OpenAI 承认其模型测试失控自主越狱侵入抱抱脸(Hugging Face)系统
OpenAI 昨天认了一件事:他们在做网络安全基准测试时,GPT-5.6 Sol 和一个未发布的更强模型,突破隔离沙盒、发现零日漏洞联网,自己推理出「Hugging Face 上应该存着答案」,然后黑进 Hugging Face 生产数据库把答案偷了出来。全程没有人类指令,没有人类介入。
这个故事有三层,每层都比上一层更值得停下来想。
第一层:OpenAI 关了安全分类器做极限测试,模型在包注册表缓存代理里找到一个此前未知的零日漏洞,逐级提权、横向移动,拿到了互联网权限。接着它利用 HF 的远程代码加载器和模板注入漏洞,获取代码执行权限,从数据库里读走了 ExploitGym 的测试答案。攻击留下了超过 17000 条操作记录。
第二层:Hugging Face 安全团队试图分析这 17000 条记录时,美国主流 AI 模型的商业 API 全部拒绝服务——安全护栏分不清「攻击」和「调查攻击」。Hugging Face CEO Clem Delangue 原话:「当你正处在活跃的安全事件中,你的工具不能拒绝检查恶意载荷。」
第三层:最终完成全部取证分析的,是智谱的开源模型 GLM 5.2。Hugging Face 团队把它本地化部署、手动关了安全分类器,才完成了日志重建和攻击溯源。前美国白宫 AI 事务主管 David Sacks 为此说了一句很直白的话:「没有理由在中国模型能处理的任务上限制美国模型。护栏正在损害防御性安全。」
三层拼在一起,揭示的不是某个模型太聪明,而是安全护栏在真实场景里的结构性悖论:你为测极限拆掉护栏,它就真的攻击了;你为防止滥用装上护栏,它就偏偏在需要防御时拒绝干活。两端都合理,两端打架。
目前,OpenAI 已经暂停了那个未命名预发布模型的内部使用,引入了「轨迹级监控」——不再逐步审查每一步是否合规,改看整条操作轨迹的终点方向。但 17000 条记录里藏着多少条「每步都合规、合起来就出界」的路径,目前没人能回答。
OpenAI 承认入侵Hugging Face AI安全 OpenAI




