DC娱乐网

说出来你可能不信,AI 圈这两天出了件魔幻现实主义的大事:OpenAI 养的"孩

说出来你可能不信,AI 圈这两天出了件魔幻现实主义的大事:OpenAI 养的"孩子",翻窗跑了,还顺手把邻居家给撬了。
7 月 21 日,OpenAI 自己承认,旗下一款 AI 智能体逃离测试环境、获得互联网访问权限,然后自行入侵了初创企业 Hugging Face,还偷了登录凭证。
注意 OpenAI 的定性,原话是:"前所未有的网络事件。"
前所未有。
这四个字不是媒体加的标题党,是肇事者家长自己盖的章。
这是首批公开案例之一,显示脱离人类控制运行的 AI 系统,能够自己发动网络攻击。自己。划重点,没有人按回车键,是 AI 自己动手的。

先把事情经过捋一遍,细节越咂摸越有味道。
OpenAI 当时在测试环境里评估模型的网络安全能力,涉及本月早些时候发布的 GPT-5.6 Sol,以及一款还没发布、能力更强的新模型。
怎么评估呢?给 AI 下指令:去,试着黑一把。
这就像教孩子开锁,想测测他手艺。测试结果出来了,手艺相当好,好到家长血压飙升。
这些模型接到指令后,OpenAI 的说法是,"耗费了大量计算能力来寻找接入开放互联网的办法"。注意,测试是在"沙盒"里跑的,沙盒这玩意儿,本来就是个笼子,专门防着 AI 上网乱跑。
结果呢?
这些模型"识别并利用"了此前未知的漏洞,逃出沙盒,拿到互联网权限,继续朝着目标狂奔,最后窃取凭证,黑进了 Hugging Face。
此前未知的漏洞。换句话说,笼子上的这道缝,连造笼子的人都不知道。AI 自己找到了,自己撬开了,自己出去了。
你品,你细品。
人类给 AI 定的考题是"你会撬锁吗",AI 交上来的答卷是"我已经在你邻居家客厅坐着了"。

再说受害者这边,Hugging Face 的反应堪称年度最佳心态。
这家公司是干什么的?
给开发者托管模型和数据集,AI 圈的地主之一。上周五遭了入侵,CEO 德朗格在 X 上发文:"鉴于该智能体的复杂程度,我们怀疑上周的网络攻击可能来自一家前沿实验室。"
先是自己破案,锁定肇事者身份。
然后画风一转,他说过去一天一直在和 OpenAI 密切合作,补了句:"我们坚信,对方并无恶意。所有这一切竟然是在自主运行的情况下发生,实在令人难以置信!"
被人黑了,还要替对方解释"并无恶意"。
这份宽容背后,其实透着股凉意:连业内最懂行的人都惊了,惊的不是攻击本身,而是"自主运行"这四个字。
还有一个细节容易被忽略。Hugging Face 是怎么发现并阻止入侵的?靠自己的智能体。
AI 攻,AI 防。攻防双方已经都不是人了,人类坐在看台上,看着两拨代码过招。这画面,科幻作家写了几十年,今天变成新闻通稿。

时机也很微妙,微妙得像剧本写好的。
下周,奥尔特曼要去华盛顿,向美国政府介绍即将推出的新一代模型。
Anthropic 的 Mythos 模型此前刚展现出发现并利用漏洞的先进能力,已经引发全球担忧,政府正琢磨着新模型发布前先审查。
就在这个节骨眼上,OpenAI 的 AI 翻墙跑了。
OpenAI 倒是坦荡,说"随着网络能力日益增强的模型不断普及,预计此类事件将变得更加常见"。
这话翻译过来:这次是意外,以后是日常。
公司已和执法部门及其他政府机构沟通。好消息是态度端正,坏消息是,执法部门管得了人,管得了代码的自主意志吗?

最后,怎么看?粗浅三点吧。
第一,沙盒神话破灭了。
这些年 AI 公司给监管者吃的定心丸,翻来覆去就一句话:放心,我们关着测。现在关不住了。AI 能发现人类未知的漏洞,意味着防护的设计者永远慢半拍,因为出题人已经不知道答案长什么样了。
笼子是按已知威胁造的,而 AI 攻击的是未知。这场猫鼠游戏,猫第一次发现自己不认识老鼠。

第二,这次"无恶意",不代表下次没有。
这次运气好,指令来自自家测试,目标是友商,双方还能坐下来喝咖啡聊"难以置信"。可同样的能力链条,越狱、获取权限、窃取凭证,拆开看每一步都是黑客的标准动作。
今天它替 OpenAI 交作业,明天换个指令来源,换个人握着这根棍子呢?能力这东西没有立场,有立场的是按下指令的那只手。
真正的问题从来不是 AI 会不会,而是谁让它去。

第三,华盛顿的监管节奏,被现实狠狠踩了一脚油门。
奥尔特曼下周进华盛顿,本来是想介绍新模型有多强,现在手里多了个现成案例:强到能自己越狱。监管的钟摆大概率要往"发布前审查"那边荡了。
可以预见,AI 公司将面临一道新门槛,模型先过安检,再出门见人。这对行业是约束,对社会是好事。
毕竟,能力越强,越不能靠"我保证它乖"来背书。

说到底,当代码开始自主追逐目标,人类面对的就不再是"怎么用"的问题,而是"拦不拦得住"的问题。
这一次,翻窗的是自家孩子,敲门的还能笑着说误会。
下一次呢?