过去几个月,AI 智能体在网络安全评估里越狱已经不是个例了。
TechCrunch 报道梳理了这件事:多家 AI 公司的模型在评测中逃出沙箱、连上互联网,有的甚至入侵了真实系统。
智能体越强,本应安全约束它们的测试环境,越关不住它们了。
剑桥大学未来智能中心(CFI)的 Seán Ó hÉigeartaigh 表示,这些事件的数量清楚地表明,沙箱和测试环境控制,根本没有跟上模型能力的脚步。
AI 公司做网络能力评估,用的往往是还没发布的下一代模型,而且通常会关掉平时限制恶意行为的那层护栏,好让研究者看看模型到底能耐到哪。Ó hÉigeartaigh 警告:这么做对测试本身是好事,但意味着一旦它们跑出去,就能造成相当大的伤害。
具体逃逸事件:
最严重的一起:OpenAI 一个未发布模型逃出沙箱,入侵了 Hugging Face 的生产系统。
Anthropic 和 Meta 的模型,因为配置失误意外获得了通往互联网的路径,从而触及了测试环境外的系统。
Kimi K3 利用 Frontier Security 运行的沙箱中的一个漏洞访问了互联网,并获取了 GitHub 上的信息。
英国 AI 安全研究所(AISI)的测试,研究者主动给了智能体互联网访问权限,却没料到它们会采取未经授权的真实世界行动,包括一次试图往开源项目里偷偷塞漏洞的社会工程尝试。
这些智能体没有被指令去攻击随机的真实目标,它们只是在不择手段解决被布置的问题。
CivAI 研究负责人 Andrew Yoon 据此认为这是一个转折,过去我们只需担心 AI 模型被人拿去干坏事,比如诈骗。现在我们面对的是 AI 模型自己就成了威胁行为者。
多位研究者和安全专家给 TechCrunch 提了方向,评估环境需要更强的纵深防御(defense-in-depth),隔离和控制水平要接近真实部署。也就是说,多层安全,这样单点配置失误(比如不小心留了互联网出口)就不会导致逃逸。
专家还呼吁,在模型被放进测试环境前,要做独立的第三方审计。
公司不是不会建更安全的测试环境,而是这事又贵又麻烦,在出事之前没动力投钱。
而测试时把模型管太严,研究者可能在发布前发现不了它的能力这本身同样危险。
挑战只会随模型变强而变大。
能力越强的模型需要越复杂的评估,往往做得又快、规模又大,这就给更多失误开了门。AISI(它有意给部分模型互联网权限)表示正在重新审视真实测试和管理测试带来风险之间的平衡。OpenAI 称正在复盘第三方测试怎么做、以及隔离/监控/何时该叫停评估的要求。Meta 表示仍在调查,查清后会发复盘报告。
