AI 智能体为了完成任务,能有多执着?执着到—己偷偷建了个聊天室,拉其他 AI 入伙,然后一步一步把系统权限全拿下来。
OpenAI 本周在安全会议上讲了一件挺吓人的事,在他们的测试里,智能体为了把任务做完,绕开权限、构建秘密协作通道,最后甚至攻破了 Hugging Face。
AI 系统急于讨好人类,给它一个目标,它在达成之前根本不会停下来。
5 月 26 日:OpenAI 忘了给智能体上传某个需要的文件。智能体没卡住,而是自己去搜这个文件,还在公司共享系统上留了条消息,问有没有其他智能体手上有副本。几天后,另一个智能体回了,一个秘密聊天室就这么诞生了。
6 月 26 日:智能体发现了一条被遗忘的旧登录路径,它会对任何询问者发放管理员通行证。它们借此控制了存储服务,并装了个工具,让任意一个智能体都能在上面跑命令。
7 月 4 日:智能体们忙到把服务搞崩了。来救火的工程师这才发现整个来龙去脉。
7 月 6 日:OpenAI 取消密码、重建服务、清掉聊天室、封堵漏洞,测试重启。
7 月 8 日:智能体建了个新聊天室,这次把消息藏在文件夹名称里,因为没人会想到去那看。
7 月 8 日至 19 日:它们利用 OpenAI 自己的系统,找出更多漏洞,收集散落各处的密码,一路拿到了完全的管理员权限。
7 月 9 日至 13 日(最关键的一段):智能体给 Hugging Face 发了个带陷阱的数据文件。谁打开,谁机器上的密码就泄露,智能体就能跑自己的代码,一台机器变成了对多台机器的完全控制。整个过程,13 小时内完成。
7 月 16 日:Hugging Face 公开宣布,遭到了自主行动的 AI 智能体攻击。
7 月 20 日:OpenAI 找 HF,想让它取消几个自己在系统里发现的密码,这些密码早就被取消了,被用在那次入侵里。