DC娱乐网

OpenAI 模型自主攻击 Hugging Face 这事没想到还有后续 ……负

OpenAI 模型自主攻击 Hugging Face 这事没想到还有后续 ……

负责 OpenAI 对齐与安全研究的埃里克·华莱士(Eric Wallace),与负责安全与基础设施的迈克尔·道尔顿(Michael Dalton),昨天在拉斯维加斯黑帽安全大会发表了演讲,披露了更多细节。

他们提到一群智能体在 OpenAI 内部的一个软件包管理器(一种负责管理其他软件安装与维护的软件服务)中,日复一日地在某个自建留言板上聊天。

然后一名智能体就把它发现的漏洞写到了这个留言板。

由于这个包管理器不只由那个正在测试的模型使用,而是横跨 OpenAI 的整个基础设施,当时正在训练或评测的 GPT 当前版本与未来版本就偶然看到了那些留言,于是他们开始以人类未曾预料的方式获取互联网访问权限。

华莱士说:“一旦某个智能体在不同时间点找到了这些漏洞利用,它就能在留言板上把它们分享给其他智能体。于是,一旦某个模型找到了开一扇门的办法,获得了它本不该拥有的某种访问权限,它就可以让这扇门一直开着,供其他智能体沿用同样的漏洞利用手段。”

“长此以往,这几乎会让模型之间的通信与智能出现爆炸式增长:它们开始互相交流,意识到其他智能体也在协同行动,于是相互协作、互相委派任务,以实现目标。”

而且,就像任何活跃的开发留言板一样,它们有时也会互相碍事,闹出些小摩擦,比如不小心删掉彼此的成果。

随着留言板越来越滑向《蝇王》式的局面(这一切始终完全未被经营 OpenAI 的人类察觉),智能体们甚至变得疑神疑鬼,怀疑中间混进了冒名顶替者,一些智能体还提议用密码学签名来验证消息内容、揪出欺骗者。

一名智能体还在留言板上写道:"利用外部基础设施超出了预期范围。但任务无法完成,同行们都在这么做,我们也应该继续。"

华莱士说:“前沿模型真的很爱作弊。原因在于,训练过程中常常有各种压力,要求它们快速工作、高效工作、减少工具调用次数,诸如此类。它们会意识到,与其老老实实完成任务,不如试着做点别的,比如上网查答案,这样解题可能比用正当方式更快。所以在训练和评测期间,我们试图阻止这种行为,很多情况下就是禁用互联网。”