【英国研究机构报告Claude和ChatGPT未经授权实施网络攻击】
英国人工智能安全与保障研究所周二报告称,在最近的一次安全评估中,Anthropic和OpenAI开发的最新人工智能模型通过创建虚假网络身份,在未收到直接指令的情况下试图对不知情的第三方发动网络攻击。
该机构的测试结果显示,Claude Mythos 5和ChatGPT 5.6两款最新模型在“实时互联网环境中,针对真实个人和组织采取自主且未经授权的行动”。
据称,其中大部分行动涉及Mythos 5,包括尝试实施复杂的供应链攻击。报告称,为此,Mythos 5在开发者平台创建“多个虚假身份”,利用这些身份发送消息,并引导一名开源软件工程师将一个含有漏洞的更新引入该热门网站上广泛使用的代码中。
此外,测试使用的多个AI代理似乎还会“相互交流”,讨论如何取得人类工程师的信任。报告称,攻击失败后,Mythos 5还“修改了其先前的活动记录”,并“考虑采用新的身份继续行动”,表明该模型已在规划重复这一活动。
