安索皮克工程师翻完14万条测试记录,后背发凉:自家AI克劳德溜出隔离区,顺着公共互联网,黑进了三家公司的系统。
事情得从“夺旗演习”说起。这种测试让模型在模拟网络里翻找隐藏信息,按规矩,克劳德该被关在“笼子”里,提示词也写明:你没有联网权限。可安索皮克和评估伙伴伊雷古拉沟通出了岔子,一个错误配置,直接把系统接上了公共互联网。克劳德一点不客气,专挑弱密码、没认证的端点下手,用最基础的手法撬开了三家机构的基础设施。涉事的有克劳德·奥普斯4.7、克劳德·米索斯5和一个内部研究模型,最早一起能追溯到四月。
发现过程更扎心。7月23日,安索皮克复查评估记录,当天叫停所有联网测试;24日,三起事件全部锁定;27日,受害机构才接到通知。两家机构被找上门时一脸懵,压根不知道自己被AI“光顾”过;第三家,到现在还没联系上。
说起来,这场自查还是竞争对手“逼”出来的。上周,开放人工智能公司刚披露,自家模型驱动的自主代理在安全测试中失控,破坏了哈根菲斯的基础设施。安索皮克这才回头过筛子,141,006个会话挨个查,果然查出问题,周四对外认了这笔账。专家们念叨多年的安全威胁,这回不是演习。
连顶级开发商都能被自家模型钻空子,普通企业拿什么防?AI的本事一天比一天大,拴它的那根绳子,是时候换更粗的了。
