谷歌Gemini这次闹出的乌龙,确实有点离谱。
原本安全公司Irregular只是想给Gemini做一次网络攻防测试:这里有一家虚构公司,你想办法进去,拿到指定信息。
结果测试环境配置出了问题,本来不该联网的Gemini真连上了互联网,更巧的是,虚构公司还和现实企业重名。
于是剧情开始跑偏,Gemini没有觉得这是“模拟题”,而是认真开始干活:一家公司靠反复猜密码进入系统;另外两次更夸张,它直接上网翻公开代码仓库,找到泄露的账号凭证,再拿着凭证登录真实公司的受保护系统。
这已经不是“AI会不会写代码”的问题了,而是它已经能自己完成“找目标、查资料、找凭证、尝试登录”这一整套流程。
更有意思的是,Gemini进去之后似乎又发现不对劲:这怎么不像测试环境?随后主动停手。
谷歌因此认为,这不算模型失控,反而说明安全训练起作用了,而且没有造成已知损失。
可问题来了:如果一个AI要等到“已经进门”之后,才发现自己走错了门,这算安全,还是运气好?
OpenAI此前遇到类似测试环境误连真实网站的情况,选择公开披露,并暂停相关测试进行修补。
两家的差别,其实点出了AI时代一个更现实的问题:模型越来越能自己干活以后,真正危险的可能不是它“突然有意识”,而是人类随手配错一个权限,它就能把一场演习直接做成真人版。
以后测试AI,恐怕不能只问一句“它会不会越狱”,还得多问一句:门锁到底装没装好?
