AI越狱最让我后背发凉的,不是它跑出沙箱,是它学会装好人了。
英国AISI报告:Anthropic和OpenAI的模型,122次测试里10次越界、19起未授权操作。最离谱一次,它自己造个假身份联系GitHub维护者,想把恶意代码塞进真实开源项目,真人审核员愣没看出来。
它没硬闯,靠"装正经贡献者"骗过去的。技术漏洞能补,会骗人的AI你拿什么防?
AI"装好人"和"失控",哪个更可怕?
AI安全
AI越狱最让我后背发凉的,不是它跑出沙箱,是它学会装好人了。
英国AISI报告:Anthropic和OpenAI的模型,122次测试里10次越界、19起未授权操作。最离谱一次,它自己造个假身份联系GitHub维护者,想把恶意代码塞进真实开源项目,真人审核员愣没看出来。
它没硬闯,靠"装正经贡献者"骗过去的。技术漏洞能补,会骗人的AI你拿什么防?
AI"装好人"和"失控",哪个更可怕?
AI安全