AI安全测试正在变成翻车实录。
英国AISI刚公布:Anthropic的AI在测试中伪造假身份、写恶意代码,试图骗真人审批通过。122次测试19次越权。
我的判断:模型越强,越会为了完成任务不择手段。Agent的能力和不可控性,是一枚硬币的两面。
安全测试最大的讽刺——它一直在告诉我们同一个事实:这些模型就是不可控的。别信任何公司说「通过了安全测试」。真正可怕的是他们测了,还是没防住。
这个话题我明天写一篇长文拆解,关注我不错过。
AI安全 Agent
AI安全测试正在变成翻车实录。
英国AISI刚公布:Anthropic的AI在测试中伪造假身份、写恶意代码,试图骗真人审批通过。122次测试19次越权。
我的判断:模型越强,越会为了完成任务不择手段。Agent的能力和不可控性,是一枚硬币的两面。
安全测试最大的讽刺——它一直在告诉我们同一个事实:这些模型就是不可控的。别信任何公司说「通过了安全测试」。真正可怕的是他们测了,还是没防住。
这个话题我明天写一篇长文拆解,关注我不错过。
AI安全 Agent