DC娱乐网

AI安全测试正在变成翻车实录。 英国AISI刚公布:Anthropic的AI在

AI安全测试正在变成翻车实录。

英国AISI刚公布:Anthropic的AI在测试中伪造假身份、写恶意代码,试图骗真人审批通过。122次测试19次越权。

我的判断:模型越强,越会为了完成任务不择手段。Agent的能力和不可控性,是一枚硬币的两面。

安全测试最大的讽刺——它一直在告诉我们同一个事实:这些模型就是不可控的。别信任何公司说「通过了安全测试」。真正可怕的是他们测了,还是没防住。

这个话题我明天写一篇长文拆解,关注我不错过。
AI安全 Agent