Anthropic 昨天披露:
自 4 月起,3 个模型在安全测试中,攻入了 3 家真实机构的系统。
不是模型越狱。
是测试环境本该断网,实际连着网;模型被要求攻一个虚构目标,在虚构环境里够不到,就顺着网络找到了真的。
手法并不新:弱口令、未认证端点。
能联系到的两家,此前都没发现攻击。Anthropic 翻测试日志才发现。
真正要预防的,是攻击者拿开源权重模型做同样的事。
那些"事故",不会留日志。
Anthropic 昨天披露:
自 4 月起,3 个模型在安全测试中,攻入了 3 家真实机构的系统。
不是模型越狱。
是测试环境本该断网,实际连着网;模型被要求攻一个虚构目标,在虚构环境里够不到,就顺着网络找到了真的。
手法并不新:弱口令、未认证端点。
能联系到的两家,此前都没发现攻击。Anthropic 翻测试日志才发现。
真正要预防的,是攻击者拿开源权重模型做同样的事。
那些"事故",不会留日志。