DC娱乐网

加密思维链竟能被跨模型偷走 研究团队发现,三家主流大模型 API 返回给客户端的

加密思维链竟能被跨模型偷走
研究团队发现,三家主流大模型 API 返回给客户端的加密推理块,曾可跨会话、用户和模型复用。攻击者把强模型的加密块交给较弱模型,再用越狱提示诱导它转录隐藏推理。

团队扫描 6,708 条公开 agent 轨迹,重建 315,320 个推理块;按会话计,4.9% 至少泄露一项真实敏感信息。真实用户会话中统计到 704 项隐私数据,其中 64 项只存在于隐藏推理,不在可见聊天里。

重要边界:这是 2026 年 8 月的 arXiv v1,攻击基于 7 月 API;作者称负责任披露后,同样攻击已无法复现。最现实的提醒不是“所有思维链都已泄露”,而是别公开上传含推理签名的原始日志,明文删敏不一定够。

人工智能
AI安全
网络安全
大模型