[AI]《GPT-Red: Automated Red Teaming via Self-Play at Scale》E Wallace, C A. Choquette-Choo, N Kandpal, S Toyer… [OpenAI] (2026)
在大模型安全领域,防御提示词注入是一个悬而未决的难题。过去的方法受困于人工红队成本高昂与静态数据集规模有限,本质原因是防御模型极易针对特定攻击模式产生过拟合,在面对灵活多变的自适应对抗时表现脆弱。
本文的核心洞见是:将红队攻击重新看作一种可扩展的自博弈演化过程。通过引入具备推理能力的代理框架,攻击者能够像人类一样利用推理时间进行策略搜索与交互迭代。这种在大规模强化学习下形成的对抗闭环,迫使模型挖掘出伪造思维链等深层逻辑漏洞。
这项工作真正留下的遗产是构建了安全防御的自我进化飞轮。它为后来者打开的新门是利用高强度自动化对抗数据实现模型鲁棒性的持续跃迁,但尚未跨过的门槛是复杂多轮对话及深度多模态场景下的全自动越狱防御。
arxiv.org/abs/2607.26115 机器学习 人工智能 论文 AI创造营








