OpenAI 宣布:下一代模型 Astra,可能已经达到了关键网络能力的临界线。
8 月 7 日 OpenAI 发了一篇博客,在过去几天对内部模型 Astra 的最新评测显示,它在 agentic coding 和网络安全能力上都有显著提升。
按照 OpenAI 2023 年 12 月发布的 Preparedness Framework,一个模型达到 Critical 网络安全门槛,需要满足两个条件之一:
要么能在无人干预的情况下识别并利用 hardened real-world critical systems 里各种严重程度的零日漏洞;要么只给一个高层目标,就能设计并执行端到端的全新网络攻击策略。
此前包括 GPT-5.6-Sol 在内的模型,只被评估为 High,没到 Critical。Astra 这次等于是把红线从高级往前推了一步。
OpenAI 现在采取的措施:
更严格的安全控制,隔离测试环境、限制网络和工具访问、加强模型权重保护与加密、增强监控和检测、沙箱执行,暂停不满足新安全标准的 Astra 内部活动。
对所有 Astra 的 agentic 应用(包括训练和评测)实施通用监控,评估模型的 Chain of Thought,一旦发现高风险活动就触发安全响应、人工复核并中断。
与政府机构和选定的 AI 安全组织合作测试,给第三方测试伙伴提供推荐安全控制措施,让高风险评测能安全进行。
OpenAI 表示先进的网络能力模型应该帮助防御者先于攻击者发现和修复漏洞;他们会和政府、安全研究所、民间社会合作,确保 Astra 及后续模型的前沿能力被负责任地部署。
