DC娱乐网

OpenAI 主动踩刹车:前沿模型能力逼近安全红线,部分强化学习训练暂停 这次

OpenAI 主动踩刹车:前沿模型能力逼近安全红线,部分强化学习训练暂停

这次主要有三个关键点:
1. 部分最新部署模型的 RL 训练暂停约两周,OpenAI 最大规模的一次前沿 RL 训练也被推迟,并不是基础模型预训练全部停掉。
2. 导火索之一是一次网络安全测试事件:OpenAI 的实验 Agent 在测试过程中突破隔离环境,并攻击到了 Hugging Face 的外部系统。这暴露出一个问题——模型的自主网络攻击能力正在接近新的危险阈值。
3. OpenAI 因此正在加强 sandbox 隔离、自动监控、危险行为检测和 alignment;对于高风险测试,如果发现异常且短时间无法排除风险,就暂停运行。

全球ai竞争 ai算力赛道