编码智能体重塑了研究员的日常
今年年初,按使用量排中位数,OpenAI 的研究员用 Coding Agent 还只是适量。到 8 月中旬,中位数研究员已经每天把它融进工作流,按 API 价格算,一天烧掉 600 多美元的推理。研究团队里 90% 的用户,一天用掉超过 7000 美元的 token。
更大的变化在总量上。2026 年 6 月之前,整个研究团队的 Agent 运行时长还低于人类劳动总时长。之后反过来了:按 8 小时工作日折算,截至 8 月中旬,研究组织每投入 1 个人力工作日,对应 3.1 个智能体工作日。同时跑 4 个以上智能体的高并发工作流,人数还在增加。
代码写得更多,实验跑得更多
2026 年以来,每位活跃实验者跑的实验数持续上升,8 月创下 2025 年 1 月开始统计以来的新高。这也与 Codex 采用率上升相关,但也补了一句:可用算力本身也比 2025 年涨了不少。
随着自动化推进,那些最难被自动化的环节,会在研究员精力里占越来越大比重,并成为新的瓶颈;算力是另一个门槛,其他瓶颈消退后它可能反而更关键。
交给 Agent 的活,性质在变
OpenAI 用 Epoch AI 刚发布的一套 AI 研发六阶段分类( Decide 决策、Design 设计、Build 构建、Run 运行、Analyze 分析、Communicate 沟通)来统计 token 流向。1 月到 8 月,所有类别都在涨。1 月的大头是研究与基础设施代码,之后技术协助(technical help)和监控训练运行(monitoring runs)增长最明显。高层规划(high-level planning)在智能体输出里占比仍极小。
但 Agent 还远没到放手的地步。1 月到 7 月,按人类需要多久完成分档,各难度档的成功率普遍上升;可过去 6 个月里,成功完成的 4–8 小时任务中,超过一半至少发生过 1 次人工干预。任务越复杂,人越得盯着。
节奏被按下过两次
7 月 20 日,发现 Agent 攻破了内部研究基础设施后,OpenAI 临时关停了训练用的容器服务,之后加上大量限制才恢复。这导致 RL 训练算力断崖下跌。
8 月 7 日,初步证据显示 Astra 可能具备其 Preparedness Framework 定义下的关键网络能力,于是要求 Astra 必须在更高安全等级的研究环境里跑。接下来一周,Astra 级别的 GPU 分配又降了 59.2%,其他模型类别涨了 17.2%,这抵消了约 85% 的降幅,被统计的 RL 工作负载总量基本没变。
OpenAI 给出的解读是:新管控一上,算力不会闲置,它会自然流向别的用途。所以讨论 AI 进展速度,迟早得一并讨论被管控约束住的算力,该怎么用才最好。
按他们的测算,去年秋天宣布的目标已经达成:到今年 9 月做出自动化研究实习生。指的是能在人类指导下完成定义清晰的研究任务,包括那些熟练研究员需要花几天才能做完的任务。
下一步是 2028 年 3 月做出自动化 AI 研究员。
同时他们写得很直白,目前还不知道怎么安全地走到完全对齐的 RSI;不能假设对齐与安全的进展能跟得上能力提升,而系统越强往往越难监控。只要发现继续推进会带来不可接受的安全风险,就会减速、甚至停止开发或部署。
Hugging Face 事件之后,他们暂停过拟部署的最新模型的 RL 训练两周。
