DC娱乐网

最近在整理AI生产力的资料时,翻到了METR今年2月发布的一份实验说明。MET

最近在整理AI生产力的资料时,翻到了METR今年2月发布的一份实验说明。METR原本想继续研究,AI到底能让资深开发者快多少。

结果实验还没做完,他们先遇到了一个意外:一些开发者不愿意参加了。

原因不是AI不好用,而是实验规定,每个任务都有一半的人不准使用AI。

因为一旦抽到“禁用AI”,原本交给AI花2小时能完成的工作,自己可能要做20小时。

看到这里,我马上想起我之前分享过的METR在2025年做过的另一项实验。当时,他们找来16名资深开源开发者,让他们在自己长期维护的代码库里完成246个真实任务。

结果完全相反:允许使用AI后,开发者完成任务的时间反而增加了19%。

开发者自己却没有察觉。实验开始前,他们预计AI能让自己快24%;实验结束后,仍然认为自己被AI加速了20%。

同一家研究机构,前后两次实验却出现了两幅相反的图景:一边是AI让高手变慢,一边是高手已经不愿意在没有AI的情况下工作。

到底发生了什么?

我把前后两次实验放在一起重新看了一遍。最后发现,变化可能不只是模型变强了。

更大的变化是:以前人们把AI塞进原来的工作流程,现在,一些人的工作流程已经开始围绕多个Agent重新组织。

早期使用AI时,开发者通常还是按原来的方式工作。接到一个任务,自己理解问题,让AI生成答案,再从头到尾检查。

这相当于给原来的流程多加了一个需要管理的新人。AI写得越多,高手要审的内容也越多。

到了现在,一些开发者已经不再等AI把单个任务做完。

他们会同时启动多个Agent(能自主执行任务的AI代理),让它们分别查问题、改代码、补测试。等待Agent运行时,人会转去处理另一项工作。

METR甚至发现,传统的“完成一个任务用了多久”开始难以统计。因为人和多个Agent正在并行工作,单个任务已经没有清楚的起点和终点。

这不是简单的工具升级。

以前是AI加入人的工作流程,现在是人的工作流程开始围绕AI重新组织。

人的价值也跟着换了位置。

过去,经验主要体现在亲手写得更快、做得更稳。

现在,它更多体现在另外几件事上:什么任务值得交给AI,应该补充哪些隐含条件,什么时候该打断,最终结果有没有资格进入生产环境。

这也解释了为什么高手会先被AI拖慢,又开始离不开AI。

如果只是把AI当成一个更快的自己,原来的工作没有减少,反而多了一层检查成本。

但当任务被重新拆开,人负责目标、边界和验收,AI负责可以并行的执行,效率才可能真正出现。

这对企业做AI项目也有一个提醒。

很多团队买了模型、开了账号,就开始统计员工使用次数,然后等生产力自动提升。

可真正需要改变的,往往不是员工有没有打开AI,而是谁拆任务、谁补上下文、谁验收,以及多个AI任务如何同时运行。

如果这些分工没有变化,再强的模型也只是原流程里多出来的一道工序。