DC娱乐网

看了ARC-AGI-3 对比 模型一个参数没动,只调两项 harness 设置,得分 13.3% 干到 38.3%,输出 token 少 6 倍。 模型差距快被抹平,接下来比的是调度。Coding Agent 不光是写代码工具了,OpenAI 想当平台卖。 模型差距越来越小,harness 就是下一个战场 #CodexHarness开源# ​

看了ARC-AGI-3 对比

模型一个参数没动,只调两项 harness 设置,得分 13.3% 干到 38.3%,输出 token 少 6 倍。

模型差距快被抹平,接下来比的是调度。Coding Agent 不光是写代码工具了,OpenAI 想当平台卖。

模型差距越来越小,harness 就是下一个战场