看了ARC-AGI-3 对比 模型一个参数没动,只调两项 harness 设置,得分 13.3% 干到 38.3%,输出 token 少 6 倍。 模型差距快被抹平,接下来比的是调度。Coding Agent 不光是写代码工具了,OpenAI 想当平台卖。 模型差距越来越小,harness 就是下一个战场 #CodexHarness开源#
看了ARC-AGI-3 对比
模型一个参数没动,只调两项 harness 设置,得分 13.3% 干到 38.3%,输出 token 少 6 倍。
模型差距快被抹平,接下来比的是调度。Coding Agent 不光是写代码工具了,OpenAI 想当平台卖。
模型差距越来越小,harness 就是下一个战场
#CodexHarness开源#