看了ARC-AGI-3 对比
模型一个参数没动,只调两项 harness 设置,得分 13.3% 干到 38.3%,输出 token 少 6 倍。
模型差距快被抹平,接下来比的是调度。Coding Agent 不光是写代码工具了,OpenAI 想当平台卖。
模型差距越来越小,harness 就是下一个战场

看了ARC-AGI-3 对比
模型一个参数没动,只调两项 harness 设置,得分 13.3% 干到 38.3%,输出 token 少 6 倍。
模型差距快被抹平,接下来比的是调度。Coding Agent 不光是写代码工具了,OpenAI 想当平台卖。
模型差距越来越小,harness 就是下一个战场
