DC娱乐网

【代码"屎山"量化器:Opus 5在SlopCodeBench上的翻车现场】编程

【代码"屎山"量化器:Opus 5在SlopCodeBench上的翻车现场】编程模型在单次任务上已近封神,但面对真实世界中"需求不断演进"的长程开发表现如何?最新的SlopCodeBench基准测试揭示了残酷真相:它不一次性给出需求,而是像真实项目一样分阶段增加功能。实测显示,强如Opus 5在这一长程基准下的严格通过率仅为24%。最惊人的发现是,Opus 5生成的函数数量是前代的5倍,虽然单个函数变短了,但代码总量激增,且93%的新增代码触发了"冗余/低效"(Slop)警告。这说明当前模型在缺乏人工干预时,依然无法自主维护代码库的长期健康。底层逻辑在于,现有的RL强化学习主要奖励功能实现,而非代码简洁度。对开发者而言,这意味着"全自动编程"仍是幻觉,AI生成的代码如果缺乏持续重构,会比人类堆出的"屎山"坍塌得更快。 github.com/humanlayer/advanced-context-engineering-for-coding-agents/blob/main/benchmarking-opus-5-on-slop-code-bench.md