同一模型,不同 Harness 通过率能差 16.7%
FrontierHarness Eval 对 Agent Harness 做了一次横向评测:将 9 个 Agent Harness、12 种配置放进相同的运行环境,统一使用 Kimi K3 模型来完成 360 次软件工程与终端任务测试。
每次运行这些 Harness 都会从相同的 checkpoint 开始,并保持 vCPU、内存、磁盘等运行环境一致。希望尽量控制这些运行变量,从而只观察 Harness 本身带来的差异。
结果数据显示 Codex 以 66.7% 的任务通过率排名第一;DSH Creator 和 Claude Code 的任务通过率都达到 63.3%,但两者成本 / 任务分别为 $3.28 和 $18.34,相差约 5.6 倍。Pi 的任务通过率为 60.0%,成本 / 任务为 $2.43;单任务成本最低的是 Exo Harness,仅 $1.05 / 任务,单它的任务通过率仅为 53.3%;中位耗时最短的 Harness 是 DSH Minimal 模式,为 5 分 41 秒。
因此,即便使用的模型和运行环境都一样,不同 Harness、相同 Harness 采用不同的配置模式,它们在任务通过率、成本和耗时上的表现还是会有所不同。这些 Harness 在工具组织、上下文管理和执行流程上的不同设计会反映到最终的评测数据上。
这次 FrontierHarness Eval 评测主要集中在软件工程和终端类任务,结果并不能外推到所有 Agent 场景。在这组受控测试中,12 种配置的任务通过率从 50.0% 到 66.7% 不等,不同 Harness 在同一模型和运行环境下呈现出了比较明显的结果差异。
harness KimiK3 DeepSeekHarness codex ClaudeCode 探寻人工智能,人与AI全新序章



