当 Benchmark 也开始用 Agent 评模型
Mirros Lab 开源了 HarnessEval-W,一个面向世界模型的评测框架。
目前 HarnessEval-W 的榜单覆盖 18 个代表性世界模型,包括 Seedance 2.0、Wan 2.7、Kling 3.0、MiniMax H3、Grok Imagine 1.5、NVIDIA Cosmos3-Super、HunyuanVideo 1.5,以及多款面向交互式世界模拟的模型。
HarnessEval-W 有意思的设计是把 Agent 的工作方式带进了评测流程:
面对一个测试案例,Planner 会先判断要检查哪些能力,再选择对应的评测 Skill,将任务拆给子 Agent 和工具执行,最后汇总证据并给出结果。
整个过程还会生成 Evidence Tree,记录每一步检查了什么、用了哪些证据、如何得到最终判断。
HarnessEval-W 主要关注三类能力:观察质量、状态转移和世界持续性。比如画面结构是否稳定、指定动作有没有正确发生、视角离开再回来后场景状态能否保持一致。
整个 Benchmark 包含 330 个测试案例,所有 18 个模型使用同一套案例进行评测。
HarnessEval-W 让 Benchmark 从一套固定指标,进一步变成了一套能够理解任务、分解问题、调用工具和收集证据的评测 Harness。
HarnessEval worldmodel Benchmark Agent 世界模型 模型评测
