
LLM-as-a-Verifier 研究了一个很有意思的问题:与其只让 Agent 生成一次答案,不如并行生成多个执行轨迹,再让 LLM 对这些轨迹做重复、多维度验证并选出最优结果。实验显示,即使用同一个模型“自己执行、自己验证”也能显著提升成功率——DeepSeek V4 Flash 在 Terminal-Bench 2.1 的 Best-of-5 中从
LLM-as-a-Verifier 研究了一个很有意思的问题:与其只让 Agent 生成一次答案,不如并行生成多个执行轨迹,再让 LLM 对这些轨迹做重复、多维度验证并选出最优结果。实验显示,即使用同一个模型“自己执行、自己验证”也能显著提升成功率——DeepSeek V4 Flash 在 Terminal-Bench 2.1 的 Best-of-5 中从 78.7% 提升到 88.0%,超过了 Fable 5。