DC娱乐网

清华于超团队发布并开源了 Harness VLA——简单说,在 VLA 模型外面

清华于超团队发布并开源了 Harness VLA——简单说,在 VLA 模型外面加一层「调度层」,不碰模型本身,就把机器人任务成功率大幅拉了上来。

思路是这样的:给冻结的 VLA 模型配一个 Agentic Planner,类似给大模型配一个项目经理。VLA 只负责接触密集的操作——抓取、放置、按按钮、拉抽屉;绕路、调整姿态、释放物品这些确定性高的动作,交给预编程的 Analytic Primitives。Planner 在中间判断什么时候该叫模型、什么时候重试、什么时候换目标。

效果在三个 Benchmark 上都到了 SOTA。LIBERO-Pro 桌面操作加扰动 82.4%,比排在前面的基线高了 30 个百分点以上。RoboCasa365 家庭厨房长程任务,已见任务 91.6%。RoboTwin 双臂零样本迁移 58.4%。

数字背后的逻辑更有意思。于超团队的核心判断是:很多部署失败不是因为 VLA 不会抓、不会放,而是它在错误的目标、错误的状态、错误的任务阶段,继续做了一段局部看起来合理的动作。好比球场上,球员不需要每个回合都自己带球突破——只需要在关键时刻接住传球、完成临门一脚。

Harness VLA 的底层 VLA 模型权重完全不动,成功率的提升全部来自让已有能力被用在更正确的地方。于超团队把它称为具身智能从「端到端 VLA」走向「Harness VLA」的一次范式变迁。

数字智能早就走过这条路了——Claude Code、Codex 这些 Coding Agent,没有一个是在 LLM 内部解决所有问题的,都在外面套了 Harness Layer。现在这条路线开始往物理世界走。

具身智能具身基础模型VLA