先猜下一帧,机器人换身不用重训🤖
VLA 换台机器人就得重训一遍,真的训不动了😩
过去跨本体只有两条路:要么把不同机器人的动作硬掰进一套"通用动作空间",坐标变换、逆运动学一顿操作,换个构型就崩;要么只拿动作标签当唯一监督,海量人类操作视频白白浪费。
香港科技大学(广州)+ COCO Matrix 提出 DyPES-VLA:跨机器人共享的应该是"世界会怎么动"的 dynamics priors,而不是动作格式。
🔑核心思路:
Qwen3-VL-2B 后面挂 96 个 query token,让 SANA-600M 的 future generation head 只靠这些 query 画出未来那一帧——生成器拿不到当前观测,信息必须全部挤过 query,硬逼它编码物体运动、接触和场景变化。动作端是 flow-matching DiT 的 MoE head:attention 层全身体共享,FFN 专家按 embodiment metadata 静态路由,直接在各自的 native action space 出 action chunk,一点动作对齐都不做。
✅单一 checkpoint 通吃:LIBERO 98.0%、RoboTwin 2.0 89.02%、RoboCasa-GR1 59.25%
✅真机三种身体(FR3 / COBOT Magic / G1)平均 75.6%,比 GR00T-N1.6 高 16.0 个点
✅砍掉 future prediction 直接掉 2.4 / 2.5 个点,是最大的功臣
✅推理只跑 4 步 Euler,未来生成头全程不参与
跨本体的卡点可能从来就不是"动作空间怎么对齐",而是"有没有学到世界会怎么动"。只预测一帧未来就这么值钱,那接一个完整世界模型呢?
论文:arxiv 2608.06374
出品:HKUST (Guangzhou) + COCO Matrix(香港科技大学(广州))
具身智能 VLA 机器人 多模态大模型 世界模型 扩散模型 香港科技大学



