FetchMan:让人形机器人从仿真中学会“走过去并拿起来”
arXiv:2608.17027v1
FetchMan 提出了一套完全依靠仿真经验训练视觉人形机器人的方案,让 Unitree G1 能在陌生场景中自主走向目标并完成抓取,无需真实世界数据或现场调参。论文发现,扩大合成示范只能让行为克隆达到固定上限,而使用单一稀疏成功奖励进行 Flow-GRPO 强化学习,可以有效改善行走与抓取之间的衔接。
系统输入头部鱼眼相机和腕部相机的 RGB 图像、机器人本体状态;多物体版本还会输入目标名称。冻结的 DINOv3 ViT-B/16 提取视觉特征,MLP 编码本体状态,Flow Matching DiT 生成 15 维动作序列,再由 SONIC 下肢控制器和关节 PD 控制器执行,最终输出包括底盘速度与高度、腰部和右臂关节目标以及夹爪开合指令。
团队在约 15 万个场景中生成了 15 万条碗抓取示范,约合 650 小时机器人经验;行为克隆使用 5 千条数据时的仿真移动抓取成功率为 40%,增加到 5 万条后升至 67%,但扩大到 15 万条仍停留在 67%。Flow-GRPO 将该指标提高到 83%,并把真实 Unitree G1 的零样本移动抓取成功率从 56.7% 提高到 73.3%;多物体模型使用 35 万条示范后,则从 40% 提高到 62%。
这项工作说明,具身智能的数据规模不能单独解决示范中的隐藏阶段与分布偏移问题,较成熟的模仿学习先验、可扩展的仿真探索和简洁的任务奖励需要协同工作;它也表明,分层控制能够降低全身学习难度,但会限制机器人调整步态、支撑重物和恢复平衡的能力。
具身智能 科研 分享 论文



