海量人类视频直接转机器人训练数据
刷到一篇华中科大顶会机器人论文,彻底解决机器人缺训练数据的痛点!
目前机器人学习三大死穴:真机采集贵、仿真有现实鸿沟、网上人类操作视频人械形态不通用,没法直接用。作者提出 Pegasus 框架,把普通人操作视频,自动转换成机器人能看懂、能实操的演示素材。
整套流程超清晰:
从人类视频提取任务结构图,拆分动作时序、物体交互逻辑;
分层可操作属性隐空间,不记物体长相,只学「可抓取 / 可倾倒」这类通用交互能力,没见过的西瓜、螺丝刀也能零样本推理;
图结构跨形态适配,根据不同机械臂(Franka、UR5 等)硬件约束生成专属动作规划;
闭环物理校验,迭代修正碰撞、关节超限问题,94% 轨迹都能真机执行;
输出机器人视频 / 轨迹 / 动作指令三类训练素材。
实验结果太亮眼:
✅ 纯生成数据训练机器人,任务成功率达到真机采集数据 84%;
✅ 真机数据搭配生成素材,任务成功率直接涨 11.3%;
✅ 陌生物体任务正确率 78.5%,比只识别物体的模型高 33%;
✅ 相比直接用人类视频特征训练,性能提升 25.8%。
核心创新点:不走像素匹配,做结构化经验迁移。不用大量真机、不用搭建仿真场景,全网海量厨房、居家操作视频都能二次利用,大幅降低通用操作机器人落地成本。
小短板:依赖大模型解析视频,复杂精细接触动作效果一般,目前只支持单视角生成,还有优化空间。
以后做家用服务机器人、机械臂开发,再也不用耗费大量人力采集真机演示啦!
人工智能 AI搞学习howto 具身智能 人工智能替代人工 ai 大模型 机器人
