DC娱乐网

清华许华哲团队 RL-100 登上 Science Robotics!近日,清华

清华许华哲团队 RL-100 登上 Science Robotics!

近日,清华许华哲团队在 Science Robotics 上发表了一篇论文。他们做了一套叫 RL-100 的框架,让机器人先看人类演示学会基本操作,然后在真实世界里通过强化学习继续自我提升。

结果很直接:八项测试任务全部 100% 成功。毛巾折叠连续 250 次无失败。保龄球 25 投全中,人类专家最高 14 次。纸盒折叠比纯模仿学习快了 57%。

数据效率更让人停下来想。每个任务平均只需要 126 段人类演示——不到两小时的采集量。训练总时长里,人工数据只占 14%,剩下 86% 是机器人自己练出来的。

RL-100 的思路分三步。第一步模仿学习,用人类遥操把动作锚定成一个安全、类人的初始策略。第二步迭代式离线 RL,机器人在自己积累的经验数据上不断迭代,这是性能提升的主力阶段。第三步少量在线真机交互做最后一公里微调,消除残余失败。

框架里还有一个部署层面的改进:通过一致性模型蒸馏,把每次推理从约 100 毫秒压缩到 10 毫秒——速度提了 10 倍,任务性能不掉。

团队在北京一家商场做了 7 小时连续榨橙汁测试,零故障。不是实验室测完收工,是真的让普通顾客在机器人面前排队。

论文的同行评议给了一句很到位的总结:模仿不是机器人学习的终点,而是起点。RL-100 把这句话变成了实验数据。

通讯作者许华哲是清华叉院的长聘助理教授,2023 年联合创办了星海图,今年离开后又创办了破壳机器人——做家庭通用服务机器人,天使轮数千万美元。

八项任务目前仍是实验室标准场景,故障恢复也还需要人工介入。RL-100 揭示的方向是清晰的:过去行业默认机器人的操作能力上限就是人类演示的水平,现在有实验证据表明,这个上限是可以被打破的。

清华团队具身智能机器人学习