DC娱乐网

10万小时真实数据预训练!小米正式发布具身智能基底模型

7 月 16 日,小米正式端出了一道"硬菜"——面向真实移动操作任务的具身智能基底模型 Xiaomi-R

7 月 16 日,小米正式端出了一道"硬菜"——面向真实移动操作任务的具身智能基底模型 Xiaomi-Robotics-1。

这不是又一个实验室里的机械臂演示视频。小米想讲的,是一条更大的故事线:物理世界的 AI,也能走"规模法则(Scaling Law)"那条路。

先看预训练阶段最硬的一组数据。

小米用了 UMI(Universal Manipulation Interface)设备采集的 10 万小时真实世界轨迹,覆盖家庭、商业、工业等多类场景。然后,用一套高效的视觉语言模型,在两周内把这批数据"全自动标注"完毕。

两周。10 万小时。

这个标注效率本身就是个信号——过去卡住机器人学习的,从来不是算法,是数据。谁先把真实世界的数据流水线跑通,谁就摸到了具身智能的门槛。

"Scaling Law"这个叙事,值得放大,也值得警惕

有意思的是小米这次主动把"Scaling Law"摆到了台面上。

他们提供了 2B、5B、10B 三种尺寸的模型。实验表明,随着训练数据量和模型尺寸往上走,动作预测精度和未见场景任务成功率都呈现出"清晰的规模化增长趋势"。

这等于直接把语言模型那套"堆数据、堆参数、性能就涨"的剧本,搬到了机器人身上。

但话说回来,机器人不是聊天框。语言模型的 Scaling Law 已经被反复验证过,物理 AI 的 Scaling Law 还远没到盖棺定论的时候。小米这一步,是在为这个叙事补证据,而不是在宣布胜利。

把镜头切到地球另一端

过去一年,硅谷在"具身智能"上没少烧钱。从 Google 的 RT 系列,到 Physical Intelligence 的 π0,再到一众靠 Demo 视频融资的初创公司——"机器人基础模型"已经是个被讲烂了的词。

中国这边也没闲着。宇树把机器狗卖成了消费电子,智元、傅利叶在通用人形上加速跑。

小米这批"10 万小时真实数据 + 跨本体后训练"的打法,算是把大厂的数据体量和创业公司的速度感揉在了一起——用大厂的体量和耐心,去赌一条可规模化的训练路径。

"开箱即用"?或许是最想打问号的地方

光有预训练不够。后训练阶段,小米用了约 1 万小时跨本体数据,做"本体与指令对齐"。也就是 说让同一个模型能适配不同身体(不同机器人本体),并且听得懂人类的指令。小米给它的评价是"开箱即用"的多类移动操作能力。

"开箱即用"这四个字,或许是最想追问的地方,机器人领域的"开箱即用",和一台手机的"开箱即用"差着十万八千里——真实物理世界的长尾噪声、光照、桌面反光、被推歪的杯子,从来不会写在论文里。

被刷新的 SOTA,先打个折扣

再说那几个刷新纪录的基准:RoboCasa365、RoboDojo,都是公开仿真基准。

在仿真里拿第一,和在工厂、厨房、仓库里真干活,是两件事。我们见过太多"仿真王者、现实青铜"的案例。

所以小米的真正考题,不在榜单,在部署。模型能不能从实验室的干净场景,走到又脏又乱的真实物理世界?这一步,小米还没交卷。