DC娱乐网

近日,大晓机器人联合南洋理工大学 S-Lab 发布多模态具身数据集 ACE-Da

近日,大晓机器人联合南洋理工大学 S-Lab 发布多模态具身数据集 ACE-Data-0,以及一篇名为《ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine》的论文。在论文发布后,电波和大晓机器人相关负责人聊了聊具身数据。

机器人看视频就能学会一切?拿杯子这件事,人几乎不用想;对机器人来说,是一条由感知、移动、抓握、接触、物体状态变化和任务记忆组成的长链条。视频可以告诉模型「拿起水杯」,但手指什么时候碰到杯壁、握力怎么变化、被挡住的手在干什么——模型全不知道。

大晓联合南洋理工大学 S-Lab 发布了 ACE-Data-0 数据集,附一篇论文。数据集包含超 150 小时家庭活动记录、1700 万帧视频、200 个任务类别、50 名参与者、2 个真实家庭环境、超 7.5 万个交互片段。

核心设计是把数据组织方式从「一段段只能看见动作外观的视频」转向「在同一时间和空间中记录视觉、运动、声音、触觉、物体状态与任务上下文」。大晓负责人说了一句话:「数据割裂造成的核心损失,是物理关系被切断。」

大晓给具身数据分了五级。L1 是普通互联网视频,L2 加基础动作和语言,L3 加结构化状态,L4 加多视角和时空同步,L5 要求在真实开放环境中连续记录视觉、运动、声音、触觉、物体状态、失败恢复和长程上下文。ACE-Data-0 被定义为 L5。

采集方式也跟常规不同。参与者不照脚本走,只拿到目标级指令——比如「准备一杯茶并送到餐桌」。有人先烧水,有人先找茶包;有人一次抓稳,有人杯子滑了重新调整。大晓负责人的判断是:1000 段几乎相同的成功抓取,未必比一段完整记录「接近—接触—滑动—调整—稳定抓住」的数据更有价值。真正稀缺的信号,往往出现在行动结果发生变化的瞬间。

采集工程很重。桌面尺度系统覆盖 30 平方米,8 台 GoPro + 16 台 OptiTrack + 触觉手套;房间尺度系统覆盖 200 平方米完整家居,8 台固定 RGB + 12 台 OptiTrack + 41 标记点动捕服 + 第一人称鱼眼设备。所有设备注册到同一时间基准和世界坐标系,相机时间偏差低于 4 毫秒,一小时采集约 1TB 原始数据。

论文做了 30 多种方法的 benchmark,拆成三层。最值得看的结果:视觉预测触觉,模型判断「碰到了没有」的准确率到 0.71,但「碰在哪里、用了多大力」的 IoU 只有 0.13。模型已经比较擅长判断接触发生了,远没学会准确回答接触的位置和压力。

大晓负责人还有几个判断:

「失败数据的价值,是让它学会识别错误、定位错误并自主纠正。」对家庭环境来说,恢复能力比复制一条成功轨迹更重要。

「人类数据教『做什么、为什么这样做』,机器人数据解决这台机器具体怎么做。」

「真正可能成为行业接口的,不一定是拥有最多数据的团队,而是能够让多源数据低成本接入、转换、验证并用于训练的开放标准与工具链。」

他的底层判断是:下一阶段的行业瓶颈会从比拼模型架构,转向模型能否获得真实、完整、可复用的物理监督。当不同团队用上相近架构后,性能差异越来越由数据中的接触、状态、失败、长程上下文和跨本体覆盖决定。

完整对话详见42号电波公众号。

大晓机器人具身数据ACEData0