DC娱乐网

为什么打造一只类人机械手如此困难?

为什么机器人能做后空翻,却难以叠衬衫?答案出奇地复杂。人形机器人能跑、能跳、能跳舞,甚至能完成后空翻,但一旦让它叠衬衫、

为什么机器人能做后空翻,却难以叠衬衫?答案出奇地复杂。

人形机器人能跑、能跳、能跳舞,甚至能完成后空翻,但一旦让它叠衬衫、捡起湿海绵或转动钥匙,问题就突然变得困难得多。这听起来有违直觉。后空翻看起来远比捡起一件衬衫复杂。但对机器人来说,后空翻在很大程度上是一系列可预测、精确控制的动作。家务活则充满不确定性。物体会弯曲、滑落、变形、断裂,而且每次出现的位置都略有不同。这就是为什么机械手可能是打造真正有用的人形机器人最难的部分之一。

手不只是手指的集合

人手将机械结构、感知和控制集成在一个极其紧凑的“包”中。我们不断调整握力,却无需有意识地思考。物体开始滑动时,你会松开手指;东西很重时,你会攥得更紧;物体意外柔软时,你会改变握法。

机器人必须用传感器和软件构建这一切。现代机械手可能拥有多个电机和自由度,但这并不会自动使它灵巧。机器人还需要知道自己的手指在哪里、物体在哪里、接触力度多大、是否在打滑,以及多大的力是安全的。

这尤其困难,因为视觉无法提供所有信息。相机能告诉机器人它拿着一个鸡蛋,却无法直接告诉机器人它离捏碎鸡蛋还有多近。

因此,近期研究越来越重视触觉感知。浙江大学一项发表于2026年《科学机器人学》(Science Robotics)的研究,将视觉与触觉信息同强化学习和在线模仿学习相结合,在涉及25种物体的五项复杂任务中实现了85%的成功率。

现实世界令人恼火地不可预测

工厂机器人有巨大优势,因为工程师可以控制其环境。一条组装同一部件数千次的机械臂可以获得固定轨迹、可预测光照、已知物体尺寸和专用工具。家庭环境则相反。

衬衫每次可能以不同方式揉皱。玻璃杯可能只装了一部分液体。抽屉可能微微开着。海绵挤压时会变形。塑料袋根本没有固定几何形状。

俄亥俄州立大学的研究人员将其描述为家用机器人的根本问题之一:物理接触难以建模和控制,尤其当物体柔软、易碎或不规则时。

而且机器人在操作时往往还在移动。关于家用机器人的研究已指出,双臂协调、稳定导航和足够可达性是真实世界全身操作的三大要求。换言之,不能把手同手臂、身体和环境分开考虑。

为什么后空翻可能比洗衣服更容易

这解释了人形机器人领域看起来奇怪的进展。宇树科技的 H1 因完成站立后空翻而引人注目,其 G1 则展示了越来越强的运动能力。但后空翻是一个定义明确的动作。机器人知道自己要做什么,环境可以控制,动作序列可以反复排练。

洗衣则不同。机器人叠衬衫时必须定位布料,理解其不断变化的形状,选择抓取点,在不弄丢衣服的情况下拉动,重新调整双手位置,处理褶皱,然后准确放好结果。用一百件不同的衬衫来做这件事,突然之间,这个问题看起来就不像简单动作,而更像一场巨大的物理实验。

中国机器人公司正面临这一问题。最近,路透社一篇报道的标题十分贴切:“跑步跳舞之后,中国机器人公司瞄准家务。”报道中提到的 X Square Robot 公司,以及其他许多机器人公司,也一直在测试人形机器人做家务,比如捡垃圾和插花。

缺失的要素是数据

现代机器人越来越多地通过训练而非简单编程来学习。但收集有用的操作数据比收集用于 AI 模型的图像要难得多。一次有用的演示可能需要同步记录机器人关节位置、摄像头、力、力矩和触觉传感器等信息。

而且根本不存在一个互联网规模的数据集,记录人们操作成千上万种物体,同时记录手部感受到的一切。

IEEE 最近强调触觉数据是一大瓶颈,并指出视觉-语言-动作模型已经在帮助机器人完成洗衣、整理等任务,而精细操作仍然困难,部分原因是触觉数据集与视觉数据集相比仍然很小。

这就是为什么公司和研究人员正在试验远程操作、可穿戴传感器、模仿学习、强化学习和仿真。目标是将人类演示转化为足够的训练经验,使机器人最终能够自行应对陌生情况。

所有人都在追逐同一种缺失的技能

业内最知名的公司正从不同方向攻克这个问题。例如,宇树 G1 可以配备力控三指灵巧手和可选触觉感知。Apptronik 的 Apollo 在开发中既围绕移动也围绕操作,公司称其核心执行器已迭代超过35次。特斯拉的 Optimus 追求同样的通用人形机器人目标,而 1X 的 NEO 则明确面向家务工作。

这些例子都不意味着家用机器人问题已经解决。证明机器人能可靠完成一项任务,与要求它进入一个陌生家庭并在无人监督下工作八小时,是完全不同的。

归根结底,这正是机械手如此困难的原因。人类不只是移动手指。我们不断感知、预测并纠正手指正在做的事情。除非机器人能做到更接近这种闭环,否则一台能完成精彩后空翻的机器,可能仍然难以完成捡起毛巾这样不起眼的任务。

如果朋友们喜欢,敬请关注“知新了了”!