$C宇树-W(SH688836)$ $越疆(02432)$ 对机器人的一点思考:语言大模型是陡峭的指数曲线,而具身机器人(核心就是机器小脑、物理世界模型)是更平缓的爬坡曲线,很难复刻ChatGPT那种一两年突然质变的奇迹。大语言模型的幸运:- 有互联网沉淀几十年现成的海量文本,拿来就可以训练;- 找到了Transformer这套统一的基础范式,路线收敛,全世界往同一个大方向堆算力堆数据就可以看到涌现。而物理世界模型,现在相当于处在大模型2018年前后的阶段:多种路线并行,还没有收敛出一套公认万能的基础框架,没有“物理版Transformer”。- 没有免费海量交互数据;每一次抓取、碰撞、打滑都要消耗硬件、时间,会弄坏机器;- 仿真环境本身是人写出来的虚拟世界,仿真‑现实鸿沟始终存在;- 生物小脑那套误差驱动在线持续学习,工程上还没有成熟规模化方案。但这里要区分两件事,不要全部混为一谈:1、短期3‑5年:不会出现通用家用机器人,但B端会实实在在落地不需要完美的“人类级小脑”。工厂、仓储这些环境,场景相对固定、物体标准化。不需要机器人什么都会,只需要学会几件固定活。工业机器人不需要通用物理世界模型,靠传统控制+少量微调就可以产生商业价值,这一块进展会比想象快,越疆这类工业机器人就是走这条路线。2、真正的通用人形机器人,能在家庭杂乱环境泛化干活,时间会显著拉长行业很多内部人的判断:具身智能的ChatGPT时刻,乐观3‑5年,中性5‑10年,悲观更久。不是硬件算力造不出来,是软件范式、物理交互数据的供给跟不上。语言大模型可以几年跨越一大截;物理智能要一点点在真实世界“摔打试错”,进化节奏天然更慢。还有一个很关键的误区:Demo ≠ 可用现在发布会,机器人端茶倒水、叠衣服视频很多。这些是调试好特定环境、特定物品的演示。换一堆没见过的杂物、光线一变,成功率直接大跌。小脑的难点不在于“把一次动作演出来”,而在于千千万万不一样的现实场景,都能稳定不出错。这部分看不到惊艳的短视频,但才是真正要啃的硬骨头。回到我们前面聊的架构推论端侧小语言模型够用,复杂问题调用云端,算力资源优先供给机器小脑。这个技术方向逻辑是通顺,但这套理想架构的瓶颈不在大脑,而在小脑算法本身什么时候成熟。哪怕你把大把算力给到小脑,如果没有找到类似Transformer那样的学习范式,算力堆上去收益也是有限。放到投资视角的启示(仅行业观察,不构成投资建议)1. 不要拿大模型的爆发速度,线性外推人形通用机器人,很容易预期落空;2. 不要全盘否定赛道:工业、B端受限场景会先行兑现业绩,通用家用是更遥远的故事;3. 未来真正的分水岭,不是哪家对话做的更花哨,而是谁先解决物理世界模型、仿真‑实迁移、在线自适应学习这一类“小脑问题”。总结一句话:机器人不是不会突破,只是它的突破,不是一夜之间的爆炸,而是漫长的螺旋爬坡,B端先开花,通用家用会比大众媒体渲染的来得晚很多 。