逛完今年 WAIC,老狐有一个很直观的感受:
端侧 AI 不再是某个展台的噱头,而是整个展馆的暗线,手机、汽车、机器人等等终端设备,都在试图把模型塞进设备里,让 AI 在真实世界里干活。
且跟着老狐云逛展感受一下:

而在端侧 AI 这条赛道上,H1 馆的面壁智能,是我印象最深的一家。这家公司你可能不太熟悉,但你的手机和汽车,也许就有他们的模型。
作为第一家布局、第一家落地端侧赛道的大模型公司,今年已经是面壁智能第三次亮相 WAIC。而就在 WAIC 开幕前夕,公司完成新一轮融资,估值超 200 亿元,成为端侧 AI 领域公开估值最大的独角兽。
这届 WAIC,面壁智能的展台摆上几样东西:三星手机、乐聚机器人、一苇宇航卫星、SuperMate 智能座舱。这些产品看似没有关联,但它们共享同一个逻辑:AI 装进设备本体后,可以不完全依赖云端,而是有一个不联网也能干活的“端侧大脑”。

这也是面壁智能正在做的事:用端侧智能驱动 AI 从数字世界走向真实世界,并且让 AI 在断网的时候也能独立思考、独立判断、独立干活。
这件事放在几年前几乎不可想象。2024 年大家还在卷模型参数,2025 年行业开始谈论端侧的可能性。到了 2026 年,面壁智能直接告诉你:不用讨论了,我们已经做到了。

不卷云端,卷终端
在 WAIC 期间举办的端侧 AI 创新论坛上,面壁智能正式发布了首个具身智能成果:MiniCPM-Robot 系列。这个系列包含两个模型:通用 VLA 模型 MiniCPM-RobotManip,以及跟踪导航模型 MiniCPM-RobotTrack。
搭载了 MiniCPM-RobotTrack 的宇树 Go2 机器狗,可以做到这样一件事:收到“跟随前面的人”这条指令后,它会一路跟在目标身后,从室外走进办公楼,进入电梯,再到地下停车场,全程不跟丢。电梯和地下停车场恰恰是网络信号最差的地方,但它完全不需要联网,全程在机器狗本地跑。

这只狗解决了一个被很多人忽略、但极其致命的问题:机器人一旦脱离网络,还能不能干活?
当前大多数 VLA 模型的做法是,让机器人只根据当前画面做判断。因为如果保留历史画面,计算量会爆炸。一个三路摄像头的机器人,哪怕只记住一分钟的观测,视觉 Token 量级就高达数万甚至十万,根本塞不进模型上下文。
这就引出了大多数 VLA 模型的另一个短板:记忆。传统模型只在当前画面做决策,因为保留历史画面的计算量太大。结果是,让机械臂按按钮五次,它按到第三次就忘了前两次。
MiniCPM-RobotManip 用视觉 Token 压缩技术解决了这个记忆问题。用更少的 Token 承载同样的视觉信息,让模型在保留历史观测的同时,计算量几乎不增加。

另一个 MiniCPM-RobotTrack,负责移动跟踪。它只有 0.9B 参数,原生适配宇树 Go2 Edu 机器狗,只靠机器狗原装摄像头和本地算力,在单目标跟踪、多目标干扰跟踪、模糊指令跟踪三项任务上拿下开源模型最优。更重要的是,它不需要网络,全程本地运行。

这个产品定义,直指行业痛点:很多机器人“Demo 很惊艳、落地很狼狈”,原因就是现场没网,或者网不好。可见端侧能力不是加分项,是入场券。
不过,具身智能只是面壁智能端侧版图上的一块拼图。三星的盖乐世 AI 获批备案,端侧模型能力由面壁智能提供;SuperMate 智能座舱已搭载于长安马自达 EZ-60、吉利银河 M9 等车型;端侧模型还随一苇宇航的卫星上了天,数据在轨处理,只传结果回地面。

把手机、汽车、卫星、机器人这几条线放在一起看,面壁智能其实在做同一件事:让不同形态的终端都拥有一个本地大脑。而这条逻辑线,面壁智能在几年前就已经想好了。

把模型做小,比做大更难?
2023 年下半年,AI 行业的核心叙事是 Scaling Law。模型越大越好,算力越多越好。面壁智能却在这个时间点做了一个反共识的决定:All in 端侧。
当全行业还在卷云端参数规模时,面壁智能发布了第一个端侧模型 MiniCPM,只有 2B 参数,却跑出了当时 GPT-3(175B)的同等效果。他们管这个系列叫“小钢炮”。

支撑这条路线的,是面壁智能联合清华大学提出的“密度定律”:大模型的能力密度约每 3.5 个月翻一番,达到特定智能水平所需的参数量,每 3.5 个月下降一半。
今天需要 200 亿参数才能实现的智能,过几个月可能只需要 100 亿参数。模型的体积在缩小,但能力不降反升。对端侧设备来说,内存是固定的、电池是有限的、芯片性能是有天花板的,这个定律意味着,越来越多的智能可以被塞进越来越小的设备里。

密度定律在 MiniCPM 系列的迭代中被反复验证。面壁智能在 WAIC 期间发布的 MiniCPM5-2B,仅 20 亿参数,在 Artificial Analysis 榜单上拿下 4B 以下模型全球第一。视觉侧的 MiniCPM-V 4.6,仅 1.3B 参数,6GB 内存即可在手机上流畅运行。

这种短小精悍的能力,也延续到了具身智能。前面提到的 MiniCPM-RobotManip 仅 1.5B 参数,在通用 VLA 评测中与 Qwen-VLA、π0.5 等知名模型性能持平。MiniCPM-RobotTrack 仅 0.9B 参数,三项追踪任务全部拿下开源模型最优。
更关键的是,这些模型不是停留在跑分榜上。面壁智能已完成对高通、联发科、英特尔、英伟达、AMD 等主流芯片平台的全面适配。在国产芯片方面,他们参与了华为昇腾、寒武纪等芯片的软件栈构建。BitCPM-CANN 模型系列能在华为昇腾上运行,让同样的模型在同一块内存上只需要过去六分之一的空间。

截至 2026 年 6 月,MiniCPM 系列开源模型在 GitHub、Hugging Face 等平台累计下载量突破 3800 万次。可以说,面壁智能的端侧模型不只是被媒体谈论,而是被真实开发者反复使用、验证、落地。

端侧AI的边界在哪?
随着 MiniCPM-Robot 系列的发布,意味着面壁智能正式进入具身智能赛道。这看上去是在追风口。但如果仔细看技术路线,会发现它又一次站在了主流做法的对面。
当前具身智能的主流路径是:选择一个垂直场景(抓取、拧瓶盖、叠衣服),把单一任务做到极致,再逐个积累技能,试图用做加法的方式逼近通用。
面壁智能走的是另一条路:先打造通用 VLA 大脑,再适配多元场景。 MiniCPM-RobotManip 的训练逻辑是,用一个模型、一套参数,去处理不同物体、不同环境、不同指令,而不是为每个任务单独训一套模型。

这个选择的底气来自两方面:一是多模态底座的积累,二是视觉 Token 的压缩。并且,这两个技术优势最终导向同一个结果:把“让机器人变聪明”的成本打下来。
一台人形机器人今天动辄十几万甚至几十万,成本大头往往不是电机和关节,而是“智能”这件事本身。
目前每个机器人项目交付,本质上都是一个定制化系统集成项目,算法工程师驻场适配环境、针对特定物体标数据、为每个客户单独微调模型,这些成本摊到设备上,价格自然下不来。

面壁智能的思路是,把通用能力做到模型里,把定制门槛降下来。MiniCPM-RobotManip 一个 1.5B 的模型,在多个操作任务上达到第一梯队水平,且全链路开源。中小开发者、高校实验室拿到就能适配自己的本体,部署到自己的场景,不需要从头训练 VLA 模型,大大降低了“智能”的边际成本。
而这,或许是具身智能走向大规模制造的关键转折。

最后瞎说一点趋势判断:面壁智能的边界在哪里?将来会不会自己造芯,或者自己做机器人?老狐觉得,不是没有可能。
面壁智能的核心资产并非模型本身,而是“把模型做小、做快、做便宜、然后塞进各种设备”的能力。

这个能力一旦在终端设备上反复验证,面壁智能就不再只是一家模型公司,而是下一代终端智能标准的标准制定者,有能力定义什么样的芯片能跑懂它的模型,什么样的本体值得装它的大脑。
所以,如果有一天面壁智能自己流片,或者下场做本体,我不会感到意外。因为在端侧 AI 这场竞争里,离硬件越近,护城河越深。
撰稿:ZXS