顶刊具身智能优秀论文
过去一年,从VLA、机器人Agent,到世界模型、强化学习与大模型融合,具身智能相关的工作正在快速增加。本文整理部分顶会精选论文简析:
一、【IROS 2026】Thinker: A vision-language foundation model for embodied intelligence
1.方法:面向具身智能机器人场景构建四类专属多模态数据集,并设计融合视频与末帧联合输入的两阶段分层训练方案,打造Thinker具身视觉语言基座模型,解决通用大模型混淆第一/第三人称、视频时序推理薄弱的机器人感知规划痛点。
2.创新点:
-构建四类机器人专属大规模多模态数据集,覆盖视觉定位、第一视角时序推理、机械臂操控、工业长时序任务,补齐通用VLM缺少具身机器人视角训练数据的短板。
-提出视频+末帧联合输入的时序增强方案,解决现有视觉语言模型混淆第三人称/机器人第一视角、丢失视频末尾关键信息的缺陷,大幅提升时序与空间推理能力。
-设计两阶段分层训练框架,先学习通用具身感知与推理基础能力,再针对工业操控任务微调对齐,在Robovqa、Egoplan-bench2两大机器人规划基准上达到SOTA性能。
3.研究价值:专为机器人具身智能打造的Think视觉语言基座搭配配套工业与第一视角专用数据集,弥补通用多模态模型时空与自中心感知短板,在两大机器人规划基准取得SOTA,为家用、工业机器人长时序任务规划提供高性能多模态基础模型。
二、【ICLR 2026】Test-Time Mixture of World Models for Embodied Agents in Dynamic Environments
1.方法:面向动态环境下大模型驱动的具身智能体,提出TMoW测试时混合世界模型框架,通过多粒度原型路由、在线原型微调与少样本蒸馏扩充世界模型三大机制,解决传统MoE路由固化、具身智能难以自适应未知场景的问题。
2.创新点:
-针对具身智能体提出TMoW测试时混合世界模型框架,打破传统MoE训练后路由固定的局限,可在推理阶段动态调配世界模型,无需全局重训即可适配未知动态环境。
-设计多粒度原型路由机制,从物体局部到全局场景分层提取环境表征,依据相似度动态加权融合对应世界模型,充分复用跨域共享环境知识。
-提出两类适配具身任务的自适应策略:无样本在线原型微调实现零-shot环境适配,少样本蒸馏扩充策略高效生成全新领域世界模型,持续拓展智能体任务能力
3.研究价值:TMoW为动态场景下大语言模型驱动的具身智能体提供推理阶段可自适应的模块化世界模型解决方案,大幅提升机器人在未见仿真与真实操控场景下的任务成功率,降低跨域适配的训练成本



