DC娱乐网

#郭涛观察# 天使投资人、资深人工智能专家郭涛进一步解释,这类落差主要源于仿真环境和真实物理世界存在不可弥合的现实鸿沟。 郭涛进一步分析认为,具身智能当下评测维度纷繁,不同榜单侧重仿真、真机、单项动作或者综合任务,各家牵头机构的测试集、评价标准各不相同,造成榜单含金量参差不齐。在参 ​

郭涛观察 天使投资人、资深人工智能专家郭涛进一步解释,这类落差主要源于仿真环境和真实物理世界存在不可弥合的现实鸿沟。

郭涛进一步分析认为,具身智能当下评测维度纷繁,不同榜单侧重仿真、真机、单项动作或者综合任务,各家牵头机构的测试集、评价标准各不相同,造成榜单含金量参差不齐。在参考价值层面,榜单可以横向对比同一套硬件条件下的算法迭代进度,适合企业做内部技术迭代标尺,但不能直接等同于产业落地能力,部分榜单更多承担品牌传播作用。相较于大语言模型,具身智能受硬件本体约束极强,很难做到完全跨设备统一测试。

郭涛认为,即便是未来,具身也很难复刻大模型那种广泛通用的单一权威榜单,行业更可能分化出两类评测,一类是仿真环境标准化基准,用来迭代算法能力,另一类是基于多品牌真机的产业场景测试集,更加贴近真实业务需求,两套体系并行完成技术评估。

郭涛进一步分析认为,类似RoboChallenge等这类第三方平台及部分学术顶会,虽然已经搭建了标准化真机盲测与竞赛,但大多局限在桌面操作场景,尚不能适配人形整机与工业复杂环境。真机评测硬件投入成本高,不同本体的机械偏差会影响评测公平,同时家庭、工厂等场景任务高度碎片化,很难打造一套通用测试标准。

郭涛预计,未来两到三年将优先落地服务研发的学术真机基准。随着机器人量产成熟逐步落地,行业大概率走向学术基准、产业场景评测两套体系并行的格局。人工智能大模型具身智能