[CV]《GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes》E Bartoli, B He, D Rotondi, S Koch, F Tombari, K O. Arras, P Jensfelt, Y Cai, I Leite [KTH Royal Instituteof Technology & University of Stuttgart] (2026)
在机器人理解动态场景领域,让机器记忆并推理人类活动是一个悬而未决的难题。过去的方法受困于割裂:4D场景图只记录物体时空变化,而活动模型又与物理场景脱钩。本质原因是空间几何的“物”与行为语义的“事”两者缺乏统一的表示框架。
本文的核心洞见是:把机器人记忆从“物体的时空快照”重塑为“人-物活动的层次化叙事”。由此,通过自动提取原子交互(如“拿杯子”),并将其聚合成有目标的事件(如“准备咖啡”),再统一锚定到4D场景图中的持久实体上,这一耦合操作使问题得以解开。
这项工作真正留下的遗产是:一个能自动构建的、融合物理实体与活动叙事的记忆蓝图。它为后来者打开的新门是让机器人超越“看见什么”,开始理解“发生了什么”,实现基于活动历史的回溯性推理。但尚未跨过的门槛是对底层视觉交互识别准确率的高度依赖。
arxiv.org/abs/2608.10886 机器学习 人工智能 论文 AI创造营




