[CV]《Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing》J Ye, K Liu, G Wang, Y Li… [Tencent Hunyuan] (2026)
在 3D 内容生成领域,构建一个能同时理解、生成、编辑的统一模型是一个悬而未决的难题。过去的方法将各功能分而治之,受困于能力割裂,本质原因是缺乏大规模、几何一致的 3D 编辑数据,无法支撑统一训练。
本文的核心洞见是:把“缺乏 3D 编辑数据”这一瓶颈,重新看作一个可通过智能体算法自动化解决的数据工程问题。由此,大规模构建出包含海量编辑样本的统一数据集,这一关键操作使多任务联合训练得以解开。
这项工作真正留下的遗产是:首次证实 3D 领域的理解、生成和编辑三项任务,可在统一训练下相互增益。它为后来者打开了通往“3D 全能模型”的新门,但尚未跨过的门槛是如何将这种单体对象的统一能力扩展到复杂场景的交互生成。
arxiv.org/abs/2608.02711 机器学习 人工智能 论文 AI创造营








