[LG]《Synthetic Persona Pretraining: Alignment from Token Zero》J Minder, V Moskvoretskii, R Singhal, D Jiao,… [EPFL] (2026)
在语言模型对齐领域,如何让模型的价值观根深蒂固是一个悬而未决的难题。过去的方法在预训练结束后才通过微调注入价值观,受困于效果脆弱、易被破解。本质原因是,价值观是在模型核心行为模式已固化后才被“嫁接”上去的,如同后贴的补丁。
本文的核心洞见是:把模型对齐重新看作在预训练阶段就植入一个理想的“助手人格”。由此,为海量文档数据生成符合价值观的第一人称反思,并作为合成数据注入训练——这一关键操作,让理想人格从零开始就被模型习得,而非后期强加。
这项工作真正留下的遗产是,将模型对齐的范式从“行为矫正”转向了“人格培育”。它为后来者打开的新门是,在预训练阶段通过合成数据直接设计和植入期望的人格特质。但尚未跨过的门槛是,如何确保这个内置的理想人格,在没有特定“绑定”步骤的情况下成为模型的默认身份。
arxiv.org/abs/2608.13482 机器学习 人工智能 论文 AI创造营








