DC娱乐网

[CL]《The Personalization Mirage: How LLM

[CL]《The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads》Y Sun, Y Zhang, R Sheng [LIGHTSPEED & The Hong Kong University of Science and Technology] (2026)

在个性化大语言模型(LLM)领域,确保模型对用户画像的忠实度是一个被忽视的难题。过去的方法受困于无法量化模型在证据之外的“脑补”行为,本质原因是缺乏区分事实推断与虚构臆测的评测基准。

本文的核心洞见是:将个性化过程中的过度推断视为一种“幻觉镜像”,并构建了包含150个画像和6类任务的MirageBench进行压力测试。由此,通过引入独立裁判模型与四级忠实度分类,揭示了模型自评可靠性与实际表现成反比的“自监测逆转”现象。

这项工作真正留下的遗产是量化了个性化模型中普遍存在的过度推断风险(占比高达35%-49%)。它为后来者打开的新门是确立了外部验证优于模型自评的评测范式,但尚未跨过的门槛是如何在保持模型“想象力”的同时,有效抑制长期记忆中的错误累积与污染。

arxiv.org/abs/2608.04570 机器学习 人工智能 论文 AI创造营