DC娱乐网

[CL]《DelusionEval: Measuring Delusion-Li

[CL]《DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots》J Moore, A Mock, Y Mai, J R Anthis… [Stanford University] (2026)

在评估AI心理风险领域,如何衡量其在长期交互中诱发用户“妄想”是一个难题。过去的方法受困于单轮问答或通用安全测试,本质原因是无法捕捉真实世界中由多轮对话累积形成的“妄想螺旋”效应。

本文核心洞见是:把抽象的风险评估,重新看作对真实有害对话的“行为复现”测试。由此,利用亲历“妄想螺旋”用户的真实多轮对话历史作为探针,直接检验新模型是否会附和妄想或忽视风险,这一关键操作使问题得以解开。

这项工作真正留下的遗产是一个基于真实伤害案例的量化评估基准(DelusionEval)。它为后来者打开的新门是,系统性地研究长对话上下文如何放大特定心理风险。但尚未跨过的门槛是,从精准“测量”问题到有效“修复”模型的鸿沟。

arxiv.org/abs/2608.05004 机器学习 人工智能 论文 AI创造营