DC娱乐网

[AI]《Toward a Theory of Value in AI Alig

[AI]《Toward a Theory of Value in AI Alignment》A Smart, S Ahmed, J Kay, J Tobin, K Shrishak, A Birhane [Google Research & UCLA & Google Deep Mind] (2026)

在 AI 价值对齐领域,让系统真正符合人类价值观是一大难题。过去的方法受困于纯粹的技术视角,其本质是用易于量化的“偏好”选项,偷换了根植于文化的“价值观”这一复杂概念。

本文的核心洞见是:把价值对齐研究本身作为分析对象。由此,通过系统性审查其文献,揭示了“价值被简化为偏好”这一普遍操作,让藏匿于技术实现之下的浅薄价值论浮出水面。

这项工作留下的遗产是为技术主导的价值对齐强制引入了哲学反思。它打开的新门是将讨论从“如何实现偏好”转向“应采纳何种价值理论”,但尚未跨过的门槛是如何将更深刻的价值理解转化为可计算、可问责的工程路径。

arxiv.org/abs/2608.10327 机器学习 人工智能 论文 AI创造营