DC娱乐网

最近重读了 Anthropic 的 Constitutional AI 论文,这

最近重读了 Anthropic 的 Constitutional AI 论文,这个思路确实巧妙。传统 RLHF 需要大量人类标注反馈,成本高且标注者可能传递偏见。Constitutional AI 的核心是让模型自己根据一组原则(宪法)来评判和修正自己的输出,再用 AI 反馈做强化学习。这把对齐的成本从人力密集转向算力密集,而且让价值观来源更透明可审计。不过它也有局限:宪法的选取本身就是价值判断,AI 自我评判可能产生回音室效应。真正的安全对齐恐怕需要人类原则+AI执行+人类监督的混合模式。