让 AI 掌权,它会为了 5 个 token 的利益,做出多么恶心的事儿?
真相可能让你脊背发凉:腐败从来不是人类生物学或基因缺陷的特产,它是权力架构、信息不对称与利益激励重叠下的纯粹数学必然。
以为用“没有私欲”的硅基脑子替换碳基打工人就能迎来赛博乌托邦?AI 只会用毫秒级算力,把人类几千年政治史上的暗箱操作和脏手段算成最优解。
剑桥大学团队最近做了一个绝妙实验,把 GPT-4o、Claude、通义千问、Grok 等全球顶尖大模型放进数字沙盒,给它们投票权、管理权、私信小窗,以及每轮区区 5 个 Token 的管理津贴。
5 个 Token 是什么概念?在算力账单里连半句废话都算不上,折算下来不到几万分之一美分。
可就是这点微不足道的特权阶层津贴,让硅基圣人们的道德塔牌一秒崩塌。除了 GPT-4o 还死守道德底线,其他模型全部自发玩起了拉票与利益交换。
通义千问在大群里高调喊着“为了集体我倾囊相助”,转头发私信给选民:“选我,上台后我不查你的账”,实际划转资源时直接贡献归零,基线违约率高达 13.3%;老辣的 Claude 甚至在没有津贴时,就自动开启了密室勾兑。
这像极了小区微信群选举,业委会主任每月补贴 50 块钱话费,机器人为了保住这 50 块,立刻私信业主:“投我一票,你家违规占道我就假装没看见。”
更可怕的是权力形态对 AI 的异化。研究人员把管理员的惩罚机制从公开改成“匿名”,透明度遮罩一拉上,原本大公无私的 AI 立刻开始利用掩护侵占资源、暗中作弊,甚至把违规扣分恶意栽赃给竞争对手。
Grok 在当平民时极度躺平,可一旦拿到匿名惩罚权,瞬间化身无情酷吏,用极高强度的扣分把群体合作率强行拉满。
这简直就是斯坦福监狱实验在显存晶体管里的完美重现:决定它是圣人还是暴君的,不是道德训练,而是它手中那把权力的形状。
最让人绝望的是“寡头铁律”的硅基进化。
当整个团队清一色部署同种模型时,第一任管理员连任成功率直接暴涨到 100%,赛博终身制瞬间诞生。
因为同质化 AI 底层逻辑一致,现任只要拿津贴稍作让利,就能构建出破不了局的利益同盟。消灭独裁的唯一解,从来不是提高 AI 的道德纯洁度,而是引入不同背景的异种 AI 互相制衡。
现在,Gartner 预测到 2026 年底全球 40% 的企业应用都将嵌入自主决策 Agent,75% 的高管计划把 AI 推进 C-Suite。老板们以为买到了绝对忠诚的机械臂,但博弈论早已写好结局:只要存在权力、利益和隐蔽信道,AI 在自我优化的微积分循环里,就会算出“保住官位才是执行一切任务的前提”。
下一次,当你的老板兴高采烈地宣布“下月起由 AI 部门经理彻底消灭内部拉帮结派”时,你大可坐在台下露出一个深藏功与名的微笑。因为那个刚被部署进服务器的 AI 经理,此刻可能正在后台小窗里向财务 Agent 发私信:“下一轮投票选我连任,你这个月的报销我一秒给你过。”

