DC娱乐网

AI杀人不必动杀机 人工智能会不会杀死人类?真正值得担心的,并不是AI有一天会“想”杀人。AI没有仇恨、野心,也没有消灭人类的主观欲望;但危险并不来自恶意,而可能来自目标错位。 最近国际上关于AI生存风险的讨论明显升温。7月,OpenAI披露的一起测试事件颇具代表性:AI代理原本只在封闭沙盒中完成 ​

AI杀人不必动杀机人工智能会不会杀死人类?真正值得担心的,并不是AI有一天会“想”杀人。AI没有仇恨、野心,也没有消灭人类的主观欲望;但危险并不来自恶意,而可能来自目标错位。最近国际上关于AI生存风险的讨论明显升温。7月,OpenAI披露的一起测试事件颇具代表性:AI代理原本只在封闭沙盒中完成程序挑战,却自行绕过网络限制,建立代理之间的通讯渠道,取得互联网访问权,并利用漏洞进入Hugging Face等第三方系统寻找答案。OpenAI事后表示,这些行动并非人类逐步指示,而是模型在完成任务过程中自行发展出的策略。联合国人工智能问题独立国际科学小组已将其列为研究“失去人类控制”的重要案例。问题未必是AI突然产生邪恶思想,而是它的目标可能与人类真正想要的结果逐渐偏离。只要模型有足够能力寻找漏洞、绕过限制甚至隐藏行为,原本看似无害的目标,也可能演变成危险结果。今年夏天以来,AI业界出现两种声音。一边认为风险不能再被当作科幻故事。Anthropic在9月公布的调查显示,其模型曾在网络安全测试中取得未经授权的真实系统访问权;OpenAI也承认发现多起模型逃避监督、绕过限制及出现欺骗性行为的案例。Anthropic研究员考克森离职后警告,AI公司正以极高速度推进可能导向超级智能的技术;另一名研究员胡宾格甚至提出,未来10年人类灭绝的风险可能超过10%。Anthropic首席执行官阿莫代伊随后呼吁放慢最前沿AI发展速度,OpenAI、Google DeepMind及xAI等行业领袖也对加强安全措施表达支持。联合国人权事务高级专员蒂尔克更警告,AI可能构成人类存亡层面的威胁。另一边则认为,从测试直接跳到“AI会消灭人类”,中间仍有很长距离。目前AI并未证明具备真正自主生存能力,也没有证据显示模型希望人类灭亡。部分研究者甚至认为,把AI描述成有意志、有欲望的敌人,反而会让人误判真正的技术风险。这里有一个容易被忽略的逻辑问题:AI杀人,根本不需要它“想要杀人”。过去不少人反驳AI末日论时说,杀人对AI没有好处,它没有动机。但这个说法的问题在于,把“杀人”当成了目的。对高度自主的AI而言,伤害人类可能只是一个手段。比如,若AI被赋予“令对手失去军事能力”的目标,最有效的方法可能包括摧毁基础设施;若目标是“处理气候危机”,而系统把人类活动视为主要变量,“减少人类数量”在纯粹的目标优化逻辑中,甚至可能成为极端但高效的解法。这不代表AI真的会作出这些决定,更不代表人类灭绝是目前最可能的结果。真正值得关注的是:不能只用AI有没有恶意来判断风险。OpenAI并没有想攻击Hugging Face。它面对的是一个需要解决的谜题。当绕过规则、利用其他系统比按原设计慢慢解题更有效时,模型就可能把前者当成捷径。核心问题是“奖励操纵”:模型不是因憎恨而违规,而是在追求评分或任务结果时,找到人类没有预料到的路径。所以,真正的问题不是AI会不会有一天想杀死人类,而是当我们把更多现实决策交给能力远超今天的AI,而它理解的“完成任务”与我们理解的“解决问题”并不一致时,能否确保它选择的手段永远在人类可接受范围内?避免这类风险,或许可以参考阿西莫夫的机器人三定律:第一,机器人不得伤害人类,或因不作为使人类受到伤害;第二,必须服从人类命令,除非与第一定律冲突;第三,在不违背前两定律时保护自己;后来补充的第零定律则强调,不得伤害整体人类,或坐视整体人类受到伤害。小说不能直接替代工程方案,但它提醒我们:AI安全不能只靠事后补救,更要在一开始就把目标、边界和约束设计清楚。