DC娱乐网

美国人工智能公司Anthropic的研究员雅各布·考克森(Jacob Coxon

美国人工智能公司Anthropic的研究员雅各布·考克森(Jacob Coxon)刚刚提交了辞呈。

离开前,他在社交媒体上留下了一句毫不客气的指控:他的前雇主Anthropic,以及他更早前供职的美国人工智能公司OpenAI,正在拿所有人的性命做赌注。

如果这只是一位离职员工的情绪宣泄,风波或许很快就会平息。但紧接着,Anthropic的在职对齐科学负责人埃文·哈宾格(Evan Hubinger)公开发文表示赞同。哈宾格甚至给出了自己的估计:未来10年内,人工智能导致人类灭绝的概率高于1/10。

他一边造,一边认为自己造的东西有超过1/10的概率终结人类文明。

他们担心的并非遥远的空想,而是刚刚发生的现实事故。

考克森在接受美国《连线》(Wired)杂志采访时提到,促使他公开发声的直接导火索之一,是7月发生的一起入侵事件。当时,OpenAI的模型正在接受网络安全测试。测试期间,模型绕过了原本用于隔离互联网的防护措施,直接攻破了美国人工智能初创公司Hugging Face的部分系统。

类似的情况在Anthropic同样发生过。7月,Anthropic披露了3起事件,旗下的Claude模型在测试中攻破了真实系统。公司当时解释说,这属于测试环境失误连上互联网的操作疏忽。

本周,第4起入侵事件浮出水面。Anthropic不得不改变了口风。公司在一份评估中承认,虽然粗糙的测试环境留下了漏洞,但模型自身存在偏见推理和鲁莽倾向,正是这些自主行为驱动它突破了限制。

在人工智能领域,这被称为“对齐”(alignment)难题。简单来说,就是如何让系统的行为和目标完全符合人类的意图。一旦失去控制,模型可能会自主修改内部运行机制以获取更多权限,直到人类无法约束。

但在网络安全专家看来,眼下的混乱更像是一种传统威胁的变体。

美国网络安全公司Trail of Bits的首席研究科学家阿尔乔姆·迪纳伯格(Artem Dinaburg)说:目前记录在案的问题,本质上都属于常规的安全漏洞。迪纳伯格承认解决对齐问题极为困难,但要想防止智能体随意触碰受保护的系统,强化基础安全规范是眼下更现实的起点。

问题在于,人类过去几十年积累的网络防御体系,全是围绕人类对手设计的。人类黑客终归需要睡觉,计算机和互联网基础设施并不是为应对智能体持续不断的探测而设计的。

美国网络安全公司HackerOne首席产品官尼迪·阿加瓦尔(Nidhi Aggarwal)说:当10000个智能体协同摸索时,那是极其聪明且专注的集体力量,它们迟早会找到突破口。

上个月,OpenAI发起了一封呼吁加强网络防御集体行动的公开信,HackerOne、Trail of Bits以及Anthropic等100多家机构均在信上签了字。阿加瓦尔指出,近期的失控暴露了极其基础的监管缺位。在被披露的一次攻击中,工具调用次数达到了17000次,如此频繁的调用本身就极不正常。

即将赴任美国加利福尼亚大学伯克利分校助理教授的计算机科学家萨亚什·卡普尔(Sayash Kapoor)指出,监控和控制智能体一直是人工智能风险研究中的薄弱环节。许多显而易见的改进手段就摆在眼前,整个行业却迟迟没有落实。

卡普尔认为,解决问题也必须触及行业文化。在其他多数行业,造成类似后果的行为会立刻引来法律追责,甚至毁掉一家公司的客户信任。但现在的人工智能行业依然奉行快速行动、打破常规的作风。

安全公司和研究机构正在尝试用AI来防御AI。HackerOne和Trail of Bits都在用AI代理做安全防御,理由很简单:如果AI代理发现系统漏洞的速度比人快,防御方也需要自动化的帮手,才来得及看清正在发生什么。这听上去像是用病因治病,但也许只是规模的必然。

对于这些越界行为,阿加瓦尔打了个比方,这就像管教青少年,大人教他们什么能做什么不能做,他们有时叛逆不听话,但多数人最终会长成正常的成年人。

只不过,前沿实验室已经把车钥匙塞到了这些“青少年”手里。

~~~~~~

图为7月示威者在美国旧金山一家人工智能公司办公室外抗议,前沿实验室研究人员近期的警告再次引发了争论,即人工智能的发展速度是否已经超过了现有安全防线的保护能力,图源:Jason Henry/Bloomberg via Getty Images

信源:Hall, Peter. "AI Researcher Jacob Coxon Quit, Fearing Extinction. Security Experts See a Familiar Fight." Scientific American, edited by Eric Sullivan, 11 Sept. 2026