AGI时代真的来了吗
今天凌晨,OpenAI 发布新一代旗舰模型 GPT-6 Astra 。总裁布罗克曼在发布会上说了一句"欢迎来到 AGI 时代",并认为未来回望时,人们可能会把这一刻视为 AGI 的起点。
一句话,把哪个模型更强推到了一个更根本的问题:通用人工智能,是不是真的来了?
先看 OpenAI 端出的成绩单。在公认最难的数学评测 FrontierMath Tier 4 上,Astra 得分约 97.6%,逼近满分;测陌生环境抽象推理的ARC-AGI-3,从 GPT-5.6 Sol 的 7.8% 跳到99.9%;漏洞利用评测 ExploitBench 拿了100%。
它首次在训练中大规模用上前代模型参与监督(模型教模型),依托得州Stargate集群超 10万张 GPU,是 OpenAI 迄今最大的训练任务。Astra 开始像员工而非助手,能自己操作电脑、填表单、跑测试,把多步骤任务从头做到尾;在OSWorld 2.0 评测里,它做一项任务约 40 分钟,比上代快近一半。
但 AGI 到了远非共识。
马斯克年初就说 2026 年内实现 AGI,4 月宣称自家 Grok 5 就是 AGI;黄仁勋在前几天财报会上直接宣布英伟达已经实现了AGI,预测未来公司或只需 4 万人类员工指挥 40 万到 400 万 AI Agent;Anthropic CEO判断,未来一到五年 AI会在大多数任务上超越人类。
而 DeepMind 的哈萨比斯认为 AGI 还要 5 到 10年,门槛是在大多数领域比诺奖得主更聪明,目前还缺世界模型和自主科学实验。最尖锐的是杨立昆,他直说靠扩展 LLM 范式达到人类水平本身就是泡沫,而出路是世界模型路线。
不过大家说的不是同一个AGI。
斯坦福科技评论把分歧拆成三个被混用的定义:模型什么时候在现有基准上超过人类(基本到了)、AI 什么时候能无人监督就干有经济价值的工作(可测、进展快)、机器什么时候匹配人类全部认知范围(含没人知道怎么测的部分)。
不同人答的是不同问题,所以一个说 2027、一个说 2033,看着差十年,其实未必矛盾。
OpenAI 自己的 System Card 承认,Astra 的 AI自我改进能力还没到 High 门槛;第三方综合评测里,它并未全面领先两天前发布的 Claude Fable 5.1。ARC-AGI-3 的 99.9% 是在特定测试环境下、保留模型隐式推理状态才取得的,有机构测算它在更标准测试上得分约 62.7 分。
所以AGI时代真来了吗?
当模型只会聊天时,有人说会推理才算 AGI ;推理被攻克,门槛变成能自主干活;现在 Astra 能独立完成工作流,门槛又挪向持续学习和自我改进。
你们觉得呢?