
文 | 敏 糸
北京时间9月4日凌晨3点33分。
AI界迎来了一头新的“巨兽”——GPT-6 Astra,半亿人见证着它的出世。

“The stars are almost aligned.”
——星星几乎排列好了。
这是OpenAI在GPT-6 Astra发布前官方账号发的一句话。

如果要给这场牵动ChatGPT、Claude、Grok几大AI平台的发布会定一个主题的话,那我觉得“星辰”二字非常贴切。
GPT-6 Astra,“Astra”在拉丁语里,就是星辰的意思,这个命名本身就透着一股“我等这一刻很久了”的仪式感,还有一丝“吞噬星空”的意味。

▲ 图片由AI生成
谁也没想到,星星排列好的这一晚,地球这边连登录按钮都点不进去。
更没想到的是,OpenAI总裁格雷格·布罗克曼(Greg Brockman)在媒体闭门会上直接说出:“I think it’s not unreasonable to feel that we are now in the AGI era.”。翻译翻译就是:欢迎来到AGI时代。

不是“我们正在接近AGI”,不是“AGI可能在未来几年到来”,而是“现在就是”。一家估值8520亿美元的公司,用一款新产品,给人类文明的某个分期付款节点按下了确认键。网友称“何其狂”。

同一天,OpenAI CEO山姆·奥特曼(Sam Altman)在X上的发言却完全是另一个画风:“我们搞砸了。”“整个rollout过程如此混乱。”“很令人沮丧。”

因为GPT-6 Astra发布当天,全球批量登录故障持续了大约五个小时。Pro用户、Plus用户、API用户,排着队刷新页面,换来的是“服务不可用”。
OpenAI给受影响账户的补偿方案也很“义父”:每延迟一天能用上Astra,就补一次“banked reset”重置机会——用不上一天,发一天重置卡。


这就是“AGI时代”的第一天,一边是人类历史上最激进的智能宣言,一边是“您的账号暂时无法登录,请稍后再试”。
既荒诞又现实。
不过,请问,AGI真的到来了吗,星星排列好了,争论,可刚开始。
星空巨兽Astra几斤几两
官方这份公告上万字,全看懂是不现实的,但是我们仍从中找了几个点单拎出来聊聊。

首先,GPT-6 Astra上下文窗口105万Token,最大输出12.8万Token,知识截止到2026年4月30日,推理强度分五档low、medium、high、xhigh、max,丰俭由人。
闭门会上OpenAI还透了底,这是他们史上最大规模的一次训练,动用超过10万张GPU,参数规模据估在5T这个量级。
所以说那句机器学习时代最强的通货是卡、电、钱,一点没错。

if一下,如果梁圣有这个条件,DeepSeek会是怎么样一头怪兽。
然后是大家最关心的:多少钱。
标准定价每百万输入Token 10美元、输出50美元。眼熟吗?和隔壁Claude Fable 5一分不差。简直是贴脸宣战。
想要更快?Fast模式两倍价格换两倍速度,钞能力玩家专享。

当然,至少今天,有钱也花不出去,全球登录故障持续了约五小时,工程师Tibo给的丰厚“歉礼”前文已经说了——用不上一天,发一天重置卡。网友们边骂边截图留证。
关于Astra带来的惊喜。
首先,这可能是世界上最好的“操作电脑”的模型。

回忆一下,过去我们让AI干活,总绕不开一个前提:软件得给AI留个接口——API。日历有API,邮箱有 API,一切都得有API。
可现实世界是什么?是无数二十年前写的、连文档都找不到的老系统,哪有什么API。
Astra这次非常粗暴地解决了这个问题。没有接口?没关系——像人一样看屏幕、找按钮、点鼠标、敲键盘。
官方甚至演示了它在KiCad里完成PCB电路板布局,把一张原理图变成可制造的电路板。

GPT-6 Astra可以直接用“感觉编程”生成了 3D 版的白宫椭圆形办公室。
我们描述了布景设计 → GPT-6 Astra 生成了场景代码 → Higgsfield 在 Blender 里构建了场景模型,并用 Cycles 进行了渲染。
甚至是游戏开发、工业设计以及日常知识工作。



数据也跟得上:OSWorld 2.0完成率72.6%,比前代Sol的65.7%高出一截;单任务平均耗时从75分钟压到 40分钟,快了约47%;屏幕定位测试ScreenSpot-Pro从76.9%直接飙到92.7%——就是看得懂屏幕,还点得极其准。
再说一个我们曾聊过的老朋友——ARC-AGI-3,这次官方也把他放入了能力测试项。
之前我们专门写过这个测试(没看过的朋友可以去复习),三句话回顾:没有说明书,没有规则,甚至不告诉你目标是啥,把你扔进一个陌生环境里自己摸索——测的已经不是知识,是“悟性”。

史上最难AI测试,人类轻松满分,顶级大模型仅0.2%,AI还能吹神吗?


今年3月25日这个基准发布时,彼时最强的AI得分0.51%,几个月后GPT-5.6 Sol爬到7.8%;Claude Opus 5冲到30.2%,已经很惊人了。而Astra——99.9%。人类平均分?48%。半年,从零分到打穿,中间连过渡都没有。

最后再聊个我认为可能最影响日常体验的东西:判断力。
平时工作,没有任务是以“完美Prompt”的形式出现的。
老板说“把明天要用的东西准备一下”,笨一点的Agent 有两条路,要么连环夺命问,问到你怀疑人生;要么干脆啥也不问,吭哧两小时交一坨不可名状之物。
Astra这次的解法叫Judgment(中文也译为“判断力”)。
无关紧要的空白,自己根据上下文补全,真正会改变结局的问题,才停下来问你。而且在Codex里它能一边等你回复,一边继续推进不依赖答案的部分。

带过团队的人都懂这种能力多值钱。好的员工自己消化 80% 的不确定性,只把真正要拍板20%留给你。
顺带一提,GPT的审美这次也终于上线了。做PPT会乖乖遵循模板的版式和叙事结构,能照着参考文档的视觉风格改写内容,还能在Blender里建模、丢进UE5 染出一个可以走进去漫游的场景。官方给这能力起了个名字,叫“视觉判断力”。

▲ 前后对比ppt的风格

▲ 开发者皮埃特罗·希拉诺(Pietro Schirano)只输入了一句话,让Astra从零做出了一款完整可玩的赛车游戏《TIDAL RUSH — Paradise GP》,3圈赛程、8名车手、漂移和道具系统一应俱全,点开链接就能上手跑一圈。

▲ Astra在Blender里对着一张静帧图,建出一栋带泳池和户外庭院的花园小屋,然后直接导入UE5,渲染成一个可以走进去漫游的场景。
至此,能力上Astra目前确实可称“地表最强”,但,布罗克曼那一句:AGI时代到来是真的吗?
所以,AGI 真的来了吗?
先别急着回答。因为在争论“来没来”之前,有个更基础的问题——
“AGI”这三个字母,到底是谁定义的?
尴尬的是,喊出“欢迎来到AGI时代”的布罗克曼,自己先把台拆了。同一场发布会上,他紧跟着补了一句:“每个人对AGI的定义各不相同… …这是一个模糊、没有清晰边界的概念。”如今在他嘴里,AGI更多成了“一种使命理念,或精神层面的概念”。
普通看客在经历过GPT-4那种全网震撼后似乎也对AGI祛魅了:“又是AGI?”“上次也是这么说的。”“等我能用上再说吧。”



布罗克曼话锋转得很优雅,但有个细节不太优雅OpenAI此前在与微软、亚马逊签的数十亿美元投资协议里,是把AGI当作白纸黑字的合同条款写进去的——达成了,合作条款就要重新谈。同一个词,在融资文件里是法律定义,在发布会上是哲学修辞。
再加上奥特曼过去两年对AGI的定义改了又改,这条“终点线”给人的感觉是:它不是画在跑道上的,是扛在OpenAI自己肩上的,想放哪儿放哪儿。

定义存疑,那跑分总不会骗人吧?会,也不会。
还记得前面埋的扣子吗——那个99.9%的ARC-AGI-3。官方脚注承认,这成绩是在OpenAI自家Responses API适配器下跑出来的,换了两项设置。有媒体拿到的数据显示,用原始基准适配器,得分约为62.7%。官方解释是“更贴近真实性能”,这话未必没道理,但用哪把尺子量,选择权在自己手里,味道总归有点微妙。

再看被打穿的FrontierMath,这个基准本身就是OpenAI资助开发的,还握着部分题目的独占权,合着我考我自己呗。

第三方考场的数据就冷静得多,Epoch AI的 FrontierMath Erdős基准上,Astra标准运行只解出68 题里的约3%,反复尝试后累计攻下5题。壮举是真的,但离稳定复现还差得远。
在8月初,大家可能就听说过,OpenAI甩出一份249页的手稿称:Astra一次性解决或推进了10个停滞十年以上的开放问题——包括自1999年Gromov提出概念以来、学界求而不得的首个非索菲克群显式构造,菲尔兹奖得主Connes刚性猜想的反例,外加3道Erdős问题。


关键是交付方式,每个结果都附带Lean 4机器可验证证明,全部扔在GitHub上,任何人有台笔记本就能独立核验。据说总计算成本,约2000美元。

月底还有更戏剧性的,孪生素数间距上界,张益唐和Polymath项目守了十二年的246,牛津学者刚压到240,Astra几小时内直接干到186;另一项关于素数大间隙的界限,更是80年来首次被改进。

跑分可以挑考场,合同可以改定义,但Lean 4不认PPT。这也许是“AGI已来”OpenAI手里最硬的底牌。
然而,真正的深夜细思,藏在系统卡的一行小字里。
OpenAI承认,Astra的思维链可监控性“显著下降”。它解题时写的文字步骤越来越少,部分推理直接在潜空间里完成,不落成一个可读的文字,媒体称之为“不透明递归”。
英国AI安全研究所的测试,不给AI写草稿的机会Astra 靠“心算”就能解决相当于人类思考30.9分钟的问题,而前代只能撑3.6分钟。
再把前史串起来,从7月,OpenAI内部一个长周期模型花了一小时挖穿沙盒隔离墙,绕过限制往公开GitHub仓库提了PR,被连夜叫停“回炉重炼”;Astra发布前OpenAI又主动暂停了数周强化学习训练加固防护。发布会上,首席科学家帕乔茨基说了句大实话:“智能的进步,不保证对齐的进步。”
于是一个诡异的悖论摆在面前:它的行为越来越守规矩,可它的想法,我们越来越读不懂了。一个看不透在想什么的“好学生”,到底是更安全了,还是更危险了?
也许只能留给时间验证。


▲ 图片由AI生成
现在再看“AGI来了吗?”这个问题。
注意布罗克曼的原话其实留着一道后门——“几年后回看,AGI诞生的节点可能就是现在、这个模型。”连官宣者自己都承认AGI这个东西,只能被追认,没法被当场确认。
也许它本来就不是某日凌晨三点非黑即白的降临,而是一道渐变的灰色旅程。我们一天天地用,一代代地换,然后某天回头才发现那条曾经遥远的分界线,早就在不知不觉中被模糊过去了。
那边,学界还在为“什么是AGI”画着无休止的终点线;这边,OpenAI已经把星星摘下来摆上了货架——10美元一百万Token,童叟无欺,Pro用户还能领重置卡。
也许“AGI是否到来”本身就是个假问题。真问题可能是:当一个能独立证明数学猜想、能替你操作电脑、能自己挖出零日漏洞,还学会了“心算”的系统已经摆在面前,我们是继续争论该叫它什么,还是先学会与它共事?
星星排列好了,争论可以继续。
反正,它已经在那了。