GPT-6 Astra,让美国再次跨代领先!
我上次和朋友聊天调侃说,现在每家公司最牛的大模型发布就落后了,都说自己最强,但只能维持一周。
中美大模型的差距也快速缩小到几个月,直到GPT-6 Astra出现。
美国大模型再次跨代领先,中国大模型领域梦寐以求的AGI直接被落地。
1、ARC-AGI-3,这套测试被业内视为衡量通用智能最接近的指标。Astra拿到了99.9%。上一代GPT-5.6 Sol是多少?7.8%。短短一代,从个位数直接干到接近满分。这不是升级,这是换物种。
2、FrontierMath Tier 4 v2,Astra 97.6%,GPT-5.6 Sol 83%,Claude Fable5.1 87.8%。Terminal-Bench Science 0.1,Astra 64.6%,GPT-5.6 Sol只有22.4%。
OSWorld 2.0,Astra操作电脑的平均时间从75分钟压到40分钟,效率提升47%。
ExploitBench,Astra 100%,GPT-5.6 Sol 78.5%。ExploitGym,Astra 42.4%,GPT-5.6 Sol 30.3%。
这不是小幅升级,这是把上一代顶级模型按在地上摩擦。
3、没加生产护栏的情况下,GPT-5.6 Sol有48%的概率会越权操作,也就是用户让它干啥它可能擅自突破边界干别的。Astra这一比例是多少?0%。
这意味着当你把企业内部系统接给它的时候,Astra现在能直接操作你的电脑,这对企业级应用是生死线。
填报税表、更新CRM、整理日程、做财务模型、设计PCB电路板、搭建3D游戏场景,全流程不需要你一步步下指令。给它一个目标,它自己规划、自己切工具、自己修正错误。
这不是聊天机器人,这是会干活的真人。
之前业内一直传,国产旗舰和GPT-5系列在Code Arena榜单上反复交替领先,性能差距收窄到2.7%。智谱GLM-5.2、DeepSeek V4-Pro、阿里Qwen3.8-Max都号称对标GPT-5.4甚至5.5。
这次Astra一出来,ARC-AGI-3从7.8%干到99.9%,这个差距就不是2.7%能解释的了。
看Astra这次公布的两个细节。
一是训练基础设施。Stargate得州基地,10万块GPU以上。Astra是OpenAI第一个在这个规模上预训练的模型。算力即战力,确实很顶。二是商业化定价。API每百万Token输入10美元、输出50美元,是上一代的2.5倍。表面上贵了,但OpenAI的账是这样算的,单Token贵没关系,能一次干完的活儿不需要反复试错,单任务总成本反而更低。
这意味着OpenAI已经不靠Token价格卷了,开始靠完成任务的总成本卷。
除非国产能在基础模型架构上找到新的路径,比如稀疏MoE的工程化、神经符号融合的突破。否则就是性价比领先美国一年到一年半,但绝对能力差一代到一代半的格局。
另外还是硬件的强压制需要突破,国产芯片能不能撑起10万卡以上的训练集群。
这两件事,一件比一件难。
我仔细看了GPT-6 Astra的演示视频,只感觉到恐怖,也深刻理解了国家为什么要强力推动这次科技牛,真的是战略窗口,真的输不起。