OpenAI官方账号发布GPT-6 Astra相关推文如果你把评测维度拆成三块——
专业生产场景(写代码、操作软件、搞科研、做安全分析)日常通用场景(常识问答、写文案、长文档处理)基准框架(同一个测试,跑在厂商专属框架还是行业通用框架下)你会看到三张完全不同的成绩单。
专业生产场景,代际跃升是真的这是GPT-6 Astra最没有争议的强项。不是“小步快跑”,是从“能用”到“能交付”的质变。
代码开发:在Terminal-Bench 4.0测试中,Astra得分57.9%,前代GPT-5.6 Sol只有37.3%,Claude Fable 5.1是55.8%。在内部数据库迁移这类硬核任务上,Astra拿到63.9%,前代只有42.7%,提升超过49%。

更直观的是,开发者鱼皮实测——只给了一句“生成包含重庆、上海、西安、深圳、江南五种风格的城市生成器”,Astra自己搜索Three.js文档,18分钟写完整个项目,7项自动化测试全部通过,成品直接能在浏览器里跑。
AI生成的带多层立交的重庆3D城市界面电脑操控:这一项最接近“像人一样干活”。OSWorld 2.0测试里,Astra得分72.6%,完成单项任务平均耗时从75分钟压缩到40分钟,效率提升近47%。什么概念?此前模型操作电脑慢到用户宁可自己动手,现在40分钟已经接近普通人手动处理同类任务的效率区间。
有实测案例显示,Astra能自己打开Capture One,自动完成一张欠曝RAW格式照片的调光、校色、肤色优化全流程,成片效果符合专业产出标准,耗时约12分钟。
AI自动完成照片校色优化的前后效果对比数学与科研:Frontier Math Tier 4——这套被公认为最难数学基准之一的测试——Astra拿了97.6%,Claude Fable 5.1是87.8%,前代GPT-5.6 Sol是83%。
更狠的是,Astra直接参与了孪生素数间隔研究的实质推进:OpenAI研究员苏炜杰借助Astra,将素数间隔上界从246推到了186,AI给出了名为“三重稠密可整除”的全新约束条件,这是人类数学家自己还没想到的招。
企业级落地也已经有可验证的案例:法律科技公司Legora用Astra做财务报表审阅,整体效率提升约40%,几分钟内审完41份文件,还精准定位到4处人为预埋的容易遗漏的错误;游戏公司Playco用Astra做原型开发,人工修复工作量直接减少50%,一个灰盒基础原型就能产出3个不同主题的可运行游戏。
AI生成的海滩主题卡丁车游戏运行界面在这些场景上,Astra不是“纸面数据好看”,而是真的能出活了。
日常通用场景,代际感知几乎为零但换个场景,结论就翻过来了。
独立评测机构Artificial Analysis发布了一份综合智能指数——注意,这不是OpenAI挑选的评测,而是第三方独立机构。
这份指数把数学、推理、代码、知识多个维度拉平权重后,Astra得分61分,和前代GPT-5.6 Sol完全持平,低于Claude Fable 5.1的66分,也低于Claude Opus 5的63分。
编程能力分项指数上,Astra是67分,Claude Fable 5.1是70分,差距依然在那。
更有意思的是,同一位开发者拿Astra跑日常办公任务——近300K体量的新闻日报批量总结——结论是:Astra在中文长文输出上确实超过了DeepSeek,“但前提是放手让它干,别管着它”。换句话说,体验提升有,但远没到“代际”的程度。
在常识问答、日常文案生成这类普通用户最高频的场景下,Astra的体验相比前代没有明显跃升。可是API调用成本是前代的2.5倍。花更多钱,得到的日常体验提升约等于零——这就是反方最核心的质疑起点。
所以准确的说法是:Astra在“动手”类任务上极具代差,但在“动嘴”类任务上,和前代坐在同一张桌子上。
同一道题,两套框架,分数天差地别光看两个场景的对比,你可能已经感觉到了症结在哪。但真正让这次“综合第一”的结论站不住脚的,是评测框架本身。
GPT-6 Astra最炸裂的宣传数字,是ARC-AGI-3测试拿了99.9%的接近满分——这套测试衡量的是模型在陌生环境中学习和抽象推理的能力,前代GPT-5.6 Sol只有7.8%。十余倍跃升,听起来确实像AGI敲门了。
但第三方实测揭示了一个关键细节:这个99.9%是在OpenAI专属的Provider Adapter特殊测试框架下取得的。这套框架可以在多次调用之间保留模型的隐藏推理状态、复用此前的探索结果——相当于给模型开了“记忆外挂”。
换成行业通用的标准无状态测试框架之后,Astra的ARC-AGI-3得分骤降到62.7%,测试成本反而从1.88万美元涨到了2.61万美元。部分公开实测场景中,这个分数甚至低至17%~63%的区间。

62.7%依然是一个领先成绩,但它和99.9%之间,差了整整一个“代际叙事”的距离。
这还没完。Epoch AI这次的评测体系——也就是给GPT-6打出169分、在267个模型中排名第一的那份榜单——包含了50余项基准,大量向网络安全、电脑操作、前沿数学这类GPT-6针对性强化的小众项目倾斜,刻意压缩了普通用户日常高频的通用场景权重。
换句话说,这次“综合第一”的排名,是规则设计后的结果,而这份规则本身,恰好最有利于GPT-6。
所以,这次逆袭到底是什么成色把前面三块拼在一起,结论就很清晰了:
如果你是一个程序员、数据从业者、科研人员,或者需要AI替你操作电脑、跑自动化工作流的人——GPT-6 Astra是当前最强的选择,没有之一。
它能在40分钟内完成过去需要75分钟的复杂软件操作,能自主写完全栈项目、能帮你改论文的数学证明,而且越权操作的概率从前代的48%降到了0%。这些提升是真实的,可复现的,而且直接对应你的生产需求。
如果你是一个普通用户,日常就用AI问问题、写写文案、处理下文档——GPT-6 Astra和前代、和Claude Fable 5.1拉不开差距,甚至在某些维度上还落后,但你的API账单会翻2.5倍。这个“综合第一”和你没关系。
“综合榜第一”这个结论本身,是OpenAI拿着自己最擅长的小众项目,在偏向自己的评测框架下,加权合成的一个总分。
不是“纸面数据好看”,但也不是“全场景真的变强了”——它在它能做的事上做到了真正的代际跃升,只是这些事,暂时还不是大多数人每天在用AI做的事。
这也解释了为什么研究摘要里提到,正方信源主要来自头部媒体和券商研报,反方观点却集中在技术社区开发者专栏——专业用户被震撼到了,普通用户没感觉,各自基于自己的体验在说话,自然吵不到一块去。