DC娱乐网

GPT-6 Astra发布:AI开始像真正的员工一样工作 昨晚全球AI服务大面积宕机后,北京时间凌晨3点33分,OpenAI正式发布GPT-6 Astra。 这次确实有一点GPT-4发布时的感觉:各项能力同时跃升,重点也终于不再局限于编程。Astra更像一个拥有博士级分析能力、能够操作电脑、独立推进任务,同时具备审美和判断 ​

GPT-6 Astra发布:AI开始像真正的员工一样工作

昨晚全球AI服务大面积宕机后,北京时间凌晨3点33分,OpenAI正式发布GPT-6 Astra。

这次确实有一点GPT-4发布时的感觉:各项能力同时跃升,重点也终于不再局限于编程。Astra更像一个拥有博士级分析能力、能够操作电脑、独立推进任务,同时具备审美和判断力的员工。

唯一让人扫兴的是,Astra目前只向部分企业开放,API已经上线,Plus、Pro、Business和Enterprise用户还要等待未来几天的分批推送。之前宣传Pro会员可以优先体验新模型,现在200美元用户也只能排队。

AI开始直接使用电脑

GPT-6 Astra的API型号为gpt-6-astra,上下文窗口105万Token,单次最多输出12.8万Token,知识截止于2026年4月30日。推理强度分为low、medium、high、xhigh和max五档。

标准API价格为每百万输入Token 10美元、输出Token 50美元。单价明显高于GPT-5.6 Sol,但OpenAI强调,Astra完成复杂任务需要的输出更少,最终每项任务的成本未必更高。

这次最重要的升级,是电脑操作能力。

过去的Agent依赖API、MCP或者命令行。软件专门为AI提供接口,AI才能直接读取数据、执行操作。现实世界里,大量企业软件没有API,很多ERP和内部系统甚至是二十年前开发的,文档都找不到。

Astra选择了一条更直接的路:看屏幕、找按钮、点击、输入、等待反馈。人类能通过电脑界面完成的工作,它都可以尝试接管。

它可以操作Excel、Power BI,完成网站测试、软件安装和故障排查,也能处理电路板设计、法律文档排版,甚至根据静态图片在Blender中建模,再导入虚幻引擎生成可漫游场景。

OSWorld就是把AI扔进一台真实电脑,让它操作多个软件完成任务。Astra的成功率达到72.6%,GPT-5.6 Sol为65.7%;完成复杂任务的模拟平均时间从75分钟降至40分钟。ScreenSpot-Pro测试的是模型能否看懂屏幕并准确找到点击位置,Astra从Sol的76.9%提高到92.7%。

这意味着,图形界面可能成为Agent时代最通用的接口。企业不需要等待旧系统接入MCP,AI可以像员工一样直接操作现有软件。大量软件的自动化价值,也会从“有没有开放接口”转向“AI能否稳定看懂并操作界面”。

从会答题,走向自己摸清规则

Astra在ARC-AGI-3上取得了99.9%的成绩,这个数字比普通考试跑满分更值得关注。

ARC-AGI-3包含数百个陌生交互环境和数千个游戏关卡。模型没有说明书,也不知道目标,需要通过试错理解环境:什么东西会造成失败、地图的规则是什么、怎样才算完成任务,然后把刚刚发现的规律迁移到更复杂的关卡。

它测的能力,很接近我们平时说的“悟性”。

今年3月,这项测试刚推出时,最强模型得分只有0.51%;GPT-5.6 Sol提高到7.8%,Claude Opus 5达到30.2%,Astra直接做到99.9%,人类平均成绩约48%。

单项测试无法给AGI盖章,却展示出一个重要变化:模型开始拥有更强的陌生环境适应能力。过去的模型擅长调用训练中学过的知识;Astra更擅长进入一个完全陌生的系统,通过反馈自己找出规则。

这项能力与电脑操作结合后,价值会被明显放大。企业工作很少拥有标准答案,更多时候是进入一个混乱流程,理解规则,再把事情办完。Agent能否真正替代部分白领工作,关键就在这里。

好员工最稀缺的能力是判断

现实任务很少有完美的提示词。

老板说“把明天开会要用的东西准备一下”,里面至少包含十几个没有说清楚的问题:给谁看、什么格式、重点是什么、是否参考上次会议、需要做到多细。

能力差的Agent通常走向两个极端:要么不断提问,把每个小决定都推回给用户;要么完全依靠猜测,忙两个小时后交出一堆无法使用的东西。

Astra强化了一项很容易被低估的能力:Judgment,也就是判断力。

日常、低风险、能够合理推断的信息,它会自己决定;真正影响任务方向的缺失信息,它才会提出一个聚焦的问题。

在Codex中,它甚至可以一边等待回答,一边继续完成不受这个问题影响的部分。用户长时间不回复,它会在低风险环节合理推进,在关键决策处停下来等待。

真正好用的员工也是这样:自己消化80%的不确定性,只把必须由你决定的20%交回来。

审美能力的提升同样服务于“交付结果”。Astra制作PPT和文档时,会主动处理版式、层级、间距、模板和视觉风格,也能参考已有文件的设计与语气,在保留核心内容的同时,让结果更接近企业原有的品牌风格。

OpenAI已经把Astra定位为适合复杂工作、视觉判断和高质量成品的模型。

这可能比某项跑分提高几个百分点更有商业价值。企业付费购买AI,最终买的是可以直接使用的成果,以及减少多少返工。

欢迎来到AGI时代

GPT-6 Astra真正重要的地方,是几项能力开始汇合:它能理解陌生环境、操作电脑、使用工具、判断何时自主推进、生成审美在线的成品,同时拥有更强的安全意识。

单独看,每一项都可以被解释为Benchmark进步;组合起来,它已经越来越接近一个能够独立完成工作的数字员工。

对产业而言,AI竞争的核心也在变化。模型价值不再只看回答质量和编程能力,还要看它能接管多少真实工作、节省多少时间、减少多少人工返工。电脑操作能力成熟后,企业采用Agent的门槛会下降,大量没有API的旧软件和传统行业也可能被纳入自动化范围。

Greg Brockman在媒体沟通会上说:“欢迎来到AGI时代。”

我以前也觉得,AGI会像GPT-4发布一样,拥有一个清晰的历史时刻:某天凌晨,一家公司突然发布一个模型,所有人试用后同时意识到,AGI已经来了。

现在我越来越觉得,AGI更像一条逐渐消失的分界线。模型每隔几个月多掌握一种人类能力,我们一边惊讶,一边习惯。直到某一天回头看,才发现那条曾经遥不可及的线,早已被我们走了过去。

Astra未必能为AGI给出最终答案,但它确实让这个问题离现实更近了一步。