在评估智能体的 Last Exam 测试中,GPT-6 Sol 在 max effort 状态下得分为 56.4%,高于 Claude Opus 5 在评估中的最高分,每任务成本也降低 60%。在事实可靠性方面,GPT-6 Sol 和 Luna 模型也取得进展。在 OpenAI 基于去标识化的真实世界对话中,GPT-6 Sol 的错误率约为前代的一半,接近 Astra 级可靠性且成本更低。GPT-6 Luna 的事实可靠性也迎来大幅提升,同时成本更低。编程方面,GPT-6 Sol 和 Luna 均针对 AI Coding Agent 工作负载进行了优化。在 FrontierCode 1.1 Main 测试中,GPT-6 Sol 相比 GPT-5.6 Sol 有明显提升,并以更低成本达到与 Claude Fable 5.1 xhigh 相当的水平。在 DeepSWE v1.1 软件工程测试中,GPT-6 Sol 在 max effort 下取得 68.8% 的成绩,距离 Claude Fable 5 的最高成绩 69.9% 仅差 1.1 个百分点,而单任务成本低约 80%。GPT-6 Luna 在 max effort 下取得 66.6%,表现接近 Opus 5 和 Fable 5 的 medium effort,同时单任务成本分别低约 93% 和 96%。
在评估智能体的 Last Exam 测试中,GPT-6 Sol 在 max effort 状态下得分为 56.4%,高于 Claude Opus 5 在评估中的最高分,每任务成本也降低 60%。 在事实可靠性方面,GPT-6 Sol 和 Luna 模型也取得进展。在 OpenAI 基于去标识化的真实世界对话中,GPT-6 Sol 的错误率约为前代的一半,接近 Astra 级可靠
阅读:0
点赞:0