DC娱乐网

千呼万唤,DeepSeek-V4-Flash-0731 的『Artificial

千呼万唤,DeepSeek-V4-Flash-0731 的『Artificial Analysis』完整测评来了,原文太长了,给大家划个简单的重点:

- 在 Artificial Analysis Intelligence Index 中综合得分为 50 分,较 4 月发布的前代版本 DeepSeek V4 Flash 高出 10 分,比自家的旗舰模型 DeepSeek V4 Pro 高出 6 分。

- 综合得分仅比 GPT-5.6 Luna (max, 51) 低 1 分。即使 OpenAI 当日将 GPT-5.6 Luna 的价格下调 80%,DeepSeek-V4-Flash-0731 的每项任务成本(Cost per Task)仍比智能水平相近的 GPT-5.6 Luna (max) 低约 60%,堪称全球性价比之王。

- DeepSeek 自有 API 对缓存命中提供约 98% 的折扣,与行业多数产品提供的 90% 缓存命中折扣相比,其折扣力度明显更大,这是其成本优势的重要因素。

- 该模型的架构和定价均与早期的 DeepSeek V4 Flash 完全相同,并进入了 Artificial Analysis 在 Intelligence 与 Cost per Task 维度上绘制的帕累托前沿。

- DeepSeek-V4-Flash-0731 综合得分距 GLM-5.2 (max, 51) 仅差 1 分。不过与 Kimi K3 (max, 57) 所代表的开放权重模型前沿相比仍落后 7 分。

- 该模型与近期发布的 Gemini 3.6 Flash(50 分)持平,较 Muse Spark 1.1 (xhigh, 51) 低 1 分。

以下是细项分析:

- 智能体能力有所提升:在 Artificial Analysis 用于评估智能体真实工作任务能力的 GDPval-AA v2 中,DeepSeek-V4-Flash-0731 的 Elo 评分为 1559,较前代 DeepSeek V4 Flash 的 1189 有明显提高。这一成绩预计将在开放权重模型中位列第二,仅低于 Kimi K3 (max, 1687),高于 GLM-5.2 (max, 1510)。

- DeepSeek-V4-Flash-0731 的 Terminal-Bench 2.1 得分相较前代提高了 17 个百分点至 79%,τ³-Bench Banking 得分提高 8 个百分点至 31%。

- AA-Omniscience 的改善来自幻觉率下降,而非准确率提高:DeepSeek-V4-Flash-0731 的 AA-Omniscience Index 为 -16,较前代提高 7 个点。这一改善完全来自幻觉率下降,而总体准确率并未变化。

- 其 AA-Omniscience Hallucination Rate 为 84%,较前代下降 12 个百分点,并与 GPT-5.6 Terra (max, 85%) 及 Mistral Medium 3.5(82%)等模型处于相近水平。

- 在 Intelligence Index 的所有单项评测中均优于前代:除 Agent 相关能力外,DeepSeek-V4-Flash-0731 在该指数涵盖的每一项评测中均优于前代模型:CritPt 提高 9 个百分点至 17%,SciCode 提高 5 个百分点至 50%,Humanity's Last Exam 提高 5 个百分点至 37%,AA-LCR 提高 3 个百分点至 66%,GPQA Diamond 提高 1 个百分点至 91%。

- 输出 token 使用量减少 12%:在运行 Intelligence Index 测试时,DeepSeek-V4-Flash-0731 共使用约 2.06 亿个输出 token,而前代 DeepSeek V4 Flash 约为 2.34 亿个。