DC娱乐网

DeepSeek 今天上线了实验版多模态模型,DeepSeek-V4-Flash

DeepSeek 今天上线了实验版多模态模型,DeepSeek-V4-Flash-Vision-Exp。

纯文本能力和 V4-Flash 正式版打平,但视觉理解一加上去,Agent 能力直接跳一档,已经摸到 Opus-4.8 的边上。

几个关键基准分数:

Terminal Bench 2.1:83.9
NL2Repo:57.7
DeepSWE:59.3
DSBench-Hard:63.6
AutomationBench(Public):25.7
ApexBench(Pass@1):36.5
Agents' Last Exam:27.3
Chartography:64.3
ZeroBench(Pass@5):35.0

第一,纯文本部分(Agent、推理、世界知识)和 V4-Flash 正式版持平。

第二,一旦 benchmark 需要视觉理解,它相比 V4-Flash 就是大幅跃升 多模态 Agent 能力已经接近 Opus-4.8。

公开基准里的 Code Agent 文本任务,DeepSeek 系列统一用自家的 DeepSeek Harness 极简模式跑,max 档、topp=0.95、temperature=1.0。所以这些分数要在同一框架里横向看。

对于要做,能看截图/图表/界面再动手的 agent 场景(比如自动化运维、UI 操作、图表分析),这是个个非常大的提升。