DeepSeek-V4-Flash 官方正式版 API 宣布公测上线。
在保持 284B 总参数、13B 激活的 MoE 架构“一个字没动”的前提下,仅凭后训练与 Agent 框架优化,便将软件工程基准 DeepSWE 成绩狂飙 7.5 倍至 54.4 分,并打出输入 $0.14 / 输出 $0.28 每百万 token 的屠夫价格。
大模型行业“拼体量、烧钱刷榜”的盲目扩增路线已被彻底颠覆,通过极致后训练在垂直 Agent 领域实现“轻量级 MoE 越级斩杀顶尖闭源旗舰”,才是真正拉开产业落地差距的分水岭。
不得不说,这次 DeepSeek 玩的“后训练魔法”,狠到连自家产品线都避之不及。
从官方公布的评测数据来看,这完全是一场体面人难以直视的“内卷下克上”:
上一代 V4-Pro-Preview 在 Terminal Bench 2.1 上拿了 72.1 分,而这次的 V4-Flash 正式版直接砸出了 82.7 分;在 Cybergym 网络安全基准测试中,更是从 52.7 分一跃升至 76.7 分。
甚至在 DeepSWE 软件工程任务上(54.4 分)已经开始对 Anthropic 的 Opus-4.8(58.0 分)贴脸输出。
自家旗舰 Pro 预热版还没坐热,就被闪电版的弟中弟按在地上摩擦,这种“连自己人都不放过”的进化速度,确实让人倒吸一口凉气。
但真正让硅谷各大模型厂商睡不着觉的,并不是这几分提成,而是横向对比下的价格悬殊。
在 Terminal-Bench 2.1 的榜单上,GPT-5.6 Sol 拿了 85.8 分,要价是输入 $5 / 输出 $30;Fable 5 拿到 80.5 分,价格更是高达 $10 / $50。再看看 DeepSeek V4-Flash:82.7 分,价格 $0.14 / $0.28。
这意味着,为了买 GPT-5.6 比 Flash 高出区区 3.1 分的性能,你得付给它近 100 倍的输出溢价;而比 Flash 表现还低 2.2 分的 Fable 5,单价居然是 Flash 的近 180 倍。这已经不是“性价比”的问题了,这完全是逻辑层面的降维打击。
对于每天跑成千上万次 Agent 自动化循环、SWE 工具调用的开发者来说,这笔账算起来极其残暴:
过去用昂贵顶尖模型跑一次调试的成本,现在用 V4-Flash 可以跑上百遍。
况且,这次正式版原生支持 Responses API,完美适配 Codex,开发者甚至连代码都不用重写,改个接口地址就能直接无缝无感地“降本增效”。
这背后的技术洞察非常清晰:底座大模型的预训练规模固然决定了“智商下限”,但对于具体的 Agent 代码执行、终端操作和工具调用,决定“执行力上限”的永远是后训练(Post-training)与环境适配框架(DeepSeek Harness)。
以前大家总以为要养出一名顶尖的“AI 程序员”,必须砸几十亿美金去训练千亿参数的巨无霸;而 DeepSeek 用实践证明了,只要后训练的强化学习和工具链做到了极致,一个 13B 激活的轻量 MoE 也能在垂直干活场景里拥有不输顶尖旗舰的实操手感。
未来模型竞争的禁区早已不是“谁的模型更大”,而是“谁能在卡价与算力高墙之下,把每万 Token 的干活产出比压到极致”。当闭源巨头们还在试图靠高昂订阅费维系算力成本时,开源与轻量化 Agent 的号角已经吹响。
代码库里那些卡在预算线上的 Agent 项目,今天终于可以放开手脚干一场了。


