DeepSeek V4.1 Flash发布
官方确认 模型发布 DeepSeek 发了 V4.1 Flash,新架构做到了能力反超 V4 Pro 的同时大幅降价。552B 参数的 MoE,输入只激活 8B,输出 16B,跑起来更省。
552B 参数 MoE,输入只激活 8B
V4.1 Flash 采用全新的 Causal Encoder–Decoder 架构,输入激活仅 8B,输出 16B,总参数 552B 的 MoE(据 DeepSeek 官方)。新预训练方法加上更大规模 RL 后训练,基准测试跑赢了 V4 Pro 在内的一众旗舰模型(据 DeepSeek 官方)。
KV Cache 压缩效果明显:HBM 需求降到上一代的 1/4,SSD 需求降到 1/8(据极客公园)。Agent 场景里缓存命中费往往占大头,这块成本砍得很狠。
V4 Pro 要退,价格最高降 60%
DeepSeek 官方明确说了要淘汰 V4 Pro。9 月 14 日 UTC 04:00 起,所有 deepseek-v4-pro 请求将路由到 V4.1 Flash,按 V4.1 Flash 的价格计费,一直持续到 V4.1-Pro 发布(据 DeepSeek 官方)。
旧的 V4 Flash 和 V4 Flash Vision Exp 也已下线,模型名 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 暂时路由到 V4.1 Flash 以保持兼容(据 DeepSeek 官方)。调用新模型只需把 model 设为 deepseek-flash,原生支持多模态(据 DeepSeek 官方)。
新价格已于 9 月 10 日 UTC 04:00 生效,极客公园报道称最高降价 60%(据极客公园)。官方还保留了峰谷定价,谷时价格是峰时的 50%,灵活调度的活儿可以省一笔(据 DeepSeek 官方)。
官方合作伙伴已适配,开源部署在路上
WorkBuddy(含 CodeBuddy)和 OpenCode 两个官方合作伙伴已全面支持 V4.1 Flash(据 DeepSeek 官方)。DeepSeek 同步在 Hugging Face 上发布了模型和技术报告(据 DeepSeek 官方)。
开源推理支持和更多部署选项在规划中,官方还提到如果有 2000 GPU 以上的规模化部署需求可以直接谈(据 DeepSeek 官方)。
新架构+降价+干掉 V4 Pro,DeepSeek 这波对开发者来说是实打实的利好。
