DC娱乐网

#DeepSeekV4.1Flash发布# DeepSeek这次的操作,本质上是用架构创新把性价比的天花板又往上顶了一层。 V4.1 Flash用的是全新的Causal-Encoder-Decoder非对称架构,552B总参数的MoE模型,但输入激活只有8B、输出激活16B。这套设计的底层逻辑很清晰:Agent场景里输入输出比往往是100:1甚至1000:1,既然99 ​

DeepSeekV4.1Flash发布 DeepSeek这次的操作,本质上是用架构创新把性价比的天花板又往上顶了一层。

V4.1 Flash用的是全新的Causal-Encoder-Decoder非对称架构,552B总参数的MoE模型,但输入激活只有8B、输出激活16B。这套设计的底层逻辑很清晰:Agent场景里输入输出比往往是100:1甚至1000:1,既然99%的计算都花在“读”上,就没必要让“读”背上和“写”一样重的参数。

结果就是,这个“最小号”模型在Terminal-Bench、DeepSWE等Agent基准上全面超越了自家旗舰V4 Pro,同时KV Cache对HBM的需求压到了上一代的1/4,SSD需求压到1/8——相对初代模型缩小了437倍。缓存命中的费用直接降到0.02元/百万token,降幅60%。

更值得关注的是,这是DeepSeek第一款原生多模态模型。之前的V4 Flash Vision Exp是在纯文本底座上外接视觉编码器的“外挂”方案,这次是从模型层面内建视觉理解。读截图、识别图表、分析界面,不再需要额外拼装。

9月14日之后V4 Pro将被有序下线,请求全部路由到V4.1 Flash并按Flash价格计费。一个Flash干掉了自家Pro,这在行业里还是头一次见。

从产业视角看,DeepSeek的策略很明确:不跟海外顶级闭源模型拼绝对跑分,而是用架构效率把调用成本打到地板价,让AI自动化的试错成本低到可以忽略不计。当每百万token的输出只要4块钱,一个月薪几千的客服跑一天自动化流程的成本可能不到一杯豆浆钱。

国产AI的竞争力,正在从“追赶参数”转向“重新定义性价比”。这条路走通了,比任何跑分榜单都更有长期价值。