DC娱乐网

DeepSeek 8月13日发布V4‑Pro(半撤回) +DeepSeek Ha

DeepSeek 8月13日发布V4‑Pro(半撤回) +DeepSeek Harness

2026‑08‑13,同步发布DeepSeek‑V4‑Pro‑0813基座模型与Agent运行时DeepSeek Harness(v0.1开发者预览,MIT开源)。随后发生半撤回事件,发布宣传叙事撤回,API接口并未下架,官方重新上线但未对外解释事件原因。
国内率先完成“基座大模型+Agent执行运行时”完整技术栈;本次半撤回事件不是简单技术故障,而是裸模型能力与“模型+Harness”系统协同成绩叙事边界的修正;AI竞争从模型跑分转向Agent真实任务闭环能力,公式Agent = 模型 + Harness;定价权重构进入第二阶段,试图摆脱单纯Token价格内卷。
一、事件定性:半撤回,非回炉重造
官网发布横幅、更新公告全部撤下,API、定价页面保留0813版本标识,服务可正常调用,属于宣传叙事层面撤回,并非模型彻底下线回炉重造。
核心矛盾:裸模型能力 VS 模型+Harness系统协同成绩
官方基准:在Harness完整运行环境下,Agent任务跑分(终端操作87.9分等)逼近海外头部模型。
第三方独立裸模型实测:脱离Harness运行底座,V4‑Pro‑0813仅小幅优于Flash(53 vs 52),弱于竞品Kimi K3。
官方将整套系统联合优化后的成绩,包装成裸模型原生能力,形成市场预期错配。
二、DeepSeek‑V4‑Pro‑0813 能力重新审视
架构不变:MoE总参1.6T,激活49B,依靠大规模专项后训练面向Agent任务优化。
Agent专项:系统强,裸模型提升有限,同时暴露短板
配套Harness环境:DeepSWE、Terminal Bench、CyberGym取得高分;CyberGym攻防智能体52.7→83.3分(+58%),网络安全属于高付费垂直场景。
裸模型实测:相比Flash提升微弱,长链路任务缺陷暴露:50轮长任务存在约42轮“提前交卷”现象;网络安全场景召回率高,但误报率34.4%,直接削弱生产实用性。
长上下文能力(硬件架构层面不受本次事件影响)
上下文窗口100万token,最大输出384K token,可完整加载大型代码库;
自研混合稀疏注意力降低长序列KV缓存开销;Engram记忆机制缓解长会话幻觉;
双模式切换:thinking深思模式 / 快速模式,兼顾推理质量与响应速度。
产品分层与商业化设计(性价比逻辑受到挑战)
V4‑Pro(旗舰,并发上限500,面向复杂Agent);V4‑Flash(高吞吐,并发2500,普通业务);新增图像推理能力。
三、DeepSeek将“模型+Harness”的系统协同优化成绩,误包装成了裸模型的原生能力。
Harness价值重估:混乱中的确定性
独立性:Harness作为MIT开源的Agent运行底座,其架构价值(一切皆插件)和生态价值(300+插件)不受此次事件影响。
战略意义:本次撤回反而证明了Harness的重要性——模型裸跑天花板已现,真正的差异化在于“模型+执行环境”的系统优化。
四、实测暴露的重大短板
稳定性不足:长程任务(50轮)中存在42轮左右“提前交卷”现象,未用完调用次数。
误报率高:网络安全场景虽召回率高,但误报率达34.4%,实用性大打折扣。
性价比存疑:若Pro仅比Flash强1分,目前的高价与分层定价逻辑缺乏支撑。
五、V4-Pro-0813的“翻车”恰恰验证了DeepSeek的战略公式:Agent = 模型 + Harness。
V4-Pro可能不是那个“全能旗舰”,但它证明了Harness作为“放大器”的潜力。DeepSeek试图用开放栈(Harness)对抗海外封闭栈,方向正确,但步子迈得大了,导致模型预期管理失败。
六、跟踪重点
最高优先级:官方是否给出撤回解释;Artificial Analysis是否更新评分。
关键验证:开发者能否用Harness + 其他模型(如Kimi/Qwen)复现高分?(验证Harness是核心变量)。
观测项:峰谷定价(8月17日)是否如期执行。