DC娱乐网

DeepSeek 这次真正升级的,不是模型,而是 AI Agent。今天,Dee

DeepSeek 这次真正升级的,不是模型,而是 AI Agent。

今天,DeepSeek 正式发布了 DeepSeek-V4-Flash 正式版 API。很多人第一眼看到官方放出的 Benchmark 后,关注点几乎都放在了跑分上:TerminalBench 超过了 GLM 5.2、DeepSWE 提升了七倍、多个 Agent 基准测试大幅领先 Preview 版本,甚至有人开始喊出”国产模型再次反超”。

不过,如果认真读完官方公告,我认为这次更新真正值得关注的,并不是跑分,也不是模型本身,而是 DeepSeek 已经把重点放到了整个 AI 行业下一阶段最重要的方向——Agent(智能体)。

首先,需要明确一点,这次更新的并不是大家日常使用的网页版或者 App,而是 DeepSeek-V4-Flash API 正式版。官方也特别强调,V4-Flash-0731 与 Preview 版本保持相同的模型结构和模型尺寸,仅重新进行了后训练优化。 换句话说,这不是一次更换底层模型的升级,没有增加参数规模,也没有重新设计网络架构,而是在同一个基础模型上,通过后训练进一步提升模型的综合能力。

这句话其实透露了一个非常重要的行业趋势。过去几年,大模型的发展几乎都是围绕预训练展开,谁拥有更多的数据、更大的参数、更强的算力,谁就有机会获得更好的模型能力。但随着基础模型逐渐成熟,越来越多厂商发现,仅靠扩大模型规模已经很难继续带来数量级的提升,相反,如何让模型真正完成工作,开始成为新的竞争重点。

所以这一年来,无论是 OpenAI、Anthropic、Google,还是 DeepSeek,大家几乎都在做同一件事情——强化 Agent 能力。

这一点,从 DeepSeek 这次公布的 Benchmark 就能看得非常明显。很多人可能没有注意,这次官方展示的大多数测试项目,并不是传统意义上的语言理解或者数学推理,而是围绕 Agent 展开的能力评测,例如 TerminalBench、Cybergym、DeepSWE、Toolathlon、AutomationBench,以及 DSBench 等。这些测试关注的并不是模型能不能回答一个问题,而是它能不能自主规划任务、调用工具、写代码、操作终端、完成复杂流程,并且在执行过程中不断修正错误,最终交付一个完整结果。

也正因为如此,这次很多 Benchmark 的提升幅度远远超过大家平时看到的模型升级。例如 DeepSWE,从 Preview 版本的 7.3 一跃提升到了 54.4;Cybergym 从 38.7 提升到 76.7;AutomationBench 从 10.8 提升到 25.1。如果只是聊天能力或者知识能力的优化,很难出现如此巨大的提升幅度。这更说明 DeepSeek 把大量工作放在了 Agent 的规划能力、工具调用能力以及执行策略上,而不是简单提升模型回答问题的水平。

官方还有一个容易被忽略的细节。在 Benchmark 的说明中,DeepSeek 提到此次测试采用了 DeepSeek Harness 框架。很多人可能觉得这只是一个测试工具,但实际上,它反映的是整个行业的发展方向。未来,大模型已经不仅仅是一个模型,而是由模型、Agent Runtime、工具调用框架、长期记忆以及执行环境共同组成的完整系统。真正决定 AI 能力的,不只是模型本身,而是整个 Agent 系统是否足够成熟。

除此之外,这次正式版还新增了一个非常重要的能力——原生支持 Responses API,并针对 Codex 进行了适配。这看似只是 API 层面的更新,但意义并不小。Responses API 是目前 OpenAI 推出的新一代接口标准,未来无论是工具调用、多轮任务执行,还是 MCP、Agent 工作流,都会逐渐建立在这一套接口之上。DeepSeek 主动兼容这一标准,也意味着它正在积极融入全球主流 AI 开发生态,开发者迁移成本将进一步降低。

当然,对于这次公布的 Benchmark,我们也应该保持理性。Benchmark 的价值在于帮助大家了解模型在哪些能力上进行了强化,而不是简单用来给模型排座次。比如在 TerminalBench 中,DeepSeek V4-Flash 达到了 82.7,已经非常接近 Claude Opus 4.8 的 85.0;但在 DSBench-Hard 中,DeepSeek 为 59.6,Claude Opus 仍然达到 71.7。不同测试集考察的是不同能力,没有任何一个排行榜能够全面代表模型的真实实力,因此没有必要因为某一项领先就下结论说”全面超越”。

对于普通用户来说,这次升级带来的感知可能并不会特别明显。如果只是日常聊天、写文章、翻译或者搜索资料,你未必能感受到与 Preview 版本之间存在巨大的差异。但对于大量使用 Cursor、Claude Code、Codex、OpenHands、MCP 工作流以及各种自动化开发工具的开发者来说,这次升级带来的价值会更加明显,因为 Agent 的执行能力,往往比模型单次回答的质量更重要。

我认为,比这次版本更新本身更值得关注的是,它再次印证了整个 AI 行业的发展方向正在发生变化。过去两年,大家竞争的是谁拥有更大的模型、更高的参数和更好的推理能力;而从今年开始,竞争重点正在逐渐转向谁能让 AI 真正完成一项完整的工作。未来决定一个 AI 产品竞争力的,不再只是聊天是否自然、回答是否准确,而是它能否自主规划任务、持续调用工具、完成复杂流程,并最终交付结果。

从 ChatBot,到 Copilot,再到真正意义上的 AI Agent,这条路线已经越来越清晰。而 DeepSeek 这次发布的 V4-Flash 正式版,真正释放出来的信号,或许并不是模型又提升了多少分,而是国产大模型开始全面进入 Agent 时代。DeepSeekV4Flash正式版上线