梁文锋出手了!DeepSeek V4 Pro正面硬刚Grok 4.6,首测结果一出,全网炸了。
8月12日深夜到13日凌晨,全球AI圈经历了一场罕见的“撞车”。
梁文锋的DeepSeek和马斯克的SpaceXAI,几乎在同一时间分别放出了自己的旗舰模型——DeepSeek V4 Pro正式版和Grok 4.6。
说是“撞车”,其实两边的方式很不一样。DeepSeek这边没有发布会、没有官宣推文,甚至连更新日志都没来得及写。
8月13日凌晨,DeepSeek官网的API文档悄悄刷新了一下,模型版本从V4 Pro预览版变成了“DeepSeek-V4-Pro-0813”。
从4月24日预览版上线算起,整整等了111天,正式版就这么来了。马斯克那边则高调得多,直接在X上转发SpaceXAI的推文宣布Grok 4.6上线,英伟达第一时间在评论区留言“恭喜发布”。
说实话,这两款模型放在一起对比,最让人感慨的不是谁更强,而是价格差距实在太离谱了。
先看性能。DeepSeek V4 Pro正式版最亮眼的成绩在Agent相关评测上。Terminal Bench 2.1拿到了87.9分,只比全球第一的Anthropic Fable 5的88.0分差了0.1分。
Cybergym拿到83.3分,以0.2分的微弱优势压过了Fable 5的83.1。最夸张的是DeepSWE软件工程基准,从预览版的12.8直接飙到62.7,涨了将近5倍。
这些测试都不是简单的“会不会写代码”,而是考察模型能不能像工程师一样在复杂代码仓库里持续干活、修改多个文件、运行测试并不断修正。
换句话说,V4 Pro从预览版到正式版,变化大到“像换了个模型”。
Grok 4.6同样不弱。第三方评测机构Artificial Analysis的智能指数显示,Grok 4.6得分61,与OpenAI的GPT-5.6 Sol持平,比上一代Grok 4.5提高了5分。
在GDPVal-AA v2真实知识工作评估中,Grok 4.6拿到1753 Elo,超过了Fable 5的1741和GPT-5.6 Sol Max的1728。
性能上两边咬得很紧,但价格完全不在一个量级。
Grok 4.6的API定价是输入2美元/百万Token、输出6美元/百万Token。SpaceXAI自己说这是“其他前沿模型的一半价格”。
但跟DeepSeek一比就尴尬了——V4 Pro的价格是输入3元人民币/百万Token、输出6元人民币/百万Token。
按汇率换算,DeepSeek V4 Pro的输出价格大约是0.87美元,而Grok 4.6是6美元。差了多少?将近7倍。
更直观的对比来自一个实际测试。有开发者让两个模型去完成同一个代码修复任务,DeepSeek V4 Pro花了12分02秒、成本0.12美元,但代码有bug;Grok 4.6只花了3分18秒、成本1.41美元,代码没问题。
Grok快是快,但成本是DeepSeek的近12倍。这就引出一个很现实的问题:对于绝大多数开发者来说,你是愿意多花11倍的钱省9分钟,还是愿意花一毛二分钱等12分钟然后自己修bug?
我个人的看法是,这恰恰暴露了AI行业当前最核心的矛盾——性能和成本之间到底该怎么取舍。
DeepSeek走的是一条极致的性价比路线。1.6万亿总参数、490亿激活参数的MoE架构,100万Token上下文、38.4万最大输出。这些硬指标摆在那里,价格却只有对手的零头。
Grok 4.6的路径则完全不同。它更强调“快”和“准”——3分18秒完成任务、没有bug。SpaceXAI特别强调Grok 4.6的长流程智能体能力,说模型能够自己理解需求、写代码、运行测试、发现问题再修改,不用每一步都等用户下指令。
这种“一次到位”的能力确实有它的价值,尤其是对那些时间比钱更贵的场景。
但问题在于,全球有多少开发者愿意为这9分钟多付11倍的钱?我猜不会太多。
尤其是在当前AI应用越来越普及、开发者预算越来越紧张的背景下,DeepSeek这种“够用且便宜”的策略,市场空间可能比我们想象的要大得多。
有一点是可以肯定的:当梁文锋和马斯克同时把高性能模型的价格打到这个水平,真正睡不着觉的不是对方,而是OpenAI和Anthropic。
Fable 5每百万输出Token定价50美元,GPT-5.6 Sol Max是30美元。DeepSeek卖0.87美元,Grok卖6美元。
价格差了一个数量级甚至两个数量级,性能却差不了多少。这种降维打击,才是这场“撞车”最值得关注的地方。


