DeepSeek V4 Pro正式版,第一时间拿我的API key上手试了试,先说一些第一印象:
1、指令遵从性比预览版大幅提升,指哪打哪拿我之前的一些工作流简单试了一下,指令遵从和理解都大幅提升。之前我说 DeepSeek V4 Pro 是边牧类型的模型,它知道你说的是啥,也理解你要干啥,但就是不完全遵从,要耍小聪明。但DeepSeek V4 Pro在这一点上就做得很好,能完全理解我输入的内容,并做相应的修订。不管是文字写作,还是 coding,还是 Agent 应用。
2、Coding能力大幅提升,但是和前端 harness 关系很大使用这个命令:参考macOS最新操作系统,创建一个现代、有着精美桌面和UI的浏览器内操作系统 (命名为“AISniper OS”)。要求包含系统状态弹窗(如Wi-Fi、系统健康度)、时钟、底部快捷栏、主题切换功能,并内置可交互的3D太空射击游戏,底部快捷栏应该有Finder,计算器,设置、命令行终端和太空射击游戏
图1 和 图2 分别是字节Trae和Codex做的,Codex那个明显好看。
3、没想到他的智商还能进一步提升图3 这个五位数密码的题非常快,就答对了。目前在我这儿这个问题答错的分别有腾讯HY3、小米NIMO V2.5 Pro和华为Openpangu 2.0 Pro,sigh。
图4 这个问题是国产模型里头我测过以来第一个答对的。(Kimi K3我没测过,测试成本太高了,问下去这个问题,OpenCode Go 5小时限额直接拉满,sigh)
4、中文写作没有预期提升得那么大,但也很好了
首先是AI口癖大幅减少。写作风格很流畅自然,这一点的体验上,其实和之前的DeepSeek V3.1到V3.2正式版的差异很像。V3.2正式版的文风相较于V3.1以及V3时候的浮夸,其实是更流畅自然的。当然拿到现在来看还是有很多的AI问题,但在当时来说是中文SOTA。DeepSeek V4正式版的文风也有类似的取向,更流畅自然,减少了大量AI凑字数的啰嗦,减少了大量的不是而是等AI口癖,加以适当约束,文笔甚至可以称得上老练和精炼。中文SOTA的线又被拉高了。当然可能有很多人不喜欢这种风格,觉得辞藻华丽、内容啰嗦,但好东西加以适当约束。DeepSeek V4 Pro 正式版也能干出来。
其次是中文写作内容水平好像又提升了,不过我的文学鉴赏水平不够高,能力有限。我让他翻译了一段《追忆似水年华》的内容The first few times we went there, the Sun had just set when we arrived, but there wasstill light: in the garden of the restaurant, they had not yet lit the lamps, and the heat ofthe day was dropping, subsiding, as though into a vase, lining the inner surface of it withthe dim, crystalline transparency of the air, which seemed so firm that a tall rose-bush,veining with pink the darkened wall against which it stood, resembled the arborization to be seen inside an onyx.译文如下我们最初几回去那儿,到达时太阳刚刚落下,但天色仍亮:餐馆的花园里,灯还没有点亮,白昼的热气正在降落、沉积,仿佛坠入一只花瓶,为瓶的内壁衬上一层幽暗而晶亮的空气之透明;这空气显得那样坚实,以致那株高高耸立、以粉红在它所倚靠的晦暗墙壁上布下脉络的蔷薇,竟像是缟玛瑙内里才可见的树状纹理。
btw,作为对比,我也很喜欢Kimi K3的文风。从对指令的理解和内容写作上,我个人觉得Kimi K3略胜一筹。但DeepSeek V4版的文风之多变,对多样文风的掌握之好,我依然欣赏。外加它的价值,从中文写作的角度来说,我还是更喜欢DeepSeek V4 Pro正式版。
5、模型直觉和思考深度,体感上接近GPT-5.6 SOL高到极高我之前写报告的时候,大多还是我出观点,让AI给我填内容。因为AI思考的深度和广度,特别是在某个具体行业领域内,跟我比起来还是差不少。简单点说,我被喂了更多的材料,所以我的直觉更好。
但 GPT 5.6 SOL 在我比较熟悉中一个相对新的领域,思考的能力和深度在直觉上比我强。也让我第一次有了给AI打工的感觉。DeepSeek V4 Pro正式版在这种内容的思考逻辑和深度上,给我的体感是类似的。就是我之前经常念叨的,模型本身聪明。DeepSeek V4 Pro给我感觉就是智商高,之前不好好学习,现在突然好好学习了,就能上清北。海外那几个头部模型给我的感觉也是这样。国内其他的模型给我的大多感觉还是智商中高且努力学习,所以能考上985或者摸到清北的边。
当然,抛开上面所有的内容,我更期待的是DeepSeek Harness。从上面的比较,你们已经可以看出来,使用不同的工具对于DeepSeek的影响非常大。字节Trae和使用Codex,DeepSeek的前端审美一个天上一个地下。也因此,这一批测试里头,绝大部分我是跑在Codex上的。原因倒也简单,这是DeepSeek官方通过一行代码就能支持的。而我相信DeepSeek自己的Harness会比Codex要强上不少。最简单的一个,就是模型不用反复切换。让DeepSeek V4 Pro干规划的活,让Flash干牛马的活,速度快、质量高、体验好。距离DeepSeek自家的Harmony出来也应该没多久了,目前已经能看到一些第三方的测评。真希望明天就能用上啊。



