重磅更新,DeepSeek多模态模型现已正式发布
今天下午DeepSeek这波速度有点快。
几个小时前,社区才从DeepSeek Harness的代码里扒出一个此前没见过的名字,deepseek-v4-flash-vision-exp。当时外界还在猜,DeepSeek是不是准备给V4 Flash补上原生视觉能力。相关代码已经给图片输入铺好了路,但模型还没有出现在正式目录里。
结果现在已经有开发者开始通过API调通了。
模型名称就是 deepseek-v4-flash-vision-exp,从名字也能看出来,目前还是实验版本。DeepSeek官方更新日志在我查询时暂时还停留在8月13日的V4 Pro,正式公告和完整技术细节应该还在路上。
目前流出的评测里,它在Terminal Bench 2.1拿到83.9,NL2Repo 57.7,DeepSWE 59.3。更值得看的其实是视觉Agent相关测试,加入图片理解以后,相比原来的V4 Flash提升非常明显,部分多模态Agent能力已经开始逼近Claude Opus 4.8。
这也和DeepSeek这几天的动作对上了。
最新几版DeepSeek Harness一直在补图片输入、图片上下文保存、Agent任务里的多模态传递。之前我还觉得这像是在提前给视觉模型「留接口」,现在看,接口后面的模型是真来了。Harness项目本身也仍在快速迭代。
我觉得这次最值得注意的,不只是DeepSeek终于能「看图」。
而是它依然把多模态往 Agent 上靠。
不是单独做一个会识图、描述图片的视觉模型,而是让模型看到截图、图表、网页和GUI以后,继续调用工具、写代码、完成任务。
这就很DeepSeek了。
眼睛终于装上了,但目的好像还是为了干活。
目前模型刚刚放出来,正式技术报告、价格细则以及完整Benchmark还要等DeepSeek官方公告。重磅更新 DeepSeek 多模态 多模态大模型 DeepSeek多模态 深度求索


