DC娱乐网

DeepSeek这次上视觉模型,我觉得最大的信号不是“又多了一个模型”,而是多模

DeepSeek这次上视觉模型,我觉得最大的信号不是“又多了一个模型”,而是多模态这条赛道真的开始卷了。

文本模型大家已经卷了很久,现在竞争正在往下一层走:谁能看懂现实世界,谁能把看到的信息真正用起来。V4-Flash-Vision-Exp目前还是实验性质,但纯文本能力保持V4-Flash正式版水平,同时在视觉理解相关Agent测试上明显提升,官方披露的多模态Agent能力已经接近Opus-4.8。

我反而挺期待后面的正式版。因为一旦视觉、语言、工具调用真正揉到一起,AI的使用方式可能会变得完全不一样。以后我们给AI的输入,可能不再是一句话,而是整个屏幕、整个文件夹,甚至整个现实世界。

这才是多模态真正值得期待的地方。

DeepSeekV4视觉模型上线