DeepSeek刚给Flash加上眼睛:多模态视觉模型上线,做AI Agent的成本又降了一档
8月21日,DeepSeek上线了一个实验性模型:DeepSeek-V4-Flash-Vision-Exp。
名字很长,但核心就一句话:给Flash模型加上了图片理解能力,价格跟原来的Flash一样。
这意味着什么?
以前做多模态Agent,视觉输入贵、接口不统一、截图理解不稳定。现在你可以用同一个模型读取截图、图表、界面元素,再交给Agent处理。图片按token计费,每张最多384 token,跟文本一个价。
几个实际用法:
让Agent看截图自动填表单
解读数据图表生成分析报告
看懂界面元素后执行自动化操作
批量处理图文混合检索
还有个Files API免费开放,同一张图上传一次就能反复引用,不用重复传输。
不过注意"实验性"三个字——官方建议先拿10-50个真实样本测试,对比错误类型和成本,别急着上生产。
多模态Agent的竞争,正在从"能不能看图"变成"看得便宜、接得顺、能不能进工具链"。
做AI应用的朋友,这个可以试起来了。
