大家好,欢迎收听每日一分钟AI。
今天聊一个"补齐短板"的故事。你可能用 DeepSeek 聊过天,但很长一段时间,它是"看不懂图"的——你给它发张截图,它只能干瞪眼。
就在这几天,情况变了。DeepSeek 上线了第一个能"看"的模型,叫 V4-Flash-Vision-Exp。它能干三件特别实用的事:给你描述一张照片、把截图里的文字读出来、看懂复杂的图表。
有意思的是,它的"眼睛"几乎不加价。我们知道,AI 看图片通常是按"词元"收费的,一般比纯文字贵。但这个模型看一张图,最多只算 384 个词元,折算下来,高峰期看一张图还不到一分钱。所以有人开玩笑说,DeepSeek 是把"视力"当成赠品送了。
那它的"眼神"到底好不好?官方甩出了一串测试分,最抓眼球的是——在几项"既会看图、又会干活"的测试里,它第一次反超了业界顶尖的 Opus 4.8。比如一个叫 ZeroBench 的考试,它拿 35 分,Opus 4.8 是 34 分;还有个"Agent 毕业考",它 27.3 对 25.7。当然,整体水平还只是"接近"而不是"全面超越",官方也很克制,明确说这只是个"实验版",不建议急着上生产环境。
说到底,这件事的意义,不只是多一个会看图的模型。而是 AI 正在从"会聊天",进化成"看得见、干得动"的助手——你甩给它一张图,它就能替你干活。这条路,正在越走越快。
明天见!
---
📌 本期关键词:DeepSeek 多模态 视觉模型 Agent Opus4.8
📌 参考来源:DeepSeek官方文档、智东西、IT之家、凤凰科技、澎湃新闻

