DeepSeek 为李思Flash装上眼睛
做AI开发的朋友注意了,DeepSeek这次藏了个很少人真正看懂的狠更新,直接把多模态Agent的门槛给踩碎了。
很多人刚刷到消息还以为,它就是给V4 Flash加了个普通的看图功能,完全没摸到这次升级的核心。
这次根本不是什么“上传图片AI随便写两句点评”的常规操作,是真的给之前只能处理文字的V4 Flash,硬生生装上了一双能独立干活的眼睛。
搞开发的都知道,之前的V4 Flash有多猛:文本推理、代码生成、工具调用,全是第一梯队的水平。
但它有个所有人都头疼的致命短板:所有信息只能从文字里读。
想让它分析报表?行,你得先把截图里的表格转成文字,一行行喂给它,但凡漏个数字,它算出来的结果直接就歪了。
想让它操作个软件界面?更不可能,它连按钮在哪都看不见,全靠你用文字描述半天,稍微说不清楚就彻底跑偏。
这次升级直接把视觉模块焊死在了它的执行逻辑里。
不是把图片当成一个额外的输入扔给它,是让“看画面”变成它干活流程里的本能步骤。
举个最直观的例子:
以前你发一张销售报表截图给AI,它得先调用OCR把图转成文字,再对着文字给你算同比环比,中间转译出点错,结果直接全废。
现在你啥额外操作都不用做,直接把图甩过去,它自己扫一眼就能抓全表格里的所有数字,看懂折线图的涨跌趋势,甚至能自己发现哪行数据标红有异常,转头就调用分析工具给你出完整的复盘报告。
全程不用你中间转任何格式,它自己看,自己判断,自己动手干。
官方这次把它叫做Vision Mixup实验版本,属于V4 Flash的能力扩展。
最良心的是什么?
原来大家最担心的,加了多模态之后原来的文本能力会不会拉胯?
官方直接拍板:原有文本、代码、工具调用的能力一点没砍,测试成绩和之前完全持平,多模态Agent的专项测试分反而涨了一大截。
更绝的是成本。
图片折算成Token计费,直接沿用原来V4 Flash的调用定价,开发者接入几乎不会增加额外负担。
这波真的是降维打击。
你去看市面上绝大多数做多模态的大模型,本质上都停留在“你发图我给你描述内容”的阶段。
就像个刚学会认东西的小孩,看完图只能张嘴告诉你“这是一张表格,里面有很多数字”,你不接着下指令它就啥也不会干。
DeepSeek这次直接跳了级。
它的AI看完画面之后,是能主动行动的。
看见界面上的按钮,它知道点哪里;看见图纸上的标注,它知道对应要改哪行代码;看见屏幕上的报错弹窗,它知道该调用什么工具去修复。
相当于之前AI只能听你念指令干活,现在它直接站在你旁边,盯着你的屏幕看,你说个目标它就知道该干啥。
之前很多想做自动化Agent的开发者,被“信息必须全部转成文字喂给AI”的门槛卡了不知道多久。
这次升级一出来,相当于直接把这道墙给拆了。
以后你想做个自动办公的AI助手,根本不用费劲把所有界面元素都做文字适配,AI自己盯着屏幕看两秒就全懂了。
从自动处理报表,到自动操作软件,甚至是对着实拍画面做巡检、做数据分析,之前很多想都不敢想的Agent场景,现在随手就能搭出来。
说句实在的,这波更新之后,AI能替咱们打工人干的重复活,真的要比之前多太多了。
你们觉得这个功能最先会在哪个场景爆火?



