
今天,7月21号。
阿里发布了它最强的图像模型,Qwen-Image-3.0,接下来,估计你会看到一大堆实测;发布会官方的关键词,就一个字:实;内容丰实、细节真实、知识厚实;三个词,阿里自己给的答案。
但我想退一步,先问一个问题:图像模型发展到今天,到底在比什么?
搞懂这个,比看一场花里胡哨的演示重要得多。
为什么这么说?
过去几年,你对AI生图的印象,大概还停在「画得像不像、美不美」这一层。手指头画对了没,光影真不真实,AI味重不重。
这套比赛规则里,图像模型是个画师,考画功。可这场发布会,阿里声称的所有升级,指向的都不是画功。
是另一个指标:一张图里,能装下多少东西。
说一个最直观的数字。提示词长度。上一代Qwen-Image-2.0,一次最多吃进去1K token的指令。3.0直接拉到了4.5K。翻了4.5倍。
这意味着什么?
过去你给图像模型下指令,只能压成一句话。现在你可以像给设计师写需求文档一样,把画面结构、文字内容、排版细节,完整地写进去。
发布会现场演示的一条提示词,3700个token,折合约13000个字符。什么概念?一份小型说明书的体量。
这份说明书生成了什么?
一张九宫格。九个格子,九个不同学科的知识图解。数学公式、几何图形、逻辑推导,各画各的,互不串门。一条指令,一次生成。
作为对照,现场把同一条提示词喂给了2.0;超出1K限度之后,模型就开始「胡字」,连九宫格的框都排错了位置。
另一组演示往纵深走,让模型生成一个VSCode编程界面,界面里打开着千问App,App的聊天窗口里躺着一张手冲咖啡海报。
三层界面套娃,每一层的结构和风格都要对,最里层海报上的文字还得清晰可辨。
官方演示里,手机截图上的时间数字,小到只有10个像素,现场还把一张YouTube界面图放大20倍来看,这些字小到只占原图的1%,字字可辨。
把这些演示摆在一起,动作是同一个:
往一张图里塞进更多的东西。更长的指令、更多的画面、更深的嵌套、更小的字;塞进去,还要保证每个字都是对的。
这就是「实」的人话版本:信息密度;图像模型比赛项目,正在从「画得好不好」,换成「装得下,装不下」。
......
问题来了:一张图塞这么满,给谁看?谁买单?
这就要算一笔账了,图像模型这门生意,主流模式简单到有点原始:按产出量。
我查了一下现在市面上的计费方式。国内厂商的图像API,普遍按张收费,生成一张收一张的钱。
OpenAI的GPT-Image-2按token计费,产出的图越多越大,token烧得越多。名目不同,骨架是同一副:客户为产出的量买单。
阿里的3.0目前还在公测申请阶段,没有定价;不过,记住「按量收钱」这四个字。我们再回头看发布会上一个不起眼的案例。
讲商业化的架构师举了短剧行业:
过去客户做一部短剧的前期素材,人设图、场景图、每个镜头的分镜图,要一张一张生成,几十张起步。现在这些元素可以融在一张图里,一次出完。
官方的原话:过去生成几十张图的事,今天一张搞定。
这笔账发布会没有算下去,我替它算完;按量计费的模式下,几十张变一张,客户这个环节的账单就压到了原来的几十分之一,单价一分没动,客户掏的钱少了一个数量级。
这不是短剧一个行业的特例。
讲到办公场景时,同一位架构师又算了一笔时间的账:过去自己调一个复杂的PPT页面,字号、字距、排版一处处抠,要半小时甚至一小时,用3.0生成,最快半分钟。
张数的账、时间的账,算的是同一件事:图的信息密度越高,客户为一份可用素材付出的成本就越低。

C端是同一个逻辑的零售版。
发布会上,千问App的产品经理举的例子是手帐和社媒封面;过去要找模板、挑图、拼字、调排版,做到一半就想放弃。现在一句话丢给模型,文字、排版、贴图一次成型。
企业省账单,个人省那个熬夜拼图的晚上,这大概就是信息密度在商业上的真实身份:一种不打价格战的降价。
直接降单价是价格战,人人都会,也人人都伤,把降价做成技术能力就不一样了:一张图装得下九张图的内容,等于用一张的价格卖九张的货。
而这个折扣,只有装得下的模型给得起,想给同样折扣的对手,得先把4.5K token的长指令、互不干扰的排版这些能力做出来。
降价,被做成了门槛。
这也解释了为什么发布会把GPT-Image-2挂在嘴边。那是目前公认的天花板,也是把文字渲染、信息图当主打能力的模型。
两家瞄着的是同一个方向:图不再是画,可以直接商用的信息载体。
方向对不对,市场用脚投票;各家走到哪一步,得看第三方的尺子。
这里如实交代一句:阿里闭源旗舰没有上过第三方盲测榜,今天「仅次于GPT Image」的信息,来自自家评测,毕竟还没放出来。
但这笔降价的账,往下多想一步,会碰到一个悬着的问题:
按量计费的生意,收入等于单价乘以量;信息密度把客户要买的量压掉一个数量级,单价又没人敢涨。这门生意的收入,以后从哪里长出来?我不知道。
能确定的只有一件事:这个能往图里塞东西的本事,正在变成竞争的胜负手。
......
既然是胜负手,为什么偏偏只有这几家能做到?因为回头看那些演示,考的都不是画笔。
把10个像素的字写对,考模型认不认识这个字。九个学科各画各的、互不串门,考它知不知道对数函数长什么样、蜻蜓的翅膀分几节。
三层界面套娃不乱,考它捋不捋得清「界面里的App里的聊天窗里的海报」这种嵌套关系;这些能力拼在一起,有一个统一的名字:语言模型的能力。
文字渲染、世界知识、长指令理解、逻辑结构,没有一样是传统图像模型的看家本领,全是从大语言模型那边外溢过来的。
外溢还有一个更直接的证据:编辑。
这一代模型把生图、编辑做进了同一个架构。官方的说法是,文生图里积累的文字渲染、细节质感和世界知识,会自然迁移到编辑场景。
所以,你能看到古画修复前后文字不丢、手绘草图直接转成PPT这类演示;能迁移,说明这些本事长在底下那个理解世界的模型里。
另外,线上发布时,有一句话值得单独摘出来。
演示九宫格时,技术负责人说,这个case试了目前市面上的模型,只见到两个能做到;一个是千问3.0。另一个他没点名,语境里指向GPT-Image-2。
注意这两家,都是先把语言模型做进第一梯队,再回头做图像的公司。
牌桌上剩下这两位,不是巧合,图像模型的门槛,已经挪到了语言那一侧。
发布会的结尾也在往同一个方向指,外部嘉宾被问到还期待什么,他说:「我发一张图给你,你捣鼓完直接返我十张能用的。」
技术负责人接的词是agentic image generation。他管这叫三思而后行:一思用户意图,二思收集素材,三思整合统筹。最后才轮到生成。
四步里,前三步全是语言模型的活;生成,那个我们以为的主角,排在最后一步。
我翻了翻这条产品线的发布记录,商业身段的变化也对得上。
1.0在2025年8月发布时是开源的,那是千问递给开源社区的一张名片;2.0起,旗舰不再开源。到今天的3.0,直接走API公测申请。
开源线没有断,早先的编辑模型至今仍是开源阵营里最能打的,只是旗舰收进了柜台。
会画图的模型,开源社区里已经不稀缺了;会读需求文档的模型,稀缺,收进柜台的是后者。
90分钟的发布会,讲一个图像模型,拆到最后,图像可能只是入口,一个「实」字背后,是提示词变成需求文档,一张图当九张图卖,是画画的本事让位给读题的本事。
再往前一步,问题就变成了:
当塞图的能力全部来自语言,图像模型还是一个独立的物种,还是语言模型的一个输出头?
这个问题很有意思。不过看演示的方向,阿里自己可能也在思考。它只是把每一步都往「更实」的方向踩,踩到哪算哪。
我先把我听到、理解后的思考发出来;回头体验一下,也许会有新想法。