DC娱乐网

AI长齐眼睛和耳朵,开会那堆视频录音它能一次吃下

干了20年软件这行,我最怕的不是改bug,是"拼材料"。 一个会开完,桌面上堆一堆东西:PPT截图、会议录音、聊天记录、
干了20年软件这行,我最怕的不是改bug,是"拼材料"。
一个会开完,桌面上堆一堆东西:PPT截图、会议录音、聊天记录、几段录屏。要把这堆东西理成一个判断、一份纪要,我得在好几个工具之间来回切。这不是技术活,是体力活,还特别容易漏东西。
四种信息 一个脑子
9月18日,阿里千问上线了个新模型 Qwen3.8-Omni-Flash。名字不重要,重点是它干的这件事:一个模型,同时吃下文本、图片、音频、视频四样东西,上下文能拉到 1M(约一百万个 token)。
这可能是我最近看到少有的、对普通上班族有实感的一次更新。下面说理由。
第一,它是"一个能干的",不是"几个能干的"。以前的多模态模型,说到底是分开的——处理视频走一条路,处理录音走另一条路。你要让AI看一段视频还得听清里面人说话,往往要拆成几步、调好几个接口。
千问这次的定位很清楚:把全模态模型从"看懂内容",往前推一步,到"规划任务、调用工具、把活干完"。
官方给的数据摆在这:
30项评测,比上一代 Qwen3.5-Omni-Plus 平均得分提升超过26%;音视频Agent、Coding、长程任务这些偏"干活的"能力,涨得更明显;音频能力整体超过了 Gemini 3.8 Flash。(来源:千问官方发布记录、腾讯新闻、新浪财经,2026-09-18)

第二,也是我真正看重的——降价,不是降一点,是砍到零头。按官方口径,音频输入 API 价格降幅超过98%,音视频输入降幅超过93%。
我为什么盯着价格不放?因为我太清楚"全模态"这种东西过去有多贵、多难养。
十几年前做 ERP 实施,我见过企业为了让系统"能听会说",单独采购语音识别、OCR、视频分析,一样样拼、一样样维护。买得起是一回事,养得起是另一回事。不少功能最后烂尾,不是没用,是用不起。
今天这个模型把图、声、像装进一个大脑,价格还打到上一个零头。意味着"让AI看视频、听录音",从企业级的高档配置,变成了随手能用的普通功能。

第三,实时版多了个"听声辨位",这是个细节,但不是小细节。把一段多人的会议录音丢进去,它能分清谁在说话、大概什么方位。这背后是"多通道空间音频"在起作用。对天天开会、会后要整理纪要的人,这比"提升26%"更实在。
最后说点我的判断。
AI 的能力边界在往后撤,但"把活说清楚"这关往前顶了。以前是工具不够能,现在是工具太能——你把一堆会议材料丢进去,它给你出纪要;你丢一段长视频,它给你出报告。可它出的东西对不对、是不是你要的,还得你自己有一双看得懂的眼睛。
工具补齐了感官,脑子这关,还是得人自己过。
你现在手头有没有那种"图文声像混在一起、理起来特别费劲"的活?留言说说,我看能不能用这类全模态模型,帮你排一个省事的顺序。