DC娱乐网

阿里多模态大模型全面跻身全球第一梯队

过去一个月,阿里巴巴模型发布全面提速。大语言、图像、语音、视频、音乐五大类模型密集完成重要版本迭代,性能均跻身国际第一梯队。

大语言模型领域,千问团队发布了新版本,在SuperCLUE、MMLU等主流榜单中稳居第一梯队。图像生成模型通义万相升级到3.0版本,在图像质量、语义理解、风格多样性等维度上对标Midjourney、Stable Diffusion最新成果。视频生成模型Wan 3.0将单次生成视频上限拉到30秒,支持多格式文档输入,在真实感、稳定性、一致性上明显优于同类国产模型。

语音和音乐方向,阿里发布了语音合成模型CosyVoice 2.0,支持多语种、多情感、多音色合成。音乐生成模型通义听悟上线专业级功能,能生成完整编曲和带人声的歌曲,被音乐制作人群体大量采用。

密集迭代的另一面,是模型能力与云基础设施形成更紧密的联动。2027财年Q1,阿里云外部商业化收入增速提升至45%,创下22个季度新高,其中AI相关收入连续七个季度保持三位数增长。

多模态被业内人士评价为“下一代智能的范式”。阿里在多模态上的布局节奏,远比市场感知的要快。当其他厂商还在卷大语言模型的参数时,阿里已经在用视频、语音、图像、音乐的矩阵,把AI的感知能力全面铺开。

#科技资讯早知道 #科技 #大厂 #讨论 #热点 #阿里 #人工智能