微信在社媒 X 上正式发布自家的 WeLM 模型线。
本次发布的 WeLM 包含两个规格:WeLM-80B 总参数 80B,每次激活 3B;WeLM-617B 总参数 617B,每次激活 23B,两者都采用 MoE 架构,核心关键词是资源效率。
其中,WeLM-80B 已经应用在微信原生 AI 助手「小微」,可以完成聊天与搜索、调用微信原生功能,以及通过小程序完成订票、点餐、打车等服务任务。而 617B 版本仍在开发,微信目前给出的规划是更强的通用理解、推理,以及智能小程序开发、小微工具生成等复杂任务。
很多人可能以为 WeLM 很陌生,可能是一个微信的新产品。其实,WeLM 这个名字其实可以追溯到 2022 年。
当时微信 AI 团队就发表过《WeLM: A Well-Read Pre-trained Language Model for Chinese》,推出了一款 10B 参数的中文预训练语言模型。因此,这次的 80B / 617B 并非 WeLM 这个名字第一次出现。
不过,目前这个 WeLM 是否和之前的 WeLM 存在架构上的继承关系有待考察。
另外,微信团队此前还基于 WeLM-80B / 617B 探索过 Hidden Decoding,通过固定 Transformer backbone 增加 token 的内部计算。
结合这次公开的信息看,微信这条模型路线关注的重点很清晰:模型能力、资源效率,以及真实产品中的大规模部署。
welm 微信AI 大模型 微信 MoE AI模型 小微 腾讯 LLM





