DC娱乐网

从140GB压缩至8GB,手机运行700亿大模型分三步 70B大模型半精度原

从140GB压缩至8GB,手机运行700亿大模型分三步

70B大模型半精度原始文件达140GB,而12GB旗舰手机扣除系统占用后,仅约8GB内存可供给模型推理,直接压缩会严重损毁模型能力,行业依靠三层技术组合实现落地。

第一步是结构化剪枝瘦身。随机稀疏剪枝会造成移动端算力空转,团队改为整体裁剪冗余网络层与通道,剔除44层冗余结构、减半隐藏通道维度,将70B模型精简至28B,体积降至56GB,但模型推理能力近乎腰斩。

第二步依托知识蒸馏修复精度。以原版70B大模型为“教师”,通过概率分布对齐、隐藏层特征匹配,搭配海量思维链数据微调28B轻量化模型,最终恢复原模型88%-92%的核心对话、逻辑推理能力。

第三步采用AWQ激活感知量化极限压缩。普通低比特量化易生成乱码,AWQ区分权重重要性,仅对1%关键通道高精度保留,其余参数采用2bit存储,平均单参数2.25bit。28B权重文件压缩至7.875GB,叠加量化元数据总大小8.32GB,适配手机内存上限。

实测高端移动端芯片可实现每秒9-18字生成速度,满足日常交互。该方案存在短板:冷门知识、小众代码准确率下降,持续推理会拉高功耗、机身升温降频。整套剪枝-蒸馏-量化技术,实现70B级大模型本地手机部署。