
阅读导览帮你彻底看懂Bonsai 27B的93压缩幅度怎么做到的还剩多少以及对你意味着什么01 /理解极低比特量化核心原理02 /知道Bonsai 27B真实能力上限03 /看清端侧AI下一波产品方向
一个 270 亿参数的 AI 模型,在 16-bit 精度下要占 54GB。最好的常规 4-bit 构建也要 18GB。
Bonsai 27B(文中简称博赛 27B)的 1-bit 版只有 3.9GB。
54GB → 3.9GB。一座大楼变成一块砖头。而且这块砖头还塞得进一部 iPhone 17 专业版(苹果手机 17 Pro 型号)。纯本地推理,不联网也能用。

这不是概念 Demo。模型已经公开发布,Apache 2.0 协议,你现在就能下载。
但真正的问题是:压缩掉 93%,那个 27B 模型还剩多少本事?
先说结论:数学和编程能力几乎没掉分,工具调用在可接受范围内,视觉能力掉得比较狠。这是第一个能在你手机里独立做多步推理、调用工具、看到你屏幕截图的 270 亿参数模型。
而这个「第一」背后,藏着一个关于模型压缩的十年追问,以及三次关键的技术跨越。
为了让你对 93% 的压缩率有个大致概念(注意这只是粗略推演,非官方数据):如果 GPT-4 级别被压缩 93%,它仍然比任何消费级硬件能装下的模型大。但如果同样的压缩率用在 70B 模型上,它约 10GB——装得进笔记本,不够进手机。Bonsai 在 27B 做到了。怎么做到的?
第 01 章极低比特量化:本质是「换一种数字系统」,而不是普通压缩大多数人理解模型压缩,以为是「把照片从 4K 压成 720P」,精度换大小,细节模糊一点但不影响看。
博赛 做的事完全不同。它不改变文件的存储格式,它改变的是神经网络权重里的数字系统本身。
一个神经网络基本上就是一层又一层的矩阵乘法。每个矩阵元素(叫权重),在标准模型里是一个 16-bit 浮点数:小数点后可以表达非常多级的变化,像一条渐变的色带。54GB 就是这么来的:270 亿个参数 × 2 字节 ≈ 54GB。

博赛 的做法是:把每个权重从「渐变色带」变成三选一或二选一的开关。
Ternary 变体:每个权重只能是 −1、0 或 +1,配合分组缩放因子。有效比特 1.71 位/权重,整模型 5.9GB。适合笔记本。1-bit 变体:每个权重只能是 −1 或 +1,同样是分组缩放。有效比特 1.125 位/权重,整模型 3.9GB。适合手机。听着像是「把高清图变成像素画」,理论上损失应该很大对吧?
实际上,在一套 15 项覆盖知识、推理、数学、编程、指令跟随、工具调用和视觉的基准测试中,Ternary 保留了 95% 的全精度能力,1-bit 保留了 90%。
数学最惊人:GSM8K/MATH-500/AIME25/AIME26 综合从 95.3 降到 93.4(Ternary)和 91.7(1-bit)。编程:88.7 → 86.0 → 81.9。
这个效果不是运气。它来自一个关键设计:整个语言网络端到端走低比特,嵌入层、注意力、MLP、输出头,全部走同一个低比特系统,没有「高精度逃生通道」。这是 PrismML 在博赛 8B 时就验证过的方法论。
同时也来自基座模型的选择。
第 02 章为什么选 通义千问 3.6 27B博赛 27B 基于阿里巴巴的 通义千问 3.6 27B,这是 通义千问家族最新的模型之一。
黑客新闻上有开发者说:
“「通义千问 Qwen 3.6-27B is the best model in that range that I've used for agentic coding by far.」(译:Qwen3.6-27B 是我在这个规模范围内用过的最好的 Agentic 编程模型。)

同一线程里另一位评论者补充:
“「Based on their numbers and cross referencing with the Gemma numbers, this model crushes Gemma 4 12b on math and coding.」(译:基于他们的数据并交叉对比 Gemma 的分数,博赛 在数学和编程上碾压了 Gemma 4 12B。)
通义千问 3.6 系列在工具调用、多步推理和 Agentic 工作流上有刻意优化。PrismML 的量化工具体系正好和这个能力分布互补。量化后保留最好的恰好也是数学和编程,这正是 Agent 工作流最依赖的能力。
一位在折腾本地模型的开发者说出了一个更直白的判断:
“「If you can hide different models of 8GB VRAM requirements each that have those specialties and mix and match them for me without having to manage it manually, I'll be impressed. Until then I will keep using my Claude.」(译:如果你能帮我自动组合各有所长的小模型,而不用我来手动管理,我会服的。在那之前我还是继续用我的 Claude。)
博赛 27B 很棒,但你真正能拿它做什么?
第 03 章当 270 亿参数住进你的口袋PrismML 对「做什么」这个问题有一个很清晰的回答:Agent。
准确的说法不是「手机聊天机器人」,而是「手机上运行的持续 Agent 工作流」。
为什么这个定义重要?因为最值钱的 AI 工作负载正在从单次响应变成持续工作:一个 Agent 一个 Agent 会反复调用工具、携带上下文、看屏幕截图、生成结构化输出再喂给下一步。一个循环可能上百步。

在云端跑这样的循环,每一步都是远程请求,每 100 步就是 100 次网络往返,100 次 Token 计费,中间还有你的私人文件、屏幕截图和数据被上传到远端服务器。
本地执行完全改变了这个等式:
边际成本为零:一百步循环不产生额外 API 费用。数据不离机:你的屏幕截图和文件不需要离开设备。离线可用:没有网络的地方 Agent 也能跑。博赛 27B 能做什么?
一个 demo 展示了它在 iPhone 17 专业版(苹果手机 17 Pro 型号) Max 上被用以多模态 Agent 工作流:识别屏幕截图、处理文档、调用工具、生成代码修改。它运行的是端到端 Hermes Agent 工作流,在 RTX 5090 上实时视频展示。
速度方面:1-bit 变体在 RTX 5090 上最高 163 tok/s(三值版 134 tok/s),在 M5 Max 上 1-bit 达到 87 tok/s。这个速度做对话够用,做高频率 Agent 循环需要缓存和优化——它的 262K Token 上下文和推测解码(Speculative Decoding)就是为此准备的。
你可能觉得 3.9GB 听起来不大,手机随便装。
实际上,手机端的内存限制比存储数字暗示的残酷得多:
一部 12GB 的 iPhone,系统吃掉后 App 实际可用只有约 6GB。这个 6GB 要同时装模型权重、KV Cache 和中间激活值。任何一个 27B 模型的常规量化版本,4-bit 的 18GB、3-bit 的 ~13GB——都远远超过这个预算。
博赛 1-bit 的 3.9GB 是第一个穿过了这扇门的 27B 模型。
这也解释了为什么 PrismML 要同时发布两个变体。这是一个刻意的两段式设计,而非技术妥协:
“三值版(5.9GB):笔记本级别质量,在你日常使用的笔记本上运行。 1-bit(3.9GB):手机级别足迹,适应 iPhone 17 专业版(苹果手机 17 Pro 型号) 的内存预算。
两个变体共享同一个基座,同一个 Tokenizer,同一个视觉塔。开发者可以在不同设备之间无缝切换同一个项目。
第 04 章智能密度:一个正在被重新定义的尺度PrismML 在公告里引入了一个新概念:Intelligence Density(智能密度),每 GB 能承载多少推理能力。
1-bit 博赛 27B(中文名:博赛 27B) 的智能密度达到 0.53 每 GB。对比一下:
全精度基线(54GB):约 0.05 每 GB最佳低比特竞品:约 0.20 每 GB1-bit 博赛 27B:0.53 每 GB:是全精度基线的 10 倍,是竞品方案的 2.7 倍
这个指标它真正在提出一个问题:当我们衡量模型进步时,参数数量还是正确的尺度吗?
一个 270 亿参数的模型,如果只能装进一台数据中心里的 8 卡服务器,它的价值和应用场景是被锁死的。同样的参数,如果塞进你口袋里的手机——它能做的事情完全不一样。智能密度让你看到了参数数量之外的另一条竞争轴。
当然,博赛 27B 也不是没有边界的。
Vision 能力掉得最狠(72.6→59.6),想用它做高精度图像理解会失望。写作风格也没有同类小模型(比如 Google Gemma 4 12B)那么自然。社区实测在小众 SQL 任务和复杂工具链上仍有差距。一位开发者总结了很诚实的体验:
“「This is somewhat akin to the 'one-expert-per-query' solution Apple are using in their small foundation models I think?」(译:这有点像 Apple 在他们的小型基础模型里用的「每查询一个专家」方案。)
博赛 27B 不是一个万能模型。它是一个可以放进口袋的、能独立做 Agent 工作流的模型。这两个限定词一样重要。
第 05 章值得盯住的几个方向博赛 27B 对中文读者的意义可能比英文读者更大。
基座是 通义千问——通义千问 是少数在 Agentic 能力上持续投入的中国模型系列。如果端侧 AI 真的按 博赛 展示的方向走,混合架构(本地跑非前端任务、云端跑最难步骤)成为主流,那 通义千问生态的端侧部署能力将是一个重要的竞争变量。
同时多留意几个正在发生的信号:
PrismML 的团队背景:Caltech 研究团队 + Khosla Ventures、Cerberus、Google、Samsung。模型压缩是他们做了多年的核心课题。他们明确说了「更大模型和全新架构已经在进行中」。智能密度作为竞争维度:如果整个行业接受了这个衡量标准,参数军备竞赛的逻辑会发生变化。模型不再只看「能力上限」,还要看「能力能在哪跑」。混合部署架构的成熟度:博赛 27B 展示的「本地三元/1-bit + 云端前沿模型」的二分法是未来 12-24 个月最可能被广泛采用的产品架构。深度模型蒸馏和精细化量化技术路线还在快速发展迭代中,值得关注未来的具体工程进展和行业落地效果。最后回到那个数字:
一个 270 亿参数的模型,3.9GB,塞进了手机。
第一代计算机填满房间。第三代填满桌子。上一个十年它们住进我们的口袋。现在,270 亿参数的推理能力正在走同样的路。这不是 2026 年最酷的技术新闻。这可能是这个十年中期的一个工程锚点,几年后再回头看,你会记得自己是哪一天第一次听说这件事的。