【26B大模型塞进2GB内存:Mac用户的“空间折叠”黑科技】开发者drumih推出的TurboFieldfare项目实现了在8GB内存的Mac上流畅运行Gemma 4 26B-A4B模型。核心逻辑是“按需取用”:它只将1.35GB的核心权重和KV缓存驻留内存,而将庞大的专家模型权重留在SSD中,仅在每生成一个Token需要特定“专家”时,才通过并行pread方式从硬盘瞬时抓取。这种设计让原本需要14GB显存的模型,在2GB内存预算下也能跑起来,M2 Air实测速度约5-6 tok/s,而M5 Pro则能飙到30 tok/s以上。这件事的重要性在于它打破了“大模型必须堆显存”的暴力美学,把AI推理从硬件军备竞赛拉回了软件工程的精细化治理。底层逻辑利用了MoE(混合专家模型)的稀疏性——既然每次只有一小部分参数在工作,为什么要让90%闲置的参数霸占昂贵的内存?虽然这种“空间换时间”的策略依赖极高的SSD读取速度(如M5芯片的IO优势),但它为普通用户运行超大模型提供了一条极具性价比的路径。这也预示着未来本地AI的胜负手可能不在内存大小,而在硬盘带宽与缓存算法的进化。 github.com/drumih/turbo-fieldfare
