如果限定为 “2026 年已经存在的芯片/内存技术,做成手机大小的厚板设备;不考虑成本、电池和散热”,我会把它做成一台 Pocket AI Workstation,而不是传统手机。
我会这样堆
部件极限方案SoCNVIDIA GB10 Grace BlackwellCPU20 核 ARM:10×Cortex-X925 + 10×A725GPUBlackwell,6144 CUDA Core + 第五代 Tensor CoreAI 算力最高约 1 PFLOP FP4(稀疏)内存128GB LPDDR5X 统一内存内存通道16 通道 / 256-bit内存带宽273GB/sSSD4TB PCIe 5.0 M.2 2230SSD速度约 11GB/s 读、9.3GB/s 写系统Linux / DGX OS + CUDA + TensorRT-LLM / vLLM / llama.cpp
GB10 已经是真实量产方案。NVIDIA 的 DGX Spark 就使用它,官方规格是 128GB 统一内存、273GB/s、20 核 ARM CPU、最高 1 PFLOP FP4,并明确支持最高约 200B 参数级模型。(NVIDIA Docs)
现在真正的 DGX Spark 是 150×150×50.5 mm,明显比手机宽;但如果把散热器、电源、接口、外壳全部拿掉,重新做双面主板,目标做成类似 170×80 mm 的厚手机/掌上砖块是比“把台式显卡塞手机”现实得多的方向。这一点属于工程推演,并不是 NVIDIA 已经有这种手机产品。
SSD甚至已经有非常适合这种设备的东西:Micron 3610 做到了单面 M.2 2230、4TB、PCIe 5.0,顺序读取约 11GB/s、写入约9.3GB/s。(美光科技)
如果主控和 PCIe 通道允许,我甚至会放:
2×4TB 2230 = 8TB
做 RAID 0。不过这属于定制主板方案;目前 GB10 商用品直接验证比较成熟的是 4TB NVMe。(NVIDIA 市场)
128GB 到底能装多大模型?
Q4 粗略计算非常简单:
参数量 × 0.5 Byte
实际还需要量化元数据、运行时、视觉编码器、KV Cache,因此必须留余量。
模型规模纯 Q4 权重大约128GB GB109B4.5~6GB✅ 随便跑14B7~9GB✅32B16~20GB✅70B35~45GB✅ 很舒服120B60~75GB✅200B100~120GB⚠️ 极限235B118GB+⚠️ 基本没 KV 空间671B335GB+❌
所以这种“手机”最有意义的地方不是跑 9B。
而是:
在巴掌大的设备里,本地塞进去一个 70B~120B 级模型。
具体能跑什么
你前面一直说的 Qwen3.5-9B Q4,当然轻松。
而且可以同时装:
Qwen3.5-9B VLM + Whisper/ASR + TTS + 向量数据库 + 本地 Agent
128GB 内存根本不会紧张。
实时视频方面:
MiniCPM-o 4.5 9BQwen 7B/9B 级 VLM实时摄像头理解 + ASR + TTS
都属于很轻松的负载。
甚至 32B 级多模态模型也有非常大的内存余量。
70B 级也没问题
例如:
Llama 3.3 70B Q4DeepSeek-R1 Distill 70B以及其他 70B 左右的量化模型。
NVIDIA 自己的 DGX Spark 文档就明确给出了单台 128GB Spark 运行 Llama-3.3-70B 的方案。(NVIDIA NIM)
70B Q4 假设占 40GB:
128GB - 40GB ≈ 88GB
剩下空间还能拿来放巨大的 KV Cache、视觉模型、ASR、TTS。
甚至 120B 都已经实测了
这不是纸面“能加载”。
NVIDIA 官方 DGX Spark 实测:
模型精度输出速度Llama 3.1 8BNVFP438.65 tok/sQwen3 14BNVFP422.71 tok/sQwen2.5-VL-7BNVFP441.71 tok/sGPT-OSS-20BMXFP482.74 tok/sGPT-OSS-120BMXFP455.37 tok/s
(NVIDIA Developer)
这里特别有意思:
120B 居然可以 55 tok/s。
原因是不能只看“总参数量”,MoE 每生成一个 token 并不是把全部 120B 参数都参与计算。
所以未来这种掌上设备非常适合 大 MoE 模型。
但 Qwen3.5-9B,你的 5070 Ti 反而更快
这点非常重要。
GB10:
128GB 内存273GB/s
你的 RTX 5070 Ti:
16GB GDDR7约 896GB/s
因此对于能够完全塞进 16GB 显存的 9B Q4 小模型:
5070 Ti 很可能明显快于 GB10。
你之前那台 5070 Ti 跑 Qwen3.5-9B 如果做到约 100~120 tok/s,完全合理。
而 GB10 的价值是:
5070Ti:
9B ✅14B ✅32B ⚠️70B ❌
GB10 128GB:
9B ✅32B ✅70B ✅120B ✅200B ⚠️
所以它不是“小模型速度怪兽”,而是:
掌上大模型容量怪兽。
如果我要设计“终极 AI 手机”
我反而不会追求传统手机 SoC。
会设计成:
7 英寸 OLED+GB10 Grace Blackwell+128GB 统一内存+4~8TB NVMe+Linux+Android 虚拟化层+摄像头+麦克风+5G/Wi-Fi
然后整个系统常驻:
9B 实时视觉模型+ASR+TTS+70B/120B 主推理模型+本地 RAG+Agent
日常摄像头、语音让 9B 模型实时处理;遇到复杂问题再调用本地 70B/120B。
这已经不是“AI 手机 App”了,而是真正的:
口袋里的完全离线 AI 服务器。
还有一个更疯狂的方向:如果不限制使用“现成能塞进去的芯片”,而允许专门设计 SoC,那么我会把目标直接定到 256GB 统一内存 + ≥500GB/s 带宽。那样 200B Q4 都能比较舒服地运行,甚至可以挑战更大的 MoE;但截至现在,这就属于定制芯片设想,而不是可以买到的手机级硬件。
顺带一提,如果彻底取消“手机大小”限制,现在 Apple 的 M5 Ultra 已经做到 512GB 统一内存 + 1.2TB/s 带宽,Apple 明确说可以本地运行数千亿参数的大模型。(Apple) 这其实已经把“未来超级 AI 手机应该往哪里发展”展示得很清楚了:不是单纯堆 TOPS,而是大容量、高带宽统一内存。
by ChatGPT