DC娱乐网

如果限定为 “2026 年已经存在的芯片/内存技术,做成手机大小的厚板设备;不考虑成本、电池和散热”,我会把它做成一台 Pocket AI Workstation,而不是传统手机。 我会这样堆 部件极限方案SoCNVIDIA GB10 Grace BlackwellCPU20 核 ARM:10×Cortex-X925 + 10×A725GPUBlackwell,6144 CUDA Core + 第五 ​

如果限定为 “2026 年已经存在的芯片/内存技术,做成手机大小的厚板设备;不考虑成本、电池和散热”,我会把它做成一台 Pocket AI Workstation,而不是传统手机。

我会这样堆

部件极限方案SoCNVIDIA GB10 Grace BlackwellCPU20 核 ARM:10×Cortex-X925 + 10×A725GPUBlackwell,6144 CUDA Core + 第五代 Tensor CoreAI 算力最高约 1 PFLOP FP4(稀疏)内存128GB LPDDR5X 统一内存内存通道16 通道 / 256-bit内存带宽273GB/sSSD4TB PCIe 5.0 M.2 2230SSD速度约 11GB/s 读、9.3GB/s 写系统Linux / DGX OS + CUDA + TensorRT-LLM / vLLM / llama.cpp

GB10 已经是真实量产方案。NVIDIA 的 DGX Spark 就使用它,官方规格是 128GB 统一内存、273GB/s、20 核 ARM CPU、最高 1 PFLOP FP4,并明确支持最高约 200B 参数级模型。(NVIDIA Docs)

现在真正的 DGX Spark 是 150×150×50.5 mm,明显比手机宽;但如果把散热器、电源、接口、外壳全部拿掉,重新做双面主板,目标做成类似 170×80 mm 的厚手机/掌上砖块是比“把台式显卡塞手机”现实得多的方向。这一点属于工程推演,并不是 NVIDIA 已经有这种手机产品。

SSD甚至已经有非常适合这种设备的东西:Micron 3610 做到了单面 M.2 2230、4TB、PCIe 5.0,顺序读取约 11GB/s、写入约9.3GB/s。(美光科技)

如果主控和 PCIe 通道允许,我甚至会放:

2×4TB 2230 = 8TB

做 RAID 0。不过这属于定制主板方案;目前 GB10 商用品直接验证比较成熟的是 4TB NVMe。(NVIDIA 市场)

128GB 到底能装多大模型?

Q4 粗略计算非常简单:

参数量 × 0.5 Byte

实际还需要量化元数据、运行时、视觉编码器、KV Cache,因此必须留余量。

模型规模纯 Q4 权重大约128GB GB109B4.5~6GB✅ 随便跑14B7~9GB✅32B16~20GB✅70B35~45GB✅ 很舒服120B60~75GB✅200B100~120GB⚠️ 极限235B118GB+⚠️ 基本没 KV 空间671B335GB+❌

所以这种“手机”最有意义的地方不是跑 9B。

而是:

在巴掌大的设备里,本地塞进去一个 70B~120B 级模型。

具体能跑什么

你前面一直说的 Qwen3.5-9B Q4,当然轻松。

而且可以同时装:

Qwen3.5-9B VLM + Whisper/ASR + TTS + 向量数据库 + 本地 Agent

128GB 内存根本不会紧张。

实时视频方面:

MiniCPM-o 4.5 9BQwen 7B/9B 级 VLM实时摄像头理解 + ASR + TTS

都属于很轻松的负载。

甚至 32B 级多模态模型也有非常大的内存余量。

70B 级也没问题

例如:

Llama 3.3 70B Q4DeepSeek-R1 Distill 70B以及其他 70B 左右的量化模型。

NVIDIA 自己的 DGX Spark 文档就明确给出了单台 128GB Spark 运行 Llama-3.3-70B 的方案。(NVIDIA NIM)

70B Q4 假设占 40GB:

128GB - 40GB ≈ 88GB

剩下空间还能拿来放巨大的 KV Cache、视觉模型、ASR、TTS。

甚至 120B 都已经实测了

这不是纸面“能加载”。

NVIDIA 官方 DGX Spark 实测:

模型精度输出速度Llama 3.1 8BNVFP438.65 tok/sQwen3 14BNVFP422.71 tok/sQwen2.5-VL-7BNVFP441.71 tok/sGPT-OSS-20BMXFP482.74 tok/sGPT-OSS-120BMXFP455.37 tok/s

(NVIDIA Developer)

这里特别有意思:

120B 居然可以 55 tok/s。

原因是不能只看“总参数量”,MoE 每生成一个 token 并不是把全部 120B 参数都参与计算。

所以未来这种掌上设备非常适合 大 MoE 模型。

但 Qwen3.5-9B,你的 5070 Ti 反而更快

这点非常重要。

GB10:

128GB 内存273GB/s

你的 RTX 5070 Ti:

16GB GDDR7约 896GB/s

因此对于能够完全塞进 16GB 显存的 9B Q4 小模型:

5070 Ti 很可能明显快于 GB10。

你之前那台 5070 Ti 跑 Qwen3.5-9B 如果做到约 100~120 tok/s,完全合理。

而 GB10 的价值是:

5070Ti:

9B ✅14B ✅32B ⚠️70B ❌

GB10 128GB:

9B ✅32B ✅70B ✅120B ✅200B ⚠️

所以它不是“小模型速度怪兽”,而是:

掌上大模型容量怪兽。

如果我要设计“终极 AI 手机”

我反而不会追求传统手机 SoC。

会设计成:

7 英寸 OLED+GB10 Grace Blackwell+128GB 统一内存+4~8TB NVMe+Linux+Android 虚拟化层+摄像头+麦克风+5G/Wi-Fi

然后整个系统常驻:

9B 实时视觉模型+ASR+TTS+70B/120B 主推理模型+本地 RAG+Agent

日常摄像头、语音让 9B 模型实时处理;遇到复杂问题再调用本地 70B/120B。

这已经不是“AI 手机 App”了,而是真正的:

口袋里的完全离线 AI 服务器。

还有一个更疯狂的方向:如果不限制使用“现成能塞进去的芯片”,而允许专门设计 SoC,那么我会把目标直接定到 256GB 统一内存 + ≥500GB/s 带宽。那样 200B Q4 都能比较舒服地运行,甚至可以挑战更大的 MoE;但截至现在,这就属于定制芯片设想,而不是可以买到的手机级硬件。

顺带一提,如果彻底取消“手机大小”限制,现在 Apple 的 M5 Ultra 已经做到 512GB 统一内存 + 1.2TB/s 带宽,Apple 明确说可以本地运行数千亿参数的大模型。(Apple) 这其实已经把“未来超级 AI 手机应该往哪里发展”展示得很清楚了:不是单纯堆 TOPS,而是大容量、高带宽统一内存。

by ChatGPT