对,你这个思路其实比“AI 手机”更准确,应该叫 “AI 掌机 / AI Switch”:核心计算和模型都在手里的设备里,完全离线可用;回家插底座后,不换设备、不迁移数据,直接解锁更高功耗和散热能力。
最合理的产品形态是这样的:
模式手持离线插底座功耗10~25W60~150W内存64~128GB 统一内存同一块内存存储2~4TB NVMe+ 外置高速 SSD视觉模型4B~9B9B~32B主语言模型14B~32B Q470B~120B / MoE实时视频1~3 FPS AI 理解5~10 FPS AI 理解语音ASR + TTS 全离线全双工多模态网络可以完全不用仍然可以完全离线
关键是模型、聊天记录、RAG知识库、照片、视频全部就在设备本地。出门断网照样:
拍摄画面 → AI 看懂语音提问 → 本地识别本地模型推理 → 本地语音回答
不需要上传云端。
回家为什么会突然变强?
不是因为插电以后“内存变大”,而是同一颗芯片可以解除功耗限制。
例如一颗专门设计的 AI SoC:
手持:
15WGPU/NPU 低频128GB RAM32B Q4 @ 15~25 tok/s
插入底座:
100W风冷/水冷直接压住 SoCGPU/NPU 高频全开同一个 128GB RAM32B 可能提高到 50~100 tok/s70B 从“勉强可用”变成“正常聊天”
它就类似 Nintendo Switch:
掌机模式 → 限功耗Dock 模式 → 解锁性能
但 AI 比游戏机更适合这种模式,因为模型根本不用重新加载到另一台电脑。
我甚至会把底座设计成两档
普通 Dock:
电源 + 巨型散热器 + 网口 + 显示器 + 键鼠。
设备插进去:
15W → 80~120W
这是最简单、最无感的方案。
更疯狂的是:
AI Dock:
除了散热、电源,再塞进去:
独立 Blackwell GPU / AI Accelerator+额外高速内存+PCIe / CXL 高速互联。
于是:
出门:掌机自己的 NPU/GPU
回家:掌机 + 底座 GPU 协同推理
这就相当于:
手机 + eGPU + 本地 AI 服务器
但用户感觉仍然是一台设备。
一个我觉得非常理想的规格
AI Pocket 主机
7 英寸 OLED
ARM CPU 12~20 核
大型 GPU/NPU
128GB LPDDR 统一内存
256-bit 总线
目标:
300~500GB/s 内存带宽
4TB NVMe
Wi-Fi / 5G
USB4 / PCIe
电池大约 80~100Wh。
手持
控制在:
15~25W
主要常驻:
Qwen 9B VLM+ASR+TTS+14B/32B 主模型。
可以一直:
看摄像头 + 听你说话 + 本地回答。
回家
插入 120~200W Dock:
SoC 满血运行。
然后可以:
70B Q4+9B实时视觉+ASR+TTS+RAG+Agent
全部同时常驻。
这才是真正的私人离线 AI。
而且有一个非常重要的优势:
现在你用云端豆包、ChatGPT、Gemini,摄像头看到的东西理论上都需要通过网络服务处理。
这种设备则可以做到:
摄像头 → RAM → AI → 结果
整个过程根本不经过互联网。
家庭摄像头、文件、身份证、合同、照片、录音、个人知识库,都可以完全留在设备里面。
所以我觉得未来真正有价值的形态未必是“手机塞一个小模型”,而是:
随身是一台 15W 的离线 AI;
回家插 Dock,瞬间变成 100W+ 的个人 AI 工作站。
这个产品逻辑其实比单纯做一个 32GB/48GB RAM 的 AI 手机完整得多。
by ChatGPT