比较什么?三个维度:训练算力规模、机架级互联架构、单次训练成本结构。同一把尺子量两边,才能看清楚 GPT-4 时代到 GPT-6 Astra 时代,到底什么东西变了,什么只是自然延续。
训练算力规模,从万卡级到十万卡级的量级跃迁GPT-4 的训练集群,单卡 FP16 峰值算力约 2000 TFLOPS,总训练计算量约 2.15×10²⁵ FLOPs。OpenAI 官方从未公开过精确数字,但 SemiAnalysis 2023 年的架构解析给出了这个被广泛引用的估算范围。
GPT-6 Astra 这边,黄仁勋在社交平台明确说了:约 10 万颗 NVIDIA Grace Blackwell NVLink72 芯片组成集群完成训练。Blackwell 架构单卡 FP4 峰值算力达到 14 PFLOPS。同口径下,GPT-6 Astra 集群的总理论峰值算力相较于 GPT-4 集群有显著提升。
黄仁勋在社交平台发布祝贺OpenAI团队的推文差距的来源不是单卡算力提升——3.5 倍的代际跃升本身不小,但真正的放大因子是集群规模从 3 万卡级跳到 10 万卡级。数量级的变化,才是后续所有架构重构的根因。
机架级互联架构,从 8 卡胖树到 72 卡统一运算单元GPT-4 时代的主流方案是 8 卡单机架部署,节点内通过 NVLink4 实现 900GB/s 互联,跨节点走 InfiniBand 胖树组网,单链路带宽 200 到 400Gbps。这个架构在万卡级集群里够用——跨节点通信延迟还能接受,800G 光模块部署量不过数万只级别。
但到了 10 万卡级,传统 8 卡独立节点跨交换机转发的通信延迟,会直接把大规模并行训练效率打对折。原有松散组网逻辑完全失效,架构必须重构。
GPT-6 Astra 的答案是用 NVLink 把单机架 72 颗 GPU 完全紧耦合为统一运算单元,机架内 GPU 间实现高速对等带宽交互,彻底消除了机架内交换机转发延迟。
10 万颗 GPU 对应多个 NVL72 机柜,跨机架互联则标配 1.6T 光模块,搭配 RDMA 无损网络,保障跨机柜、跨数据中心的训练协同低抖动无丢包。
这条升级路径的本质是:机架内从"多节点交换"变成了"一整块巨型 GPU",机架间从"800G 可选升级"变成了"1.6T 必选标配"。互联网络从配套角色,上升为决定训练能不能跑起来的核心约束。
训练成本结构,从 GPU 占绝对主导到多环节均衡重构GPT-4 时期,AI 服务器的物料成本里,GPU 硬件价值占比约 73.6%,高速互联、PCB、散热、供电合计只有 14.7%。训练成本基本等于硬件折旧,互联和散热几乎可以忽略。
到了 GPT-6 Astra 这个量级,结构彻底变了。中国证券报援引摩根士丹利的预测显示,GPU 价值占比预计从 H100 时代的 73.6% 下降到 Rubin 时代的 51%,而高速互联、PCB、HBM、供电散热等环节的合计占比将从 14.7% 提升到 47% 以上。

高盛 9 月 7 日发布的最新报告也印证了这一点:2026 到 2028 年全球光模块市场规模预期分别上调 33%、81% 和 115%,上调的核心驱动是每个 GPU 对应的光模块用量增加和规格加速升级。

值得注意的是,OpenAI 官方从未公开披露 GPT-4 和 GPT-6 Astra 的精确训练成本结构,上述占比均为第三方行业机构基于算力规模的估算,无官方口径交叉确认。
成本从"买卡就行"变成了"买卡、铺光模块、上液冷、建供电"的多维投入。过去硬件折旧占绝对主导,现在互联和散热吞噬了越来越大的一块蛋糕。
训练一次 GPT-6 Astra 级别的模型,光模块和液冷系统的投入已经不再是"配套成本",而是和 GPU 硬件本身一样,成为决定项目能不能启动的关键门槛。
参观者查看展会上的液冷AI服务器机柜选哪条路,取决于你要什么如果你是大模型训练团队,目标是前沿模型能力:GPT-6 Astra 的高算力、紧耦合、高速互联路线是唯一选择。10 万卡级集群带来的算力密度提升和通信效率跃迁,是传统万卡集群无法复制的。但你要接受高昂的互联和散热配套成本。
如果你是有商业化落地压力的算力运营方:盲目堆 10 万卡未必划算。中国银河证券 AI 首席吴砚靖明确指出,行业已经进入"单位经济性和资本回报率验证"周期,算力先行阶段结束,如果商业化落地速度跟不上,大规模采购的高端 GPU 会直接出现硬件过剩。
智谱 AI CEO 唐杰也提出,当前阶段收益最高的维度是"训练深度"而非算力规模扩张,仅靠后训练优化就能让任务完成率提升 50% 以上。
国内已经出现的第三个选项是存算协同优化的十万卡集群路线。曙光 8000 作为首个全国产十万卡 AI 超集群,采用自研 scaleFabric 原生 RDMA 高速互联和浸没相变液冷。这条路用系统级优化而非单纯堆硬件的方式,把十万卡集群的"纸面算力"转化成了"有效算力"。
曙光8000十万卡AI超集群亮相行业展会如果只能选一个,我的判断是:GPT-6 Astra 的 10 万卡 NVLink72 紧耦合路线,代表了前沿模型训练能力的硬上限——要做出代际跃迁级别的模型,这个架构门槛是绕不开的。但逻辑不能反过来用:建了十万卡集群,不等于就能做出好模型。
未做存算协同和集群容错优化的普通万卡集群,规模再大也是空转。算力是必要条件,有效算力才是充分条件。