英伟达死守的推理性价比神话,碎了。
SemiAnalysis刚发布了谷歌第七代TPU Ironwood的首份第三方推理性能测算。同等负载下,TPU每美元性能最高领先B200达50%,对B300领先幅度逼近96%。
每百万Token成本:TPU仅0.181美元,B200为0.222美元,B300高达0.276美元。
详情点击:网页链接
今年4月,黄仁勋在Dwarkesh播客上曾断言TPU与Trainium不敢跑分,甚至公开鼓励用InferenceMAX验证。五个月后,TPU带着数据如约而至。
黄仁勋的三次断言正被逐一击穿。他曾说渴望看到TPU的成本优势被证明、且认定这在逻辑上不可能成立;但测试显示在100 Token/秒吞吐基准下,TPU比B200便宜19%,比B300便宜34%。
他还称从第一性原理看TPU优势没有道理。物理测试证实TPU吞吐确实略逊于GPU,但其每小时租赁成本断崖式低廉,5%的物理优势叠加低租金,转化为50%的性价比优势,按谷歌内部成本核算甚至可放大至77%~130%。
他更断言失去Anthropic支撑TPU将丧失增长引擎。但谷歌已开放芯片直售,DeepMind内部研究员也要抢算力,黄仁勋4月敢这么说,是因为TPU从未标过价——现在,别人替谷歌标了。
这背后是谷歌的工程哲学:把计算Die、芯片互联与编译器铸成闭环系统。Ironwood的HBM容量达上一代6倍,是首代原生支持FP8的TPU,矩阵单元吞吐飙升至v5的4倍。芯片间通过自研ICI总线互联,呈3D Torus拓扑,64颗组成机架立方体,最终拼接至9216颗芯片的超级矩阵。
底层代码重构同样关键:KV Cache页数翻倍使首Token延迟骤降95%;读取块与计算块拆分让解码吞吐从64.9k跃升至96.3k Token/秒;通信任务转移至SparseCore后,吞吐提升最高达26.1%。
更颠覆的是,TorchTPU利用PyTorch的PrivateUse1接口,让TPU成为原生Torch设备,炸毁了此前TorchAX的翻译墙,vLLM、SGLang等框架的核心代码可直接复用。
CUDA帝国的两道城墙——芯片性能与生态铁幕——如今都被实质性击穿。





