【显存容量才是硬通货?AMD MI355X 挑战英伟达 Blackwell】推理服务商 Wafer.ai 发布报告称,在运行 2.8T 参数的 Kimi K3 模型时,AMD MI355X 凭借 288GB 显存实现了单机 TP8 运行,而英伟达 B200 则因显存不足必须跨节点部署。由于避开了跨节点通信的性能损耗,AMD 在单节点吞吐量和性价比上表现惊人,每美元 Token 产出远超 B200 方案。这并非 AMD 在算力架构上的纯胜,而是“显存溢出”时代的错位竞争。当模型大到单卡塞不下,显存容量就成了比算力更宽的护城河。不过,业内对 $2.50/小时的租赁价格普遍存疑,认为这更像是一场基于特定折扣的营销秀。在 Open Weights 时代,硬件选型已从“买最强算力”转向“买最适配显存”。虽然 ROCm 仍需通过“补丁”来对齐 MLA 等算子,但软件生态的鸿沟正在被 AI 辅助的优化手段快速填平。


