阿里云灵骏真武M890超节点实例已经跑通了Qwen3.8,现在可以在阿里云百炼平台上直接调用推理服务。这件事的特殊之处在于,它是国内第一个能把超过2万亿参数的大模型稳定跑起来的超节点。
Qwen3.8的参数规模达到了2.4万亿,这种体量的模型不可能塞在一张卡里,必须把参数拆散到几十张甚至上百张GPU之间来回搬运。普通AI集群的通信带宽在这里就成了硬瓶颈,高吞吐、低延迟、高并发这三个指标很难同时满足。
真武M890是平头哥刚出的训推一体芯片,从FP32到FP4的数据精度都原生支持,训练可以用高精度,推理可以压到超低精度。灵骏真武M890超节点实例里塞了64张这样的芯片,靠ICN Switch 1.0互联芯片拉通,卡间带宽做到800GB/s,显存堆到9TB。这个配置单实例就能撑住2万亿参数MoE模型的专家并行,不需要把模型拆到多个实例上去。
阿里这次是从芯片层一直优化到云平台层,跟Qwen模型做了全链路适配。结果不只是"能跑",而是跑得顺——实测在Agentic推理场景里,通过算子优化和软硬件协同,推理性能最高能提升1.5倍,推理成本也跟着降下来。
