DC娱乐网

3万亿参数模型在国产卡上跑满血?海光DCU这次玩真的 Kimi K3的参数规模

3万亿参数模型在国产卡上跑满血?海光DCU这次玩真的

Kimi K3的参数规模确实吓人,2.8万亿,是目前全球开源模型中的最高纪录。896个专家里只激活16个,配合Stable LatentMoE框架,效率比K2提升了约2.5倍。原生支持视觉理解,100万token上下文窗口。

这么大的模型,国产算力能不能hold住?海光DCU交卷了。

之前海光已经适配过365款主流大模型,从十亿级到千亿级全覆盖,积累了丰富的调优经验。这次针对K3的896专家MoE架构,团队依托自研DTK软件栈,从底层算子、通信调度到推理引擎都做了针对性优化——896个专家并行,数据分发和负载均衡本身就是硬骨头,跨卡通信稍有延迟就会拖慢整体。

海光在算子融合、专家路由调度和显存管理上做了定制调优,尤其针对KDA线性注意力机制在百万token上下文下的计算特点做了专门的算子适配,实测长文本推理性能稳定,跟GPU原生版本处于一个水平线。

从"能用"到"好用",国产算力这一步跨得够大。3万亿级模型不再是海外算力平台的专属了。
国产芯片 DCU 海光信息