Cursor开源Mixture-of-Kittens(MoK):把MoE训练瓶颈直接“熔”进一颗确定性超核,最高提速2.37倍,已在数万GPU上实战验证!
Cursor正式开源Mixture-of-Kittens(MoK),这是一款专为NVIDIA NVL72(如GB200/GB300 NVL72)打造的Mixture-of-Experts(MoE)训练超核。它将MoE层的全部通信与计算融合进单一、完全确定性的核,支持BF16与MXFP8,覆盖前向与反向传播,重叠计算与跨GPU网络通信,并彻底消除CPU-GPU同步开销。独立MoE层基准测试中,相对最强公开基线最高可达2.37倍加速(MXFP8前向);在Cursor内部生产栈中,端到端训练吞吐量较此前基于DeepEP的方案提升1.41倍(从约760.9提升至1070.2 tokens/sec/GPU),已支撑Composer模型在数万GPU规模上的训练。
