DC娱乐网

真相了!追查“牛来”幕后算力,所有线索都在靠近海光…   “牛来”到底跑在谁家的

真相了!追查“牛来”幕后算力,所有线索都在靠近海光…
 
“牛来”到底跑在谁家的芯片上?把这两天的报道和技术线索摊开看,我个人的判断越来越明确:不能确定全部是海光,但海光DCU大概率深度参与了,而且分量可能不轻。
 
先看媒体口径。
 
《晚点 LatePost》披露,GLM-5.3-Flash调用超过10万张国产芯片集群提供推理服务,潜在供应商可能包括华为、摩尔线程和海光,智谱没有回应具体名单。21世纪经济报道援引知情人士称,模型训练或获得海光DCU等国产AI加速芯片集群支撑。钛媒体更是直接押注海光。随后,金融界、大模型之家、头条热点及IT时报等平台随后也跟进了这条线索。
到这里仍然只是媒体爆料。但继续往下查,技术侧的拼图开始对上。
 
第一,推理栈高度匹配。GLM-5.3-Flash线上服务基于改造后的SGLang,引入Encode-Prefill-Decode分离架构,并使用W8A8量化、混合缓存量化、Layer Split等技术。其核心是根据多模态编码、上下文预填充和逐Token解码的不同负载特征,分别调度资源,减少显存与带宽压力。
而海光DCU此前在GLM系列适配中,已经围绕MoE并行、长上下文、量化推理、融合算子及通信原语做过优化。GLM-5.3-Flash虽然是原生多模态新模型,底层大量工程能力却能沿着前代技术栈迁移,不需要从零起步。
 
第二,模型演进关系接得上。GLM-5.3-Flash是320B总参数、18B激活参数的MoE模型,支持1M上下文,结构上继续强调稀疏计算和注意力效率。海光此前已经跟进GLM-5、GLM-5.1等前代模型,算子和软件栈有连续积累。模型每升级一代,海光的适配同步往前走,这比临时拿来“点亮”一次更有说服力。
 
第三,性能现象也能互相印证。智谱称,经过推理引擎优化,相关国产集群的端到端性能较初始硬件基线提高3倍,硬件效率和单位Token成本达到主流英伟达GPU水平。这类提升不可能只靠模型缩小参数,需要芯片、显存、通信、算子和调度共同优化,恰好落在海光DCU长期强调的软硬件协同能力上。而且别忘了,国内走GPGPU路线的一共就那几家,海光DCU似乎不必多言。
当然了,圈里还有个更简单粗暴的排查方法:谁手里有十万卡?华为、摩尔线程目前都没有对得上的公开线索,剩下最显眼的就是刚亮出全国产十万卡AI超集群的中科曙光。再往下一层看,曙光体系里的核心国产加速芯片是谁?海光DCU啊。怎么看都顺。
 
所以我现在的推测是:10万卡或许很是多种国产芯片共同构成,但从目前媒体资料以及全网分析来看,海光DCU处在核心算力池中的概率已经相当高,训练环节也可能有参与。
 
就差当事方把最后一块拼图翻过来了。
 
如果最终确认,这件事对海光的意义会非常大。它证明的不只是某款GLM能够在DCU上运行,而是海光有可能参与承接了一款全球爆火模型的训练或大规模推理,在多模态、百万上下文和高并发Agent负载下,把国产算力真正推入生产环境。
 
海光信息 智谱牛来 国产算力 GLM53Flash