7月27日,月之暗面正式发布新一代旗舰大模型——Kimi K3,并对外开放完整开源权重包。参数规模达2.8万亿,原生支持100万Token超长上下文,并具备原生多模态、复杂推理、长程编程及Agent任务执行等能力,成为当前业界领先的开源大模型之一。
模型开源首日,弘信电子旗下燧弘华创便完成Kimi K3在无锡Token工厂华为昇腾910C超节点上的适配与部署,通过HonMaaS模型服务平台正式对外提供模型服务。此次适配由燧弘华创联合趋境科技共同完成,依托趋境科技在大模型推理优化、国产算力适配方面的技术积累,以及其核心团队源自清华大学计算机系高性能计算研究所的系统级技术能力,实现Kimi K3面向国产AI算力平台的快速适配与稳定运行。

从模型发布到生产级部署,再到标准化服务,Kimi K3的快速上线,不仅体现燧弘华创Token工厂从算力基础设施、模型适配,到推理优化和Token生产的全链路能力,也进一步展现HonMaaS在超大模型部署、资源管理、多模型接入和模型服务交付等方面的能力,为万亿级大模型走向产业应用提供新的实践路径。
Kimi K3:迈向超大规模智能的新一代模型
Kimi K3是月之暗面推出的新一代旗舰基础模型,参数规模达到2.8万亿,是目前全球首个开源的3T级大模型。
模型采用Kimi Delta Attention(KDA)、Gated MLA等混合注意力机制,并引入Attention Residuals(AttnRes)和Stable LatentMoE等技术,在超大参数规模基础上进一步提升长上下文及复杂任务处理能力。
与此同时,Kimi K3原生支持最高100万Token 上下文窗口,并具备视觉理解能力,在代码生成、复杂推理、工具调用以及Agent 等场景展现出较强的综合能力,更适合作为开发者和AI Agent的底层模型。
对于如此大规模的模型而言,从模型权重开源到真正实现稳定、高效运行,并非简单的“部署”过程,而是涉及算力资源、模型架构适配、推理框架、算子优化、多卡通信以及资源调度等一系列系统性工程。此次Kimi K3在燧弘华创无锡Token工厂华为昇腾910C超节点上的快速适配,正是这一系统工程能力的集中体现。

从“能运行”到“跑得好”:Token 工厂的模型调优能力
Kimi K3采用大规模MoE架构,共包含896个专家模块,对算力、显存、通信和并行计算能力提出更高要求。针对这一特点,燧弘华创联合趋境科技,基于开源推理引擎SGLang,完成Kimi K3在华为超节点上的推理适配。
此次适配并非简单实现模型“可运行”,而是针对Kimi K3的新型架构开展系统性优化,包括KDA机制适配,以及MoE、混合注意力、多卡通信等关键模块的优化,以提升模型在国产算力平台上的运行效率与稳定性。
这背后体现的是Token工厂更核心的能力——不仅能够提供算力,更能够围绕不同芯片、不同模型和不同应用需求,对模型进行适配、调优与生产。
从GLM-5.2到Kimi K3,从模型部署到推理优化,燧弘华创正在与趋境科技等生态伙伴共同构建面向前沿大模型的Token生产能力,让先进模型能够更快完成从“模型能力”向“可用Token”的转化。
HonMaaS平台:让复杂的大模型能力走向标准化服务
如果说Token工厂解决的是“算力和模型如何高效生产Token”,那么 HonMaaS解决的则是“企业如何更加便捷地使用Token”。
作为燧弘华创面向产业客户打造的一体化MaaS模型服务平台,HonMaaS并非简单提供模型API,而是将大模型体验、资源管理、多模型接入、模型调度及服务交付等复杂能力进行统一封装,进一步降低企业使用前沿大模型的技术门槛。
超大模型部署:让前沿模型快速进入生产环境
对于万亿级参数模型而言,从开源权重到稳定运行,需要解决算力资源、模型适配、推理环境及工程部署等一系列复杂问题。依托 Token工厂的算力基础设施与模型部署能力,HonMaaS能够快速对外输出前沿模型,将模型从“开源权重”转化为可稳定运行的生产级服务。
统一资源管理:让模型服务更高效、更可控
面对不断增长的模型数量和算力需求,企业不仅需要模型,更需要对模型资源进行统一管理。HonMaaS支持账号权限、调用额度、资源使用等统一管理,并提供使用数据和调用情况的可视化报表,帮助企业更加清晰地掌握模型服务使用情况,实现资源使用的可视、可控与可追溯。
多模型统一接入:一个平台连接多种模型能力
当前大模型技术快速迭代,不同模型在代码、推理、知识处理、多模态等场景各具优势。HonMaaS已持续接入Qwen、DeepSeek、GLM、Kimi等多款头部模型,通过统一的服务接口实现多模型接入,让企业无需针对不同模型重复建设调用体系,即可根据实际业务需求灵活选择模型。此次Kimi K3的上线,也进一步丰富HonMaaS的模型服务矩阵。
灵活调度:根据业务需求匹配合适的模型
对于企业而言,不同业务场景对模型能力、响应速度和资源消耗的要求并不相同。HonMaaS支持多模型灵活调度,可以根据不同应用场景选择合适的模型能力,帮助企业更加高效地配置模型资源,提升模型使用效率。从单一模型调用进一步走向多模型协同,平台能够更好地适应企业AI应用不断增长和变化的需求。
标准化 API:降低企业接入门槛
模型真正产生产业价值,需要进入企业现有业务系统和应用场景。HonMaaS提供标准化 API 接口,企业无需重新搭建复杂的模型基础设施,即可快速完成模型调用与业务系统集成。无论是智能客服、代码开发助手、企业知识库,还是行业分析、智能体等应用,都可以基于统一接口快速接入Kimi K3等模型能力,加速从模型验证到实际应用的落地。

Kimi K3的快速适配,背后呈现的并不是一次单点模型部署,而是一条逐渐清晰的产业化路径:前沿模型→国产算力适配→模型推理优化→Token生产→MaaS服务→AI应用。在这一链条中,Token工厂提供算力与生产基础,趋境科技等生态伙伴提供模型适配与推理优化能力,HonMaaS则进一步将模型能力标准化、平台化,推动前沿模型从“可运行”走向“可调用”、从“可调用”走向“可应用”。
此次Kimi K3在无锡Token工厂华为昇腾910C超节点上的快速适配,是燧弘华创持续提升Token生产能力的一次实践,也进一步验证其面向超大规模前沿模型的承载、适配与服务能力。
未来,燧弘华创将持续联合趋境科技等生态伙伴,推动更多前沿大模型与国产算力平台实现高效适配,并依托Token工厂与HonMaaS,进一步打通从算力、模型、Token到AI应用的产业链路,让更多先进模型更快进入真实生产场景。以算力为底座,以模型为核心,以Token为新型生产要素,以平台为连接纽带,推动AI从前沿技术走向规模化应用,为大模型产业化落地探索更多可能。
扫码对接生态合作通道,共商AI落地新机遇
