DC娱乐网

8 张 5090 微调 Kimi K2.5:KTransformers 把巨模型

8 张 5090 微调 Kimi K2.5:KTransformers 把巨模型训练搬回了消费卡
Kimi K2这类模型的体量,平时是跟"集群"绑在一起的。KTransformers在2026年9月13日发布了v0.7.0.post4,第一行写的是"Kimi K2.5 文本 LoRA 训练",而且跑在8张RTX 5090上。这个框架一直在做的事是异构推理:把巨模型的专家层权重放在内存和CPU上,GPU只跑每一步真正要用的那部分。早先大模型能在单卡上跑起来,靠的就是这套冷热分离。这次它把训练也纳进来了。
三条发布重点
Kimi K2.5的文本LoRA训练
checkpoint续训
原生RAWINT4路由专家下的SGLang适配器加载
第一项,LoRA训练本身省显存——只训低秩适配矩阵,不动基座权重——但前提是你能把基座放进可寻址的内存。KTransformers的答案还是那套:专家权重不下沉到显卡,按需取。
第三项是训练完的适配器得能真的被推理框架加载、真的影响输出。发布说明写得很具体:普通LoRA和全部60个expert-LoRA层都独立加载验证过了。60个专家层,一个都不能漏。
checkpoint续训的验证方式
从2步训到4步,跟直接训到4步的结果比,做了20组状态对比,要求精确一致。这种测试费机器,但决定了"断点续训"能不能信——如果续出来的和一次跑完的不一样,那前面的checkpoint就白存了。
硬件门槛写得很老实
测试环境:双AMD EPYC 9355,大约1.5 TiB内存,训练用8张RTX 5090,推理用4张。然后接了一句原话:"Packing is disabled; this is not a minimum-spec claim."(打包功能关着,这不是一份最低配置声明。)这句话在技术发布里不常见。它等于提前把"我是按这个配置测的,你配置更低别怪我没提醒"讲清楚了,省掉一堆"为什么我跑不起来"的来回。
它专门列了"没测什么"
post4说明后半段是一份免责清单:
没覆盖所有GPU/CPU架构
旧版GLM视觉
所有序列长度
单独训练的Neko checkpoint学到了风格,但两个严格输出格式检查没过,属于可复现的风格实验,不保证通用质量
K2.6的共享架构路径没有单独做硬件验证
独立frozen-main重建还在进行,之后单独汇报
把没验的、验失败的都写进去,这在版本发布里不常见。多数项目只报好消息。这种写法读起来反而踏实——至少知道哪块能信、哪块得自己试过才算。
总结
这版最值得看的不是某个数字,是它验证的思路:巨模型的边界,未必只能靠堆卡来扩。把权重按冷热拆开、让内存和CPU承担大部分参数、显卡只跑每步的热点——这条路线让"在自己机器上微调一个巨模型"从玩笑变成了教程,哪怕门槛还是8张卡。
它给的user kit里,三个YAML、锁定的安装依赖、数据准备和转换工具都齐了,只有模型和输出路径要改。是想让人按着走就能复现。