DC娱乐网

吐字速度稳定提升 显存占用小得多

依旧是老演员Qwen3.8-27B,有DFlash2也有DSpark。

在ds-v4-flash的帮助下编译了适用于本机5060Ti 16Gx2+CUDA13+Windows的支持DFlash2的llama.cpp,对无加速/自带的MTP/DSpark/DFlash2进行测试。
DSpark:DimInfer/Qwen3.8-27B-Dspark-v1
DFlash2:z-lab官方
场景是ds自己造的编程场景。

短上下文场景见p2。DSpark的核心问题在于,需要外挂一个看上去像是完整小模型的东西,但是这个小模型也是要吃上下文的。我的配置原本Q4量化配合KV q4_0能跑256K上下文,但是一旦挂上DSpark就只能缩减到128K。这还是在DSpark Q5量化的情况下。稍长上下文的测试见p3。这时候DFlash2的提升对比DSpark就没有短上下文那么明显了,但能留大量空间给上下文还是很强。

其实还有测Qwen3.6-35B-A3B+DFlash1代。在llama.cpp多路并发场景下比MTP有优势。是的你没看错是llama.cpp+4路并发,每路平均50K。单路的速度提升跟MTP也拉不开差距。p4还有4090 48G+vLLM-Windows+NVFP4+DSpark的测试,超超超长时间任务的速度大概在33~39t/s之间浮动,有兴趣也可以看看。

总的来说,DFlash2目前稍微有点麻烦的地方在于,非苹果用户需要自己拉代码配环境编译。但对于32G显存这种刚刚好卡线的配置来说做这点前期准备值得,而且对于Agent来说也就是一句话的事。而DSpark这条路线,虽然更吃资源但明显上限会更高一些,也期待社区的迭代。

#榨干设备howto #howto入门codex #大模型 #ai #dspark #DFlash2 #deepseek #qwen38_27b