新卡到位,老卡下岗。
新买入了nVidia Tesla V100 32G显卡,实测Qwen3.8-27B的不同量化版本。速度如下:
Qwen3.8-27B-unsloth-GGUF-Q4_0 -c 261120 [40~]t/s
Qwen3.8-27B-unsloth-GGUF-Q4_K_M -c 261120 [33~]t/s
Qwen3.8-27B-unsloth-GGUF-Q5_K_S -c 261120 [29~13.18]t/s
Qwen3.8-27B-unsloth-GGUF-Q6_K -c 241120 [28~]t/s
Qwen3.8-27B-unsloth-GGUF-Q8_0 -c 91120 [29~]t/s
Qwen3.8-27B-unsloth-GGUF-UD-Q4_K_XL -c 261120 [33~]t/s
Qwen3.8-27B-unsloth-GGUF-UD-Q5_K_XL -c 261120 [29~]t/s
Qwen3.8-27B-unsloth-GGUF-UD-Q6_K_XL -c 180000 [27~]t/s
所有的上下文都是Q8_0向量化
-c后面的数字就是设置的上下文长度,基本上都是刚好把32G显存塞满
[方括号]里面的数字是稳定的推理速度,token每秒。其中前一个数字是上下文实际占用约3K时的速度,波浪线~后面的数字是上下文已经几乎塞满了以后的速度。
用的实在太舒畅了,整体感觉速度是原先P40显卡的两倍,27B模型终于可以舒畅的使用了。
而且32G显存比原先P40显卡的24G显存可以容纳更高精度的量化模型和更长的上下文,非常满意。
电脑硬件配置是:Thinkpad X1 nano (i7/16G内存/核显,Windows10-22H2版本)通过火线接口连接外置显卡。


