DC娱乐网

实测数据惊人:Qwen3.8-27B 极低比特量化版 环境:RTX 5070 T

实测数据惊人:Qwen3.8-27B 极低比特量化版
环境:RTX 5070 Ti 16GB 显存 + llama.cpp 推理框架,运行 Qwen3.8-27B UD-IQ3_XXS(11.9GB,3bit 动态量化,支持 MTP 多 token 预测)。
实测数据: · 生成速度:67.55 tokens/s · 上下文:8K 稳定运行 · MTP 多 token 预测:生效
测试题:经典概率题「甲、乙轮流抛硬币,甲先手,谁先抛出连续两个正面(HH)谁获胜,求甲胜率」。
测试发现:该模型默认开启深度思考模式,会先生成 8000+ token 的完整推理链(状态定义、转移方程、方程组求解),再给出结论,完整推理约需 2 分钟。对于需要展示推理过程的教学、解题、分析场景,这是明显优势;但日常问答建议关闭 thinking(enable_thinking: false),可秒出正文。
结论:16G 显存本地跑 27B 级模型完全可行,UD-IQ3_XXS 在体积、速度与质量之间取得良好平衡,适合私有化部署与本地办公场景。