DC娱乐网

27B真的是一个很鸡贼的尺寸 没错,我说的就是阿里开源的 Qwen3.8-27B

27B真的是一个很鸡贼的尺寸
没错,我说的就是阿里开源的 Qwen3.8-27B。
不是MoE混合架构,这次是稠密模型,所以27B这个参数量很鸡贼。

7B 能跑但不够用,70B 够用但显存爆炸,27B 正好卡在中间。
4-bit量化之后,3090、4090 这种 24G 卡基本能带得动;Mac 那边 32G 统一内存也能试;手里有 48G 以上的,直接上官方 FP8 加 vLLM。

本地部署,你将会得到一个Opus 4.6。

开放权重的Qwen-3.8 27B版本,我给的评级是也是“圣”字辈的,因为这大概是各位离消费级显卡+本地部署+好用三者同时满足 最近的一次。

当然,我还是建议别上来就把上下文拉满 262K,那是模型的上限,不是你机器的上限。从 8K 往上加,爆显存了先降上下文、再降量化。
那么问题来了,如果用DS Harness+本地部署的Qwen-3.8 27B,能不能实现Token自由?

关键是跑起来之后。llama.cpp 和 vLLM 对外都是 OpenAI 兼容接口,而 Harness 最狠的设计叫「一切皆插件」,模型层根本不锁定,官方明说能接任何 OpenAI 兼容后端,本地的也算。
于是你手里就是这么一套:本地大脑,本地身体,一条 npx 命令起服务。不联网,不花 API 费,代码不出本机。
同样的活丢给云端,旗舰 Qwen 输出一百万 token 三十六块,Claude Code 订阅起步二十美金一个月。本地跑,边际成本是电费。

当然,现在的压力要给到牢梁了,毕竟Harness 还是 v0.1 预览版。既然涨价已经劝退了大部分用户,我希望牢梁的迭代速度还能再快一些。AI进化生活howto AI新手村 人工智能 大模型