DC娱乐网

Qwen3.8-27B 上线:本地就能跑 frontier 级 coding agent,不用云 API

一、卡在能力与体积的甜点上开发者圈对它的反应,本质上是能力 × 体积这个组合带来的冲击。 Alibaba 自家发布的 b
一、卡在能力与体积的甜点上开发者圈对它的反应,本质上是能力 × 体积这个组合带来的冲击。
Alibaba 自家发布的 benchmark 是第一波引爆点。公司报告:61.7 SWE-bench Pro / 90.3 LiveCodeBench v6 / 70.7 自家 CoWorkBench 办公基准 / 84.3 OSWorld-Verified。
在 Alibaba 自己贴的对比表里,27B 模型在 SWE-bench Pro 和 LiveCodeBench 上甚至反超列出的 Claude Opus 4.6 Max 成绩——不过 Opus 仍在 Terminal-Bench、GPQA Diamond、Humanity’s Last Exam 上领先。
部分 Alibaba 的评测是内部分数,benchmark harness 也不完全等价,所以光凭这些数字还不能盖棺定论”谁是普遍 winner”。
二、第三方数据:本地模型追平几个月前的专有模型真正的转折点发生在周一,第三方评测陆续出炉。
第三方 AI benchmark 机构 Artificial Analysis 给 Qwen3.8-27B 打出 Intelligence Index 52 分——这是覆盖 coding、科学、reasoning、专业任务的 9 项评测综合——这个分数恰好等于它给 OpenAI GPT-5.6 Luna 在最大 reasoning 设置下的当前打分,而 Luna 是只在云上提供的专有模型。
开源 coding agent Cline 在 X 上写道:”这是第一次,一款本地模型跑到了 frontier 模型的能力。我们完全没预料到本地进展会这么快“。
Artificial Analysis 的 Agentic Index(测 agentic 任务)上,Qwen3.8-27B 拿到 51 分,在最大 reasoning effort 下反超 Claude Opus 4.8——Opus 4.8 是 Anthropic 不到三个月前刚发的 frontier 模型。
这不意味着这两款模型等价,但足以解释为什么开发者和 AI 重度用户一下子被点着。开发者兼 AI 播客主 Sharif Cherf(@0xSero) 在 X 上写道:”一款跑在 3000 美元硬件上的模型,正在击败 4 个月前的一切。包括 Opus。’永久底层阶级’取消“。
开发者 Joshua “Xenova” Lochner(把 ML 模型搬进浏览器的那位)周一在 X 上转发这个结果时,附上了他用自定义 WebGPU kernel 跑 Qwen3.8-27B 的实验。他的反应——”活在这样的时代真好“——基本就是圈里情绪的缩影:一款能跑在 frontier 模型分数段的模型,能下载、能改、能在本地执行,不必再经厂商 API。
把模型压一压,吸引力更明显。Simon Willison 测了约 17GB 的 Q4_K_M 量化版,跑在 M5 Max MacBook Pro 和 Nvidia DGX Spark 上。模型能写代码、能理解图、能在 Pi agent 框架里操作 coding agent loop。一次实验里,模型穿行 codebase 解释认证机制;另一次,Willison 让它写并测了一个 Python 小工具,把 agent transcript 从 JSONL 转成 Markdown。
”17GB 的文件能在我家机器上干完所有这些事,是个奇迹”,Willison 写道。他想表达的是真正让重度用户共情的事:本来感觉和昂贵托管模型绑死的能力,正在移到小到能在工作站上保存的文件里。
反应也直接体现在用量上。Cybernews 周一报道,Qwen3.8-27B 在头三天拿下了 300 万次 Hugging Face 下载;量化版本也迅速在本地 inference 工具里冒头。Reddit 的 LocalLLaMA 社区专门为它开了个发布 megathread 来收纳不断涌入的 benchmark、量化、配置建议和对比。一位用户跑出一个本地生成的游戏,形容这模型”是另一种野兽“。
三、overthinking 是个问题这股热潮有一个重要 caveat:Qwen3.8-27B 看起来是用大量 thinking 换了一部分质量。
Artificial Analysis 报告,模型在它的 Intelligence Index 测试里输出了 1.6 亿 output token——同档位开源权重模型的中位数是 4300 万。
Willison 也撞上了同一行为的极端版本——Qwen 默认走 xhigh reasoning 档。让他生成一张”骑自行车的鹈鹕 SVG”,模型烧了 21 分钟、超过 22,000 reasoning token 之后才给出答案。他建议日常本地用先开 low 或关掉 reasoning。
投资人兼开发者 Tomasz Tunguz 在一个 9 任务的小测试里也撞到同样的 trade-off——对手是 DeepSeek V4 Flash:开了 reasoning,Qwen 在他的 agent 栈上质量略胜一筹,但他报告速度慢了约 30 倍、成本贵了 4.5 倍。他也明说 9 个任务不够下结论。
inference 软件有机会缩窄这个差距。 Qwen3.8-27B 内置 Multi-Token Prediction;Willison 报告,在 DGX Spark 上,通过 llama.cpp 启用 MTP 相比默认 LM Studio 配置,跑出了约 72% 的性能提升。
但即使如此,他在 LM Studio 上的常规跑也只能跑到大约 15–30 token/s——离多数托管模型的响应速度还差得远。
这种张力正是 Qwen3.8-27B 比又一个 leaderboard 排名更重要的原因。
四、企业该带走什么对企业的真正问题,不是”27B 在 benchmark 上是不是打败了 Claude 或 GPT”,而是”一款小到能在企业自有基础设施里跑的模型,现在能不能完成足够多的 coding、文档分析、视觉和 agent 任务,把一部分 API 调用替换下来”。
这件事会改写隐私、部署、成本这套计算。Apache 2.0 权重能审查、能修改、能部署在企业自有控制之下;Alibaba 已经文档化了对 vLLM、SGLang、TokenSpeed 等 serving 框架的兼容。Alibaba 说,后面还会有托管版 Qwen Cloud,默认 1M 上下文、带内置工具。
小体积 + 友好的硬件要求意味着企业、独立开发者、甚至普通消费者都能轻松在本地部署,数据不必离开自己的机器——隐私、信息安全、治理、控制都拿到手。
更广泛一层,重度用户在关注有更结构性的原因。Hugging Face 的数据(由 Business Insider 本周披露)显示,2026 年的实际下载量严重向小模型倾斜,虽然巨型 frontier 模型的发布占据着头条;70B 以上参数模型只占下载量的小头。
Alibaba 跨多个实用尺寸档发布 Qwen 模型的策略,已经让 Qwen 家族成了开发者本地部署 workflow 的常客。
Qwen3.8-27B 把这个逻辑往前推了一步。它的 benchmark 分数还需要更多独立验证;默认 reasoning 行为在效率上会疼死人;也没有哪一张 leaderboard 能直接证明它 frontier 级平价。
但发布三天后,开发者们的反应已经不再主要是看 Alibaba 的 benchmark 表——他们是在亲身体验把一个相对小的文件放到自己控制的硬件上、看它跑那些不久前还以为只属于最大专有系统的任务。
对一部分开发者、AI 重度用户——是的,甚至企业部署来说,那才是真正算数的 benchmark。