Qwen 3.8 27B 本地项目开发:模型重要,驾驭者同样重要。今天看到一个项目 github /syv-ai/qwen38-27b-rtx3090,它通过对 vllm 一系列针对性深度优化,竟然能让 QWEN 3.8 27B 在 RTX 3090 这匹老马上跑出 120 toks/s --- 关键是缩小了猜测模型的词汇表与猜测模型大小,优化其部分注意力机制。看来老硬件潜力还可以大大挖掘。该项目 Docker 部署简单,一行指令搞定。于是我兴冲冲的进行了安装,然后开始进行本地 agent 编程测试。测试项目是常见的浏览器操作系统 --- 开发一个在浏览器里运行的桌面系统,内涵系统设置,文件管理,文件编辑,命令行,计算机,浏览器等等。我先是使用 DeepSeek 开源的 DeepSeek Harness,发现总是频繁出错,不是工具调用不对,就是上下文超额(本应自动进行压缩)。于是改成 Codex (通过 CCSWITCH 设置本地模型),结果竟然非常愉快地完成了。结果如图。我还能在这个Browser OS 里面的 浏览器里再运行一个 browser OS,完成了嵌套。图中外面这个浅色背景的是一个 浏览器操作系统,里面深色背景的是用这个虚拟系统内的浏览器打开一个新的虚拟系统,系统设成深色,而在这个两层嵌套的系统的浏览器里,还能打开网站。查看 CODEX 调用 Qwen 3.8 27B 的记录似乎都是短小精悍的对话,打中具体问题要害,它还能利用模型的多模态功能进行测试。而 DS Harness 的对话过程似乎都是那种长篇来回,导致经常出错。看来光有好马不行,得有好的骑手。而后者更多是传统软件工程的技巧。这方面 DS HARNESS 还有很大需要改进的空间。
AI人工智能
