DC娱乐网

AIMax395:125B模型换引擎快 3 倍:实测可用

对比之前测试的qwen3.8 flash,这次prefill快了整整将近4倍,目前是可用的状态了.

同一个模型,在 AMD AI Max 395 上换了套引擎,32K 长文读取prefill从 200-230 token/s干到接近 1200 token/s,多轮续聊从分钟级卡顿变成 0.8 秒。模型没换、机器没换,只是推理引擎从"通用型"换成了"这颗芯片专用型"。

先交代背景。这台 ROG Flow Z13 一体机,128G 统一内存,跑的 Qwen3.8-Flash-Next,125B 参数的 MoE,每生成一个 token 只激活 6B。之前用社区开源引擎(llama.cpp 系),短问答还行,一到长文档就露馅:30K token 的上下文每次都要从头重算,一次等半分钟到几分钟,agent 场景根本没法用,后来直接弃用了。

直到发现有人给这颗芯片单独写了套引擎,叫 halogen-flash。不是改参数,是全部 kernel 重写:512 专家 MoE、混合注意力、51B 的 ngram 查表,每个算子都只认 gfx1151 这一个 GPU 和一个模型。夸张到什么程度——它连 256K 的 KV 池都是按共享池设计的,多轮会话续聊不重灌,实测 30K 上下文第二轮起每轮固定 0.8 秒,冷启动 20 秒,提速 25 倍。长文档 prefill 是旧引擎的 3 到 4 倍:10K 到 160K 全程稳定在 1000~1200 token/秒,和官方测的"深度不衰减"完全一致——上下文越长,差距拉得越大(131K 深度能到旧引擎的 6 倍以上)。

最反直觉的是精度。按直觉,快 = 砍精度。它反而是 5.53 bpw(4-bit 权重加一层 8-bit 校准侧车),比我之前用的 3.71 bpw 高一大截——是用算法优化换速度,不是用质量换速度。decode 思考模式全口径 40 多 token/s,和旧引擎略慢,但吐字阶段能到 160+。

部署上有一个劝退点要先说:引擎闭源、只发容器、权重是私有 .hgn 格式(118G),除了它家引擎谁都不认——生态锁死,这点要自己想清楚。好处是 EULA 免费商用、无遥测、默认零外联,还内置 benchmark 让你自己复测,不让你盲信数字。

#AIMax395 #本地大模型 #Qwen3 #开源模型