英伟达开源 Nemotron 3.5 Lightning
30B 总参数、每次只激活 3B MoE架构,上下文最长 1M token(单卡 H100 实测约 256K)。
从自家 Nemotron 3 Ultra 模型蒸馏出来的,专门干执行层的脏活累活:工具调用、结果校验、子 agent 派活
同类模型里输出速度最高 4 倍,PinchBench 跑到 86% 精度、比 Qwen3.6 35B 快约 30%(精度相近)。靠的是推测解码(MTP + DSpark / DFlash 两个草稿模型)和 NVFP4 量化,单张 H100、DGX Spark、RTX 5090、Jetson 都能跑。
光有一个快模型不够,英伟达顺手给了个开源路由库:每一步自动把任务派给最合适(质量 / 延迟 / 成本权衡)的模型。
让前沿模型做规划,Lightning 做执行,钱花在刀刃上。
LangChain:145 个多轮 agent 任务,成本降 74%,只有 7% 请求交给前沿模型,精度损失约 6 点
Ramp:SWE-Bench 追平前沿水平,成本砍 58%、耗时降 33%
Cognition(Devin Desktop):近前沿表现,成本约降 28%
Boomi:路由准确率 100%,59% 流量走快 5 倍的微调模型
上面提速、降本全是英伟达自家基准,第三方实测还没出。
模型纯文本、无多模态;当主 coding agent 偏弱,定位就是执行工。
