小米把长上下文 Agent 的推理成本又压低了一档。9 月 24 日,小米 MiMo 团队公布面向 MiMo-V3 的核心架构 HySparse2,目标直指下一代长程多轮 Agent。官方介绍显示,新架构带来更少的 Prefill 计算、更小的 KV Cache,以及更精准的长上下文检索,让模型能以更低成本处理网页、文件、代码和工具调用记录,并从不断增长的任务历史中准确检索关键信息。该架构延续了 MiMo-V2 系列 Hybrid SWA 混合注意力的效率路线,这次升级采用两级 KV 共享,蓝色连线表示 KV Bridging,红色连线表示 KV Reuse。对 Agent 场景而言,任务历史越长、工具调用越多,KV Cache 的显存开销与检索精度就越关键,这也是当下各家模型竞争的焦点之一。 小米大模型智能体
