小米 MiMo-V3 将采用新架构:HySparse 2 发布,面向长上下文智能体推理优化
据 IT之家 9 月 23 日消息,小米 MiMo 大模型负责人罗福莉今日发文宣布,小米 MiMo-V3 即将采用全新架构,其核心技术 HySparse 2 已于今日发布。来源显示,HySparse 2 重点面向长上下文和智能体推理场景,在 100 万 Token 长度下,可将预填充计算量降低 5.02 倍,并将 KV 缓存缩小 4.5 倍,同时在长上下文检索相关评测中取得更高分数。这意味着小米在 MiMo-V2.6 系列刚发布并开源后,已经开始对下一代 MiMo-V3 的底层架构进行预热。
从公开信息看,HySparse 2 的核心目标并不是单纯追求参数规模或榜单成绩,而是瞄准大模型实际运行中的一个关键痛点:当模型被用于智能体任务时,上下文会持续增长,模型不仅要理解历史对话,还要处理工具调用、网页内容、文档反馈等长文本观察结果。此时,预填充成本、KV 缓存大小和长上下文检索准确率,会直接影响推理速度、显存占用和任务完成质量。
HySparse 2 重点优化长上下文下的计算与缓存
根据罗福莉介绍,智能体推理是一种与普通问答不同的工作负载。在每一轮交互中,一个看似很短的动作,可能会返回大量需要重新预填充的文本观察结果;与此同时,模型上下文还会随着任务推进不断变长。这会让预填充计算、KV 缓存和检索能力同时成为系统瓶颈。
HySparse 2 的设计正是围绕这一问题展开。来源摘要显示,在 100 万 Token 长度下,该架构可以让预填充计算量降低 5.02 倍,KV 缓存缩小 4.5 倍。对于长上下文模型而言,这类优化具有较强的工程意义:FLOPs 降低意味着处理超长输入时计算压力更小,KV 缓存缩小则有助于降低显存或内存负担,从而让更长上下文的部署更具可行性。
同时,HySparse 2 还带来了更好的长上下文检索表现。来源显示,其 MRCRv2 和 RULER-v2 评分更高,AgentPPL 和 LongPPL 更低。这些指标指向同一个方向:在长上下文、智能体和长文本建模场景下,模型不仅要“装得下”,还要能更准确地从海量上下文中找到有效信息。
架构思路:KV Bridging 与 KV Reuse 降低重复开销
从技术描述看,HySparse 2 包含多个围绕 KV 缓存的结构设计。其中,KV Bridging 遵循 YOCO 思路,让交叉解码器中的全注意力层利用自解码器的隐藏状态来构建 K/V。这一设计使得交叉解码器相关 KV 缓存可以来自自解码器,从而改变传统长上下文处理中的部分缓存构建方式。
另一项关键机制是 KV Reuse。在每个混合块内,稀疏层会复用前一层全注意力层的 KV 缓存和选择索引。简单理解,这相当于减少层与层之间重复构建和保存信息的开销,让模型在保持长上下文能力的同时尽量压缩资源消耗。
来源还提到 HySparse 2 有两项进一步改进:其一是用 Token 级别的选择替代块级别选择,使注意力选择更细粒度;其二是用近期 Token 的强制窗口替代独立的 SWA 分支,让本地和全局 Token 共享同一个 KV 缓存。由于所有交叉解码器 KV 缓存现在都来自自解码器,预填充在自解码器完成时即可停止,这也是其降低预填充成本的重要原因之一。
- 在 100 万 Token 长度下,预填充计算量降低 5.02 倍;
- 在 100 万 Token 长度下,KV 缓存缩小 4.5 倍;
- MRCRv2、RULER-v2 评分更高,长上下文检索表现提升;
- AgentPPL、LongPPL 更低,更适合智能体和长文本推理工作负载;
- 通过 KV Bridging、KV Reuse 等机制减少长上下文推理中的重复开销。
影响解读:小米大模型路线开始强调“可运行的长上下文”
对中文 AI 产业观察而言,MiMo-V3 与 HySparse 2 的信息释放有两个值得关注的信号。第一,小米的大模型布局正在从模型发布进入更底层的架构优化阶段。相比单纯发布一个新模型名称,围绕预填充、KV 缓存和长上下文检索进行改造,更贴近大模型在真实产品和智能体系统中的部署难题。
第二,长上下文正在成为智能体模型的重要基础能力。随着 AI Agent 需要持续读取文档、解析网页、调用工具并整合多轮反馈,模型能否在超长上下文中保持低成本和高准确率,将直接影响自动化办公、复杂搜索、代码协作、多模态助手等应用的体验。HySparse 2 选择从架构上压缩计算和缓存开销,说明小米 MiMo-V3 可能会更重视面向智能体应用的运行效率,而不只是离线评测能力。
值得注意的是,就在昨日凌晨,小米刚发布并开源了全新的 Xiaomi MiMo-V2.6 系列,包括 Pro 与 Flash 两个原生全模态模型。小米方面称,这是其探索 RSI(递归自我改进)路径的关键一步,通过规模化扩展强化学习算力,让模型在持续探索与反馈中拓展智能边界。此次 MiMo-V3 架构信息紧随其后出现,也显示出小米正在以较快节奏推进 MiMo 系列的模型迭代。
总体来看,HySparse 2 的价值在于把长上下文从“能支持多长”进一步推进到“以多低成本支持、以多高准确率使用”。对于未来 AI 工具、智能体系统和终端侧 AI 产品而言,这类工程效率优化可能比单一参数规模更能决定落地效果。接下来,MiMo-V3 何时正式发布、是否延续开源策略,以及 HySparse 2 在实际应用中的表现,将是值得持续关注的重点。