科技与AI今日必读

小米公布MiMo V3采用的HySparse2稀疏架构,瞄准长上下文Agent推理

小米9月24日公布下一代模型MiMo V3的HySparse2架构

小米MiMo大模型团队负责人罗福莉9月24日公布了HySparse2架构,这是小米下一代大模型MiMo V3的核心架构,相关论文于9月23日发布在arXiv上。据界面新闻报道,这套架构主要面向长上下文Agent场景:要以更低成本处理网页、文件、代码和工具调用记录,并在越积越长的任务历史里更准确地找出关键信息。鉅亨網刊出的技术解读给出了具体数字:上下文达到100万token时,预填充计算量(FLOPs)比对照架构低5.02倍;KV缓存压缩约4.5倍,为2.69GB,前代HySparse为6.72GB;RULER-v2长上下文检索测试在256k上下文下得58.45分。架构的关键是“两级KV共享”:模型前半部分作为self-decoder,后半部分作为cross-decoder,后者的KV缓存直接从前者投影得到。因此预填充节点只需部署25层(共49层),约为模型权重的一半。MiMo V3本身尚未推出,小米目前已开源的是MiMo-V2.6。

Agent执行任务时要反复读入搜索结果和工具返回内容,预填充成本和KV缓存占用因此成了推理成本的大头。小米先公开架构和论文,把降本重点放在预填充环节,走的是一条和单纯扩大参数规模不同的路线。小米是手机厂商,自研大模型的技术路线也会影响其终端与汽车业务的AI能力。

如果论文中的效率数字能在MiMo V3上兑现,长上下文Agent的推理成本和显存需求会明显下降,小米在国内开源模型的价格战中也更有空间压低API成本。对其他模型厂商来说,稀疏注意力与KV共享类架构又多了一个可对照的公开方案。

后续关注

关注MiMo V3的正式发布时间、是否继续开源、API定价,以及第三方评测能否复现论文中的预填充与KV缓存数据。

信息来源

  1. 界面新闻媒体报道 · zh · 2026年9月24日发布
  2. 鉅亨網媒体报道 · zh · 2026年9月24日发布

GFT Finance 整理归纳公开信息并总结要点,不构成投资建议。数据以来源原文为准。