小米MiMo-V3启用全新架构:HySparse 2大幅压缩预填充与KV缓存

2026-09-24 15:01:48   |   弘乐   |   4085

9月24日,小米MiMo大模型负责人罗福莉今天发文宣布,MiMo-V3即将换上全新架构,其核心HySparse 2也在今天发布。这套新架构主打三件事:更少的预填充、更小的KV缓存,以及更出色的长上下文检索能力。具体来看,在100万Token的长度下,预填充计算量下降了5.02倍,KV缓存缩小了4.5倍,同时MRCRv2和RULER-v2评分更高,AgentPPL和LongPPL则更低。

罗福莉解释了为什么要这么改。智能体推理是一种截然不同的工作负载,每一轮交互里,一个简短的动作就可能返回一大段需要预填充的长文本观察结果,而上下文还在不停增长,这就让预填充成本、KV缓存大小和检索准确率同时卡在关键路径上。为此,HySparse 2做了几处设计:KV桥接沿用YOCO思路,让交叉解码器里的全注意力层借助自解码器的隐藏状态来构建自己的K/V;KV重用则让每个混合块内的稀疏层直接复用前一层全注意力层的KV缓存和选择索引。

除此之外还有两项改进,一是用Token级别的选择取代块级别的选择,二是用近期Token的强制窗口取代独立的SWA分支,让本地和全局Token共用同一个KV缓存。由于所有交叉解码器的KV缓存现在都来自自解码器,预填充在自解码器阶段完成就可以停下。值得一提的是,就在昨天凌晨,小米刚发布并开源了Xiaomi MiMo-V2.6系列,包含Pro与Flash两个原生全模态模型,被小米称为探索RSI(递归自我改进)路径的关键一步,它通过规模化扩展强化学习算力,让模型在持续的探索与反馈里拓展智能边界。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

小米MiMo-V3启用全新架构:HySparse 2大幅压缩预填充与KV缓存

2026-09-24 15:01:48 浏览量: 4085 作者: 弘乐

9月24日,小米MiMo大模型负责人罗福莉今天发文宣布,MiMo-V3即将换上全新架构,其核心HySparse 2也在今天发布。这套新架构主打三件事:更少的预填充、更小的KV缓存,以及更出色的长上下文检索能力。具体来看,在100万Token的长度下,预填充计算量下降了5.02倍,KV缓存缩小了4.5倍,同时MRCRv2和RULER-v2评分更高,AgentPPL和LongPPL则更低。

罗福莉解释了为什么要这么改。智能体推理是一种截然不同的工作负载,每一轮交互里,一个简短的动作就可能返回一大段需要预填充的长文本观察结果,而上下文还在不停增长,这就让预填充成本、KV缓存大小和检索准确率同时卡在关键路径上。为此,HySparse 2做了几处设计:KV桥接沿用YOCO思路,让交叉解码器里的全注意力层借助自解码器的隐藏状态来构建自己的K/V;KV重用则让每个混合块内的稀疏层直接复用前一层全注意力层的KV缓存和选择索引。

除此之外还有两项改进,一是用Token级别的选择取代块级别的选择,二是用近期Token的强制窗口取代独立的SWA分支,让本地和全局Token共用同一个KV缓存。由于所有交叉解码器的KV缓存现在都来自自解码器,预填充在自解码器阶段完成就可以停下。值得一提的是,就在昨天凌晨,小米刚发布并开源了Xiaomi MiMo-V2.6系列,包含Pro与Flash两个原生全模态模型,被小米称为探索RSI(递归自我改进)路径的关键一步,它通过规模化扩展强化学习算力,让模型在持续的探索与反馈里拓展智能边界。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号