小米MiMo-V3启用全新架构:HySparse 2大幅压缩预填充与KV缓存
9月24日,小米MiMo大模型负责人罗福莉今天发文宣布,MiMo-V3即将换上全新架构,其核心HySparse 2也在今天发布。这套新架构主打三件事:更少的预填充、更小的KV缓存,以及更出色的长上下文检索能力。具体来看,在100万Token的长度下,预填充计算量下降了5.02倍,KV缓存缩小了4.5倍,同时MRCRv2和RULER-v2评分更高,AgentPPL和LongPPL则更低。
罗福莉解释了为什么要这么改。智能体推理是一种截然不同的工作负载,每一轮交互里,一个简短的动作就可能返回一大段需要预填充的长文本观察结果,而上下文还在不停增长,这就让预填充成本、KV缓存大小和检索准确率同时卡在关键路径上。为此,HySparse 2做了几处设计:KV桥接沿用YOCO思路,让交叉解码器里的全注意力层借助自解码器的隐藏状态来构建自己的K/V;KV重用则让每个混合块内的稀疏层直接复用前一层全注意力层的KV缓存和选择索引。
除此之外还有两项改进,一是用Token级别的选择取代块级别的选择,二是用近期Token的强制窗口取代独立的SWA分支,让本地和全局Token共用同一个KV缓存。由于所有交叉解码器的KV缓存现在都来自自解码器,预填充在自解码器阶段完成就可以停下。值得一提的是,就在昨天凌晨,小米刚发布并开源了Xiaomi MiMo-V2.6系列,包含Pro与Flash两个原生全模态模型,被小米称为探索RSI(递归自我改进)路径的关键一步,它通过规模化扩展强化学习算力,让模型在持续的探索与反馈里拓展智能边界。