小米发布并开源MiMo-V2.6系列:超越Kimi K3、GLM-5.3,成为AA指数排名最高的开源模型

2026-09-22 15:15:00   |   棠糖   |   4111

9月22日,小米正式发布并开源全新的Xiaomi MiMo-V2.6系列,包含Pro与Flash两个原生全模态模型。小米称这是其探索RSI(递归自我改进)路径的关键一步,通过规模化扩展强化学习算力,让模型在持续的探索与反馈中拓展智能边界。

得益于RL算力的扩展,MiMo-V2.6-Pro在Artificial Analysis Intelligence Index(AA综合智能指数)v4.3.2中取得46分,超过Kimi K3(44分)和GLM-5.3(45分),成为当前AA指数上排名最高的开源权重模型,较其前代MiMo-V2.5-Pro的26分高出20分。小米官方同时说明,该模型与Claude Fable 5.1和GPT-6 Astra(均为53分)等顶级闭源模型相比仍有差距。

在RL训练阶段,MiMo-V2.6可能是目前国产开源模型中投入RL算力最多的模型之一。Pro与Flash训练历时不到6天,成本分别约262万美元与85万美元,各完成30步,累计约75万条轨迹。训练任务平均通过率分别相对提升25%和12%,样本外的长程软件工程评测基准DeepSWE v1.1分别提升约17分(48.8至65.7)和约14分(58.4至72.6)。

本次训练从三个维度扩展RL算力:更大的Batch与更高吞吐,单次更新使用1568个样本,支持100万上下文长度训练,单步训练Token达3.5至3.7B;更多任务与复杂环境,构建覆盖Code、General、Visual、Cyber等方向的多任务训练体系;更大的Grader算力,通过Group内相对比较为长程RL任务提供更精准的奖励信号。

能力扩展上,MiMo-V2.6融合了3D空间推理、多模态感知与计算机操作能力。在游戏开发中,用户输入图片、视频或文字后,模型可将需求拆解为多个任务,由多智能体协作完成3D场景搭建、交互逻辑编写与视觉验证。在具身仿真环境中,MiMo-V2.6可直接以多视角相机画面为输入,通过视觉反馈闭环控制Franka Panda机械臂,完成物体抓取、颜色匹配与精准放置。

科研方面,MiMo-V2.6-Pro协助研究人员完成了全氟和多氟烷基物质(PFAS)吸附用金属有机框架(MOF)材料的设计方案筛选,并在Lean 4中完成了Li-Yorke经典论文《周期三蕴含混沌》原始主定理的完整形式化,形成6000余行Lean源码,完整证明通过Lean内核核验。模型未接受过针对Lean的专项后训练。

MiMo-V2.6系列沿用V2.5系列的API定价:Flash为每百万词元输入1元、每百万输出2元;Pro为3元和6元,并提供99%缓存折扣。在同等智能水平下,价格仅为海外模型的1/20至1/60。伴随新模型发布,MiMo Desktop桌面客户端(支持Windows与Mac)及会员订阅方案同步上线,订阅会员即可使用MiMo-V2.6-Pro和Flash模型,也可配置自己的API Key使用客户端。MiMo Desktop同步上线MiMo-V2.6-Pro的UltraSpeed超高速模式,提供最高20倍的推理速度。

MiMo-V2.6系列已上线Xiaomi MiMo开放平台。原邀测活动将在1周后结束,已获得邀测资格的用户切换模型名称后方可继续使用。同时,小米全面开源MiMo-V2.6-Pro、Flash模型权重与技术报告,同步开放MiMo-V2.6-Distill-Qwen-9B及配套RL研究资源,分享经过验证的训练实践,具体包括:7k+高质量RL任务环境,覆盖软件工程、漏洞复现、知识型工作、网页设计开发四类智能体任务,以MiMo-V2.6-Distill-Qwen-9B为起点展开RL训练,在11项评测中均较SFT基线取得提升;端到端RL训练框架,基于verl、uni-agent和mini-swe-agent,覆盖环境交互、轨迹采集、奖励评估与策略优化的完整训练流程;轻量可组合的Harness,开源极简mini-harnesses,将系统提示、工具与上下文管理解耦,支持社区自由组合框架组件、拓展训练配置。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

小米发布并开源MiMo-V2.6系列:超越Kimi K3、GLM-5.3,成为AA指数排名最高的开源模型

2026-09-22 15:15:00 浏览量: 4111 作者: 棠糖

9月22日,小米正式发布并开源全新的Xiaomi MiMo-V2.6系列,包含Pro与Flash两个原生全模态模型。小米称这是其探索RSI(递归自我改进)路径的关键一步,通过规模化扩展强化学习算力,让模型在持续的探索与反馈中拓展智能边界。

得益于RL算力的扩展,MiMo-V2.6-Pro在Artificial Analysis Intelligence Index(AA综合智能指数)v4.3.2中取得46分,超过Kimi K3(44分)和GLM-5.3(45分),成为当前AA指数上排名最高的开源权重模型,较其前代MiMo-V2.5-Pro的26分高出20分。小米官方同时说明,该模型与Claude Fable 5.1和GPT-6 Astra(均为53分)等顶级闭源模型相比仍有差距。

在RL训练阶段,MiMo-V2.6可能是目前国产开源模型中投入RL算力最多的模型之一。Pro与Flash训练历时不到6天,成本分别约262万美元与85万美元,各完成30步,累计约75万条轨迹。训练任务平均通过率分别相对提升25%和12%,样本外的长程软件工程评测基准DeepSWE v1.1分别提升约17分(48.8至65.7)和约14分(58.4至72.6)。

本次训练从三个维度扩展RL算力:更大的Batch与更高吞吐,单次更新使用1568个样本,支持100万上下文长度训练,单步训练Token达3.5至3.7B;更多任务与复杂环境,构建覆盖Code、General、Visual、Cyber等方向的多任务训练体系;更大的Grader算力,通过Group内相对比较为长程RL任务提供更精准的奖励信号。

能力扩展上,MiMo-V2.6融合了3D空间推理、多模态感知与计算机操作能力。在游戏开发中,用户输入图片、视频或文字后,模型可将需求拆解为多个任务,由多智能体协作完成3D场景搭建、交互逻辑编写与视觉验证。在具身仿真环境中,MiMo-V2.6可直接以多视角相机画面为输入,通过视觉反馈闭环控制Franka Panda机械臂,完成物体抓取、颜色匹配与精准放置。

科研方面,MiMo-V2.6-Pro协助研究人员完成了全氟和多氟烷基物质(PFAS)吸附用金属有机框架(MOF)材料的设计方案筛选,并在Lean 4中完成了Li-Yorke经典论文《周期三蕴含混沌》原始主定理的完整形式化,形成6000余行Lean源码,完整证明通过Lean内核核验。模型未接受过针对Lean的专项后训练。

MiMo-V2.6系列沿用V2.5系列的API定价:Flash为每百万词元输入1元、每百万输出2元;Pro为3元和6元,并提供99%缓存折扣。在同等智能水平下,价格仅为海外模型的1/20至1/60。伴随新模型发布,MiMo Desktop桌面客户端(支持Windows与Mac)及会员订阅方案同步上线,订阅会员即可使用MiMo-V2.6-Pro和Flash模型,也可配置自己的API Key使用客户端。MiMo Desktop同步上线MiMo-V2.6-Pro的UltraSpeed超高速模式,提供最高20倍的推理速度。

MiMo-V2.6系列已上线Xiaomi MiMo开放平台。原邀测活动将在1周后结束,已获得邀测资格的用户切换模型名称后方可继续使用。同时,小米全面开源MiMo-V2.6-Pro、Flash模型权重与技术报告,同步开放MiMo-V2.6-Distill-Qwen-9B及配套RL研究资源,分享经过验证的训练实践,具体包括:7k+高质量RL任务环境,覆盖软件工程、漏洞复现、知识型工作、网页设计开发四类智能体任务,以MiMo-V2.6-Distill-Qwen-9B为起点展开RL训练,在11项评测中均较SFT基线取得提升;端到端RL训练框架,基于verl、uni-agent和mini-swe-agent,覆盖环境交互、轨迹采集、奖励评估与策略优化的完整训练流程;轻量可组合的Harness,开源极简mini-harnesses,将系统提示、工具与上下文管理解耦,支持社区自由组合框架组件、拓展训练配置。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号