小米直播训练MiMo-V2.6模型,罗福莉称沉寂半年钻研强化学习

2026-09-17 16:03:14   |   弘乐   |   6254

9月17日,小米MiMo大模型负责人罗福莉发文称,自4月开源MiMo-v2.5后,小米沉寂近半年,花时间研究了一件事——强化学习究竟能扩展到多远。

罗福莉透露,MiMo-V2.6目前正处于强化学习中间阶段,团队为其扩展了三项能力:计算方面,每步约20亿个Token,1,568个Prompt×16条Rollout,完全异步;环境和工具方面,进行多任务智能体强化学习,一次运行中混合多个框架;Grader Compute方面,给打分/评分过程本身增加算力,即Agentic In-group Credit Assignment,包含测试案例和评分标准奖励。小米MiMo团队将在接下来的几周内逐步开源这些细节。

罗福莉还晒出了MiMo-V2.6模型的训练直播链接,总花费已超125万美元,直播页面显示MiMo-V2.6模型即将推出。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

小米直播训练MiMo-V2.6模型,罗福莉称沉寂半年钻研强化学习

2026-09-17 16:03:14 浏览量: 6254 作者: 弘乐

9月17日,小米MiMo大模型负责人罗福莉发文称,自4月开源MiMo-v2.5后,小米沉寂近半年,花时间研究了一件事——强化学习究竟能扩展到多远。

罗福莉透露,MiMo-V2.6目前正处于强化学习中间阶段,团队为其扩展了三项能力:计算方面,每步约20亿个Token,1,568个Prompt×16条Rollout,完全异步;环境和工具方面,进行多任务智能体强化学习,一次运行中混合多个框架;Grader Compute方面,给打分/评分过程本身增加算力,即Agentic In-group Credit Assignment,包含测试案例和评分标准奖励。小米MiMo团队将在接下来的几周内逐步开源这些细节。

罗福莉还晒出了MiMo-V2.6模型的训练直播链接,总花费已超125万美元,直播页面显示MiMo-V2.6模型即将推出。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号