小米直播训练MiMo-V2.6模型,罗福莉称沉寂半年钻研强化学习
9月17日,小米MiMo大模型负责人罗福莉发文称,自4月开源MiMo-v2.5后,小米沉寂近半年,花时间研究了一件事——强化学习究竟能扩展到多远。
罗福莉透露,MiMo-V2.6目前正处于强化学习中间阶段,团队为其扩展了三项能力:计算方面,每步约20亿个Token,1,568个Prompt×16条Rollout,完全异步;环境和工具方面,进行多任务智能体强化学习,一次运行中混合多个框架;Grader Compute方面,给打分/评分过程本身增加算力,即Agentic In-group Credit Assignment,包含测试案例和评分标准奖励。小米MiMo团队将在接下来的几周内逐步开源这些细节。
罗福莉还晒出了MiMo-V2.6模型的训练直播链接,总花费已超125万美元,直播页面显示MiMo-V2.6模型即将推出。