利好

MiMo-V2.6 或成开源模型最大规模单次 RL 训练

17:40

据 Woofun AI 消息,小米 MiMo 团队成员罗福莉披露,MiMo-V2.6 按算力规模计,可能是迄今开源模型团队开展的最大规模单次强化学习训练之一。团队在算力受限背景下,投入数十人长期推进强化学习扩展,使模型能力在中期形成并通过大规模训练进一步释放。

针对代码等可验证的中等难度任务,团队采用 MixRL 训练;对难以验证、超长周期或复杂度过高的任务则单独训练,再通过 MOPD 合并能力。为推动智能体强化学习研究,团队发布了由 MiMo 强化学习轨迹蒸馏而来的 Qwen 模型、7000 个多样化环境以及完整的强化学习训练框架。罗福莉表示,MiMo-V2.6 仅是起点,团队将持续投入资源推进可持续自我改进的智能系统。

WOOFUN AI

影响力评估 · 一键速读

MiMo-V2.6 的发布标志着开源社区在强化学习训练规模上取得重要突破,其采用的 MixRL 与 MOPD 混合策略为处理不同复杂度任务提供了新范式。通过蒸馏 Qwen 模型并开放 7000 个环境,该举措降低了智能体 RL 研究的门槛,可能加速开源生态中 Agent 能力的迭代。若后续能持续优化自我改进机制,MiMo 系列有望在通用智能体领域占据更有利的竞争位置。
WOOFUN AI 生成 · 仅供参考,非投资建议

评论

回复 @用户
0/800

暂无评论

消息提醒

登录后查看消息
查看全部消息管理订阅