查看: 10|回复: 0

小米 MiMo-V2.6 强化学习训练实时直播:总成本已超220万美元,未来逐步开源

[复制链接]
发表于 昨天 01:25 来自手机 | 显示全部楼层 |阅读模式
小米团队的 Fuli Luo 在社交媒体上公布了 MiMo-V2.6 强化学习(RL)训练的最新进展。目前该模型的训练正在实时运行中,所有数据和指标都可以通过官方页面实时查看。

训练规模与成本

从实时仪表盘数据来看,整个训练项目的总成本已经超过了 221 万美元。其中:

mimo-v2.6-pro 版本当前运行至第 19 步,累计消耗约 151 万美元,共训练了 42.2B tokens。

mimo-v2.6-flash 版本进度更快,已到达第 26 步,累计消耗约 70.6 万美元,共训练了 68B tokens。

每一步的训练规模约为 20 亿 tokens,采用 1568 个提示词 × 16 次 rollout 的方式,完全异步执行。

三大技术方向扩展

这次训练聚焦于探索强化学习的扩展能力上限,主要在三个维度上进行扩展:

计算能力扩展:超大规模的 step 级别 token 消耗和完全异步的 rollout 机制。

环境与框架扩展:支持多任务智能体强化学习,可以在一次运行中混合多个框架。

评分计算扩展:在智能体内部进行信用分配,结合测试用例和评分标准进行奖励计算。

训练过程中的挑战

从公告栏可以看到,训练过程并非一帆风顺。团队遇到了 GPU 显存溢出(OOM)、专家负载不均衡、网络连接问题、节点 VRAM 故障等多种工程挑战,并多次重启训练。例如 pro 版本在第 17 步因显存问题重启,团队随后调整了并行训练策略;flash 版本也从第 15 步重启过。

评测指标表现

从 benchmark 图表来看,两个版本在 DeepSWE v1.1、In-house Coding Bench 和 AutomationBench 等代码与自动化任务评测集上都有稳定的上升趋势。其中 pro 版本在 In-house Coding Bench 上达到了 62.26 分,flash 版本在 dynsam 指标上略高于 pro 版本。

开源计划

Fuli Luo 表示,未来几周团队将逐步开源相关技术细节。实时训练流页面为 mimo.xiaomi.com/rl/,任何人都可以在线查看训练进度。

scaled_1000155320.webp
万狸温馨提示:理性消费
1.数码选品:先定用途,再比参数,拒绝 “加点钱更好” 的超支诱惑。
2.购车决策:看平台生命周期,算长期使用成本,刚需比潮流更重要。
3.重点提醒:多查真实评价,少信首发噱头,买得对远比买得新划算。
4.交流准则:聊产品讲实际体验,不抬杠不诋毁品牌,友善分享。
5.氛围维护:遇到分歧先理性沟通,不贴“粉黑”标签,温馨交流。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注QQ群
手机版|小黑屋|万狸社区-免费活跃数码论坛,手机/电脑/汽车+旅游美食游戏兴趣社区

相关侵权、举报、投诉及建议等,请发 E-mail:572109352@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|桂ICP备16003785号

在本版发帖
客服QQ:572109352
QQ客服返回顶部