Xiaomi live-streams MiMo-V2.6 RL training, revealing costs and failures
Xiaomi's RL lead Luo Fuli announced the company is live-streaming the reinforcement-learning training of its MiMo-V2.6 Flash and Pro models, publicly showing training costs, reward curves, and hardware failures. After about 36 hours, the two models have incurred over $1.08 million in costs, averaging $30,000 per hour. Early results show capability gains, with Pro's dynsam/avg@n rising from about 0.565 to 0.614 and Flash from about 0.514 to 0.603, and DeepSWE v1.1 offline scores of 62.24 and 60.77 respectively.
Coverage timeline
量子位量子位
罗福莉沉寂半年官宣小米强化学习!直播新模型训练过程,一小时烧3万美元 梦晨 2026-09-17 09:09:25 来源: 量子位 奖励曲线、显卡故障全公开 梦晨 发自 凹非寺 量子位 | 公众号 QbitAI 什么情况?小米新模型的强化学习训练,直接开了现场直播。 点进去一看,这哪是训练现场啊,这就是烧钱现场,一眨眼就是10美刀,一分钟就是4000多元人民币出去了。 当然烧钱的速度可能不是均匀的,从pro模型开始训练算起36小时,两款模型已经花了超过108万美元, 平均每小时3万美元 。 要是别人干这事得喊一句误闯天家,但是小米干这事只能喊一句误闯米家了。 在这个页面上,训练花了多少钱、跑了多少步、奖励曲线涨没涨、哪个节点的显卡出了故障,全部公开可查。 见过开放权重、开放训练代码和开放训练数据的,开放训练过程的还真是没见过,围观群众纷纷大呼过瘾。 那么目前MiMo-V2.6的Flash和Pro两款模型训练得怎么样了? 其实还在初期,毕竟刚开始训练1天多一点。 不过已经能看出两者在RL过程中都有了比较明显的能力提升: Pro的dynsam/avg@n从第1步的约0.565提升至0.614,Flash则从约0.514提升至0.603;最新公开的DeepSWE v1.1离线评测中,Pro和Flash分别达到 62.24和60.77 。(对比DeepSeek-Flash v1.1是74.2%) Flash从更低的起点快速追近,Pro目前只保持小幅领先。不过Pro训练完一个Step更慢,所以最新的评分还没出来。 自4月份开源MiMo-v2.5后,小米沉默了近半年。 现在负责人罗福莉出来解释,这期间只研究了一件事: 强化学习能扩展到多远 。 小米公开如何Scaling强化学习 传统的预训练scaling很容易理解: 更多数据 × 更多参数 × 更多算力 → 更强模型 现在前沿模型越来越关注 RL能不能也这样scaling? 也就说如果持续增加: 每轮生成多少轨迹; 模型面对多少种真实任务环境; 为判断这些轨迹好不好投入多少计算; 模型能力是否还能持续提高? 小米给出的答案是沿三个维度扩展: 训练计算量、环境/执行框架、评分计算量。 ####训练计算量的Scaling 第一个维度最直观,就是把RL本身的计算规模做大。 MiMo-V2.6系列每个训练Step大约会处理 20亿To
