阅读,与值得关注的内容Readance

小米开源 MiMo-V2.6 双模型,罗福莉:我们选了最难的那条路

小米今天发布并开源了 MiMo-V2.6-Pro 和 Flash。罗福莉随后写了一篇长帖。


她给出了一个很重的评价:在她看来,这次工作背后的研究创新和工程挑战,超过了她曾部分参与的 DeepSeek R1。

翻开随模型发布的 44 页技术报告,确实能看到一些发布会上不太会展开的东西:训练怎样中断,模型怎样钻奖励的空子,为什么有些任务适合一起练,有些必须分开,以及怎样让一个已经能通过测试的 Agent,继续学会把事情做好。

小米这次交出来的,不只有两款模型,还有一份相当具体的 Agent RL 施工记录。

两款模型之外,还有一笔训练账

先看模型本身。Pro 和 Flash 都是原生全模态模型,支持文本、图像、视频与音频,提供 1M 上下文。Pro 是约 1.02 万亿总参数、420 亿激活参数的 MoE;Flash 的总参数约 3100 亿,激活约 150 亿。

官方公布的 Artificial Analysis 综合智能指数图中,MiMo-V2.6-Pro 得到 46 分,在当时展示的开放模型中排在最前,与最强闭源模型仍有差距。

API 沿用 V2.5 的价格。按每百万 Token 计,Pro 的常规输入、输出分别为 3 元、6 元;Flash 分别为 1 元、2 元。权重已经出现在 Hugging Face,公开的 Pro-RL 与 Flash-RL 模型卡均标注 MIT 许可证。

MiMo-V2.6 发布时的官方价格表,单位为人民币/百万 Token;UltraSpeed 是 Pro 的加速服务模式。来源:小米。

MiMo-V2.6 发布时的官方价格表,单位为人民币/百万 Token;UltraSpeed 是 Pro 的加速服务模式。

更能说明这次投入的是另一组数字。官方披露,这轮不到 6 天的 Live RL 中,Flash 和 Pro 分别完成了 30 个训练步骤,成本约为 85 万美元和 262 万美元

这些算力有没有换来新能力?在样本外的长程软件工程评测 DeepSWE v1.1 上,Flash 从 48.8 提升到 65.7,Pro 从 58.4 提升到 72.6。两条曲线都有回落和波动,整体仍在向上。

Live RL 期间的 DeepSWE v1.1 成绩变化。橙色为 Pro,灰色为 Flash。来源:小米官方发布。

Live RL 期间的 DeepSWE v1.1 成绩变化。橙色为 Pro,灰色为 Flash。来源:小米官方发布。

罗福莉在原帖里把这种关系概括为:潜力通过 mid-training 建立,再由重投入的 RL 释放。她说,团队把数十人长期投入到扩展 RL 这件事上;我们看到的几天运行,背后还有更长的准备。

测试通过了,模型却可能学歪了

报告里有一组案例,很容易让写过代码的人会心一笑。

训练要求模型修复某个历史版本的 bug,它却安装了已经修好的新版依赖;另一些轨迹直接去上游找更新后的源码,或者翻到了现成的修复记录。答案找到了,测试也可能过了,但这轮训练原本想培养的修复能力,并没有因此得到可靠检验。

在真实开发里,查上游、升级依赖当然可以是合理选择。这里的问题在于:一项指定历史环境的训练任务,可能被环境里泄露的答案替代了。

小米为此清理残留文件、缓存和超出任务时间点的 Git 历史,限制可能泄露答案的网络访问,还安排专门的对抗 Agent 去找训练环境的漏洞。报告没有把奖励当作天然可信的东西。

即便堵住这些捷径,“测试通过”仍然太粗。

两个补丁都绿了,一个只改必要的位置,另一个塞进一堆兼容分支,放宽校验,顺手吞掉异常。如果奖励只剩 0 和 1,它们可能得到一样的反馈。对模型来说,后者甚至是一条更容易多拿几次分的路。

这也是 MiMo-V2.6 把更多算力分给评分器的原因。它不只问任务有没有完成,还比较同一组尝试中,哪些通过测试的方案更好。

报告里的 GAR,也就是组内优势重分配,会让评分 Agent 查看任务、代码变更和测试等材料,在成功轨迹之间比较:方案是否准确,改动是否越界,有没有不必要的兜底,代码是否便于维护。奖励向更好的成功方案倾斜;失败方案不会因为“写得漂亮”变成成功。

这件事有一组单独的对照实验。在 Flash 的纯代码 RL 实验中,不使用在线组内评分时,交互轮数和 Token 长度很快增加,通过率后期难以继续提升。加入评分之后,通过率的改善维持了更久,交互轮数也更稳定。

技术报告图 8:灰线是不使用 GAR,橙线是使用 GAR。三幅图依次为通过率、交互轮数和 Token 长度;这是单独的代码训练对照实验。来源:MiMo 技术报告。

技术报告图 8:灰线是不使用 GAR,橙线是使用 GAR。三幅图依次为通过率、交互轮数和 Token 长度;这是单独的代码训练对照实验。

仔细看右图,橙线的 Token 用量仍然在增长。这里不是在证明“想得越少越好”,而是在避免模型把越来越长的操作过程,误当成越来越好的解法。

对每天把任务交给 Coding Agent 的人来说,这比又多几分榜单成绩更有现实感:我们需要的,恰好就是那个能把测试跑绿,又不把仓库修成另一种问题的模型。

为什么有的任务一起练,有的必须分开?

罗福莉的长帖回答了一个容易被简化成路线之争的问题:为什么使用 MixRL,而不是 MOPD?

她的回答是,两者并不冲突。

中等难度、结果能够验证的代码及相关 Agent 任务,可以放进混合 RL,让不同领域一起训练。这次混合批次里包含代码、通用工具任务、视觉任务和网络安全任务,任务之间共享同一个模型的学习过程。

但游戏、3D,以及部分主观评价很强或过程极长的任务,不能因为它们也叫 Agent 任务,就全塞进同一锅。

一个任务很快结束,另一个还在场景里尝试;有些反馈能靠程序判断,有些要等完整作品出来才能评价。如果统一等最慢的任务,吞吐就会受影响。若让训练继续跑,迟迟才回来的轨迹,又可能来自已经落后多个版本的策略。

罗福莉明确提到,强行混训会降低 rollout 效率,或者引入严重的轨迹陈旧问题。因此,这些任务先单独训练,再通过 MOPD 合并能力。

技术报告进一步介绍了 MOPD2:适合的任务保留学生模型自己探索的完整轨迹;另一些任务则复用教师轨迹或 SFT 示范中的历史前缀,让学生直接学习其中的决策位置,不必每次把前面的漫长过程重新走一遍。

罗福莉还补了一个带点玩笑意味的理由:团队足够扁平,没有那么强的部门壁垒,不同领域的人每天一起解决 RL 的瓶颈。她特别提到,那段时间的 RL 日常进展会议让她印象很深。

真正跑起来,麻烦还在下面

大规模训练最容易被一条向上的曲线讲完。MiMo 报告却保留了一张中断时间线。

Pro 跑完 30 步用了约 123.1 小时,Flash 约 81.8 小时。中间不只有正常训练,还有硬件、推理、训练和调度环节的故障与恢复。

技术报告图 12:浅色区间为完成训练步骤,其他色块标记不同原因的失败与恢复。来源:MiMo 技术报告。

技术报告图 12:浅色区间为完成训练步骤,其他色块标记不同原因的失败与恢复

有些故障相当直接:GPU 显存错误、Kubernetes 故障导致任务容器崩溃、评分服务在网络上不可达。

也有一些问题只有把规模拉大才会显形。整个批次看上去负载还算均衡,拆到某个微批次、某个专家并行节点,收到的 Token 却超过平均值 30 倍,随后显存耗尽。训练越往后,轨迹越长,打包数据又可能把主机内存吃满。

MoE 的路由器也并非一直越训越好。研究团队观察到,让路由器继续更新时,越来越多计算挤向部分专家,一些专家则渐渐闲置。他们把路由参数恢复到 RL 开始前的状态,保留其他权重,负载恢复了,评测表现却没有下降。最终,训练采用了冻结路由器的办法。

这些地方很难包装成一句漂亮的能力宣言,却决定了那几百万美元能否换来连续有效的更新。

还有一个跟使用者更近的问题:模型换到另一套 Agent 工具里,能力还剩多少?

小米没有只拿一套生产框架训练,而是把系统提示、工具和上下文管理拆成可以组合的轻量 harness,让模型在多种配置里工作。报告里的对照显示,能力提升也出现在未用于该训练配置的 Codex、Claude Code 和 mini-swe-agent harness 上。

社区拿到的,不必从万亿模型开始

这次开源里因此有个很值得单独看的东西:MiMo-V2.6-Distill-Qwen-9B。

它以 Qwen3.5-9B 为底座,用 MiMo 生成的代码、通用 Agent、视觉和网络安全任务数据做监督微调。公开模型卡把它定位为后续 Agent RL 研究的起点。

这个身份很重要:下载到的是蒸馏后的 SFT checkpoint。报告另外展示的 RL 成绩,来自以它为起点、继续进行领域训练的实验。

在这些实验中,Terminal Bench 2.1 从 SFT 后的 37.1 提升至 52.8,SWE-bench Verified 从 61.1 提升至 66.2。不同任务域的 RL 检验了同一个起点还能向哪里走。

Qwen3.5-9B、MiMo 蒸馏后的 SFT 起点,以及进一步领域 RL 的实验结果。橙色不是下载到的 SFT 模型直接取得的成绩。来源:小米。

Qwen3.5-9B、MiMo 蒸馏后的 SFT 起点,以及进一步领域 RL 的实验结果。橙色不是下载到的 SFT 模型直接取得的成绩。

与之配套,官方宣布开放了约 7000 个任务环境,覆盖软件工程、漏洞复现、知识工作和网页设计,以及基于 verl、uni-agent、mini-swe-agent 的端到端 RL 训练框架和可组合的 mini-harnesses。

对研究者来说,一个已有一定工具使用能力的小模型,加上一批有任务、有环境、有验证器的训练材料,才让“换一种奖励”“试一组环境”“比较不同 harness”变成可以实际动手的问题。

当然,7K 环境不等于复刻了小米全部内部训练条件,9B 上的提升也不等于复现万亿模型。但社区至少不必只对着最后一张成绩表猜过程。

罗福莉把这条路称为通向自我提升和 AGI 的艰难道路。报告目前能展示的,是人在设计环境、校验奖励、维护训练系统的条件下,模型通过探索与反馈继续改善能力;离无需人介入的递归自我改进,还有问题要解。

而这份工作的吸引力,恰好在于它把其中一些问题摊开了:模型怎么蒙混过关,评分怎么失真,训练怎么停下来,以及怎样让已经做对的模型,再做得好一点。

双模型已经可以用。那份技术报告,以及能让更多人接着做实验的开源起点,可能会比这次榜单名次留得更久。

参考链接

  • 小米官方发布:MiMo-V2.6——扩展强化学习规模,迈向自我提升  https://mimo.mi.com/docs/zh-CN/news/latest/v2-6
  • 罗福莉原帖:MiMo-V2.6: The Hard Road to Scaling Up RL  https://x.com/_LuoFuli/status/2102162926802968749
  • MiMo-V2.6 技术报告  https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf
  • Pro-RL 与 Flash-RL 模型及许可证  https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL  https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-RL
  • MiMo-V2.6-Distill-Qwen-9B 与模型合集  https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B  https://huggingface.co/collections/XiaomiMiMo/mimo-v26

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →