昨天小米发布并开源了 MiMo-V2.6 Pro 和 Flash,同时拿出一份 44 页的技术报告,这里面小米交代了一条更长的训练链:先准备能处理长上下文和多模态任务的模型,再让它在不同 Agent 环境里大规模探索,并解决探索结果怎样可靠地变成参数更新。
MiMo-V2.6 技术报告首页。标题提出「迈向自我改进」,摘要概括了模型底座、训练规模、任务环境与评分器四条线索。来源:小米官方技术报告,第 1 页。
先看交付物。Pro 是总参数 1.02 万亿、每个 Token 激活约 420 亿参数的 MoE 模型;Flash 是总参数 3100 亿、激活约 150 亿参数的 MoE 模型。两者都接收文本、图像和音频等输入。报告还发布了从 MiMo 轨迹蒸馏出的 9B 模型,以及约 7000 个代码、网络安全、通用工作和视觉任务环境、训练框架与可组合的 Agent harness。
成绩也不只落在一张代码榜上。报告最终结果表中,Pro 和 Flash 在 DeepSWE v1.1 分别为 71.9 和 67.9,在 AutomationBench v1.0.6 分别为 53.1 和 52.3,在内部视觉开发基准 MiMo Visual Coding 分别为 72.3 和 71.5;还报告了网络安全任务的成绩。各项基准的设置不同,不能把这些数字相加成一个「综合能力」。更有说服力的是训练过程:两款模型各跑 30 步 RL,代码、通用工作流和视觉任务的曲线都随训练总体上升,而不是只展示终点的单次截图。
报告图 3 把其中一条曲线和成本放在一起:DeepSWE v1.1 的 average@3,Pro 从 58.4 升到 72.6,Flash 从 48.7 升到 65.7。。 一次更新使用 1568 个任务提示,每题采样 16 条轨迹,约 2.5 万条;两款模型各 30 步,单次运行约 75 万条轨迹。每步处理 27 亿至 37 亿 Token,Pro 和 Flash 的 RL 成本分别约为 260 万和 90 万美元。
报告图 3:左侧是 DeepSWE v1.1 的 average@3 随累计 RL 成本变化;右侧拆分 Pro 与 Flash 的训练、采样和评分成本。
RL 之前,模型已经被准备成什么样
这份报告用了专门章节讲架构、预训练和 mid-training,原因很实际:长程 Agent RL 不是从一张白纸上开始。模型要在环境中反复读代码、看界面、调用工具、接收反馈,底座如果承受不了长输入和多模态内容,后面增加采样数量也无从谈起。
Pro 和 Flash 使用混合滑窗注意力与全局注意力的稀疏 MoE 主干,视觉和音频编码器把各模态输入接到同一序列中。滑窗层控制长序列的计算,全局层周期性让远处信息交互。图 2 展示的是这个模型结构,不是一张 RL 流程图;右侧多 Token 预测模块服务于生成效率,不能把它误读成评分器。
报告图 2:视觉、音频与文本输入进入 MiMo 的混合滑窗/全局注意力主干;右侧为多 Token 预测模块。
预训练先做文本,再联合训练图像、视频和音频。随后,agent-centric mid-training 加入代码、通用工具、视觉和研究任务的轨迹,把上下文从 256K 延伸到 1M,并为后续大 batch 优化切换部分参数的优化器和低精度训练设置。预训练提供知识和感知能力,mid-training 扩大模型可探索的任务空间,RL 才负责在真实交互与反馈里强化选择。 最终成绩由这些阶段共同形成,不能全部记在某一种奖励技巧名下。
轨迹更多了,先保证每类任务真能进入更新
MiMo-V2.6 把代码、通用、视觉和网络安全任务混在一次 RL 中。问题是不同任务的运行时间相差很大:报告统计的 25 路数据里,平均生成长度相差约 90 倍,活跃执行时间相差约 66 倍。异步系统若简单地让「先跑完的先进入 batch」,模型实际学到的任务配比,就会偏向短而快的环境。
Sample Mixer 不是仅按目标比例派发任务。它估计各路任务的完成时间和过滤后接受率,为慢任务安排更多并发;某一路在当前 batch 还缺样本时,再提高它的调度权重。这解释了为什么训练基础设施也是方法的一部分:如果视觉或长程任务名义上在数据配方里,更新时却总赶不上,所谓「联合训练」就会缩水。报告给出调度模拟与实际异质性,但没有单独把最终模型增益拆给 Sample Mixer。
一旦批次凑齐,下一道问题更棘手:同一道题的 16 条轨迹,怎样决定哪条值得模型继续模仿?
测试都过了,为什么还需要评分 Agent
以代码任务为例。假设一组补丁全部通过测试,二元奖励全为 1,组内相对优化就失去了区分信号。可其中一份可能只改必要的几行,另一份虽然过测,却顺手吞掉异常、放宽校验,留下测试没覆盖的副作用。增加采样可以找到更多成功解法,却不能靠同一个 1 分辨它们。
报告把质量判断接在两个不同的位置。GRS 改奖励。 对一部分高通过率任务,评分 Agent 先从任务、仓库和离线尝试中整理可复用的实现与行为标准;在线训练时再看新轨迹及执行环境。简化写法是 最终奖励 = 测试奖励 × 实现质量分 × 行为质量分。没过测仍为零,全过测的小组却可以因质量差异产生不同奖励。离线整理的是任务标准,不能把某条旧轨迹的做法定成唯一答案。
报告图 7a:GRS 先离线形成任务标准,在线对新轨迹细化奖励。
GAR 改优势。 它主要面对有成有败的代码任务组:先保留测试成败,确认利用答案泄漏等问题的轨迹按失败处理,再比较成功补丁的质量,把更多正向更新权重给更好的实现。比如两条通过、一条失败,按 Aᵢ = Rᵢ − 组内平均奖励,初始优势是 +1/3、+1/3、−2/3。若两份成功补丁的质量因子是 1 和 0.5,在未触发缩放上限的简化算例中,正向优势可重分为 +4/9、+2/9,失败仍为 −2/3。实际算法还有限幅和重新中心化;这里的数值是按公式构造的说明,不是论文中的训练样本。
报告图 7b:GAR 在线比较同组轨迹,把更多正向优势分给质量更高的成功补丁。
这个区别决定了能从实验读出什么。报告用 Flash 做了一组纯代码 RL 消融,比较有无 GAR:不加 GAR 时,交互轮数更快增长,后期通过率难以继续提高;加入 GAR 后,轮数大致稳定,通过率改善延续到第 52 步。Token 长度依然增长,所以观察不是「模型被简单训练得更短」,而是在更长的尝试中没有同样快地失去任务收益。该实验 batch 为 128、使用 token-mean loss,不能直接把曲线上的改善等同于 Pro/Flash 全部最终成绩。
报告图 8:Flash 纯代码 RL 的 GAR 消融。橙线为使用 GAR,三列依次是通过率、交互轮数和生成长度;注意长度仍在增长。
长轨迹还有组内排序之外的问题。一条最终成功的执行,途中也可能调用过错误工具。MiMo 把可检测的格式和工具调用错误标到具体片段,不让成功轨迹中的错误片段获得正向强化;对失败轨迹中的错误片段则加重负向信号。长度惩罚也只在同题已有足够成功解法时,才拿成功轨迹的组内长度作参照。前者处理明显错误动作,后者处理成功后的效率,都不能替代 GRS/GAR 对整条轨迹的比较。
有了奖励,还要保证梯度对准原来的执行
Pro 是 MoE 模型。报告在可训练 router 的对照中观察到专家负载逐渐失衡:第 9 层的峰值负载从均值约 6 倍升到 16 倍,几乎闲置的专家占比从 0.5% 到 22%。只把第 20 步 checkpoint 的 router 参数恢复到 RL 前,专家负载接近初始状态,当时的评测表现基本不变。因此主训练冻结 router。这个对照支持「负载塌缩主要来自路由漂移」的诊断,也意味着本轮 RL 放弃了继续学习新的专家分配方式。
报告图 11:Pro 第 9 层专家负载。橙线为不冻结 router,蓝线为冻结;三列分别观察离散程度、峰值和冷专家比例。
冻结 router 和路由重放不是一件事。 即使参数不更新,采样轨迹的 SGLang 与训练端的 Megatron-LM 仍可能因数值差异选中不同专家。训练侧若沿另一条路径重算概率,就没有准确对应生成时那条轨迹。MiMo 记录采样时的专家 ID 并重放,还对齐 MXFP4 权重口径、top-p 截断后的候选集合。前面花算力细分出的优势,要落在实际发生过的生成上,这些工程细节才不是外围优化。
另一项实验回答「能力是否只熟悉训练用的工具壳」。团队用四套轻量代码 harness 训练,再在未参与训练的 Codex、Claude Code 和 mini-swe-agent harness 中测 DeepSWE v1.1。后三者的平均 Pass@1 从约 50% 升到约 66%,尽管每条曲线有波动。这支持能力能够跨执行框架迁移;它并非「多 harness 单独带来 16 个百分点」的消融,同一轮还包含模型与训练系统的其他变化。
报告图 10:左侧为训练使用的四套 harness,右侧为留出的三套 harness;粗线是各组均值。
一次混合 RL 之外,还有什么
报告没有声称所有能力都适合塞进同一次联合 RL。可验证、难度适中的任务可以在 MixRL 中一起探索;极长程、主观评价强或验证代价过高的任务,单独训练教师再合并能力。MOPD2 在保留学生完整自主轨迹的同时,还允许学生从教师轨迹或示范的历史前缀接着生成一个新回合,由教师提供监督。这样训练中间决策时,不必每次都从任务起点重新跑完整段历史。
小米把 MiMo 生成的经验蒸馏进 Qwen3.5-9B,得到 MiMo-V2.6-Distill-Qwen-9B,再让这个小模型在公开环境里分别做领域 RL。报告表 6 的 11 项评测均较该模型的 SFT checkpoint 提升。这为外界研究 Agent RL 提供了可用起点。
读完整份报告,再回看标题里的「自我改进」,它描述的是研究方向:让模型在复杂环境中探索、得到更好的反馈并持续提升任务能力。MiMo-V2.6 展示了两款全模态模型在多类 Agent 任务上的进步,也公开了让大规模训练有效运转的一套方法。
参考链接
MiMo-V2.6 官方技术报告(PDF):https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf 小米 MiMo-V2.6 发布说明:https://mimo.mi.com/docs/zh-CN/news/latest/v2-6 罗福莉关于 MixRL 与 MOPD2 的说明:https://x.com/_LuoFuli/status/2102162926802968749