阅读,与值得关注的内容Readance

小米开源 MiMo-V2.6:模型权重之外,连强化学习训练方法也公开了

小米发布 MiMo-V2.6,并把强化学习训练所需的模型、环境、代码和工程方法一起公开。对模型开发者来说,能拿到的材料从一个权重文件扩展成了一套可继续实验的训练系统。

2 款

Pro 与 Flash。

7000+

强化学习任务环境。

1M

上下文长度。

图注:小米官方引用的 Artificial Analysis Intelligence Index 图表,MiMo-V2.6-Pro 标注为 46 分。

一次发布,公开了四层东西。

小米这次发布的 MiMo-V2.6 系列包含 Pro 和 Flash 两款原生全模态模型。官方页面将它们用于代码、通用任务、视觉任务和网络安全训练。两款模型支持文本、图像、视频和音频输入,也保留 1M 上下文长度。

更大的变化出现在发布清单里。小米同时公开了模型权重和技术报告。发布清单还包括 7000 多个强化学习任务环境和端到端训练框架。小米同时开放可组合的 mini-harness,并发布 MiMo-V2.6-Distill-Qwen-9B。后者适合作为强化学习实验的较小起点。

这让开源内容从“拿到模型以后自己部署”延伸到“研究模型如何在任务中被训练出来”。开发者可以查看环境、轨迹收集、奖励评估和策略优化环节,再决定哪些部分适合复用。

训练规模被拆成了三个工程问题。

小米把这轮强化学习训练称为 Live RL。官方披露,Pro 和 Flash 在不到 6 天内各完成 30 个训练步骤,累计约 75 万条轨迹。Flash 的训练成本约为 85 万美元,Pro 约为 262 万美元。

第一个问题是吞吐量。每次更新使用 1568 个样本,单个训练步骤处理约 35 亿到 37 亿个 token,并支持 1M 上下文。大批量和异步架构的组合,让长任务训练不必完全等待最慢的一条轨迹。

第二个问题是任务混合。训练系统把代码、通用工作、视觉和网络安全任务放在同一套流程里,再通过多个 Harness 改变系统提示、工具和上下文管理方式。模型接触到的工作环境因此更分散,训练结果也更容易被拿到不同框架中检查。

第三个问题是评分。长流程 Agent 任务通常只有完成或失败两种粗粒度结果。小米公开的方案会在同一组尝试中比较多条成功轨迹。系统进一步区分实现质量、路径长度和工具使用过程,再把优势重新分配给更高质量的解法。

公开结果里,最重要的是可复查的数字。

按小米官方披露,Flash 训练任务的平均通过率相对提升 25%,Pro 提升 12%。在 DeepSWE v1.1 长程软件工程评测中,Flash 从 48.8 提升到 65.7。Pro 从 58.4 提升到 72.6。

这些数字属于厂商公布的训练和评测结果。它们说明训练过程产生了可量化变化,也把复查工作交给了社区。技术报告、代码和环境是否足以复现这些变化,要看外部研究者能否在相同任务、模型版本和算力条件下得到相近结果。

小米还在训练系统中加入了针对 Reward Hacking 的防护,包括对抗评测、异常检测和验证器交叉检查。这个细节很关键:当模型学会利用评分规则的漏洞时,训练步数和通过率都可能变得好看,任务完成质量却没有同步提高。

从模型开源走向训练系统开源。

MiMo-V2.6 还展示了几类面向实际工作的能力。官方演示包括根据文字、图片或视频生成可运行的 3D 互动世界。模型也能在 Blender 中完成物体和场景建模,并在仿真环境中通过视觉反馈控制机械臂。

这些演示把模型能力从“生成一段代码”推向“理解环境、执行动作、根据结果继续修正”。代码只是其中一个环节,任务环境、工具接口和验证机制共同决定了最后能否完成工作。

对普通开发者来说,短期内最容易使用的入口仍是 API 和已部署服务。对模型研究者来说,真正有价值的材料则是训练环境、RL 代码和 mini-harness。它们让研究者可以替换任务、评分器或工具链,观察模型在不同工作流中的变化。

开放之后,还剩下三道现实门槛。

第一道门槛是算力。Pro 和 Flash 的公开权重并不等于普通电脑可以直接运行。模型总参数、激活参数、量化方式和推理框架都会改变部署成本。需要本地运行的团队,仍要先核对模型卡、显存需求和框架支持。

第二道门槛是评测复现。官方成绩覆盖多个 Agent Benchmark,但不同 Harness、提示词、工具权限和评分器都会影响结果。比较模型时,必须把任务版本和运行条件放在同一张表里。

第三道门槛是训练资源的使用成本。公开 7000 多个环境和完整训练框架,降低了研究入口。数据清洗、环境维护、轨迹生成、评分器设计和失败样本处理仍需团队承担。

MiMo-V2.6 留下了一个清楚的观察点。模型权重只是开源交付的一层,任务环境、训练循环和评分机制决定了社区能否继续把模型往前推。

SOURCES。

小米 MiMo 官方发布页:MiMo-V2.6。

MiMo-V2.6 官方技术与模型资料。

第三方报道:VentureBeat、RuntimeWire。

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →