发生了什么
2026 年 9 月 22 日,小米发布并开源 MiMo-V2.6 系列大模型,包含全模态旗舰 MiMo-V2.6-Pro、高效推理模型 MiMo-V2.6-Flash,以及提供最高 20 倍输出速度的 UltraSpeed 模式,同步上线 MiMo Desktop 桌面客户端。小米将这一代定位为探索递归自我改进路径的关键一步:预训练架构与参数规模基本不变,能力提升主要来自强化学习后训练的算力扩展。
- MiMo-V2.6-Pro 在 Artificial Analysis 综合智能指数取得 46 分,超过 Kimi K3 与 Qwen3.8 Max,位列开源权重模型第一;
- 单位任务成本约 0.13 美元,API 定价沿用 V2.5 系列,未随能力提升上调;
- 强化学习后训练历时不到 6 天,Flash 与 Pro 训练成本分别约 85 万与 262 万美元,累计约 75 万条轨迹;
- 长程软件工程基准 DeepSWE v1.1 中,Flash 由 48.8 提升至 65.68,Pro 由 58.4 提升至 72.57;
- 单次更新使用 1568 个样本,支持 100 万 Token 上下文长度训练,单步训练 Token 达 2.7 至 3.7B。
比模型本身更值得注意的是开源范围。小米同时放出了 7000 余个覆盖软件工程、漏洞复现、知识型工作与网页设计开发的强化学习任务环境、端到端 RL 训练框架,以及一组轻量可组合的 Harness。技术报告中还给出两个应用案例:一是在小米前沿材料团队协作下筛选用于吸附全氟和多氟烷基物质的金属有机框架材料方案;二是在 Lean 4 中完成 Li–Yorke 经典论文《周期三蕴含混沌》主定理的形式化,形成 6000 余行 Lean 源码并通过内核核验。
为什么重要
这次发布把开源竞争的焦点从权重本身推到了训练方法。只放出权重,社区只能微调;连同任务环境、训练框架与 Harness 一起放出,才有机会复现强化学习扩展这条路径。
- 开源 RL 任务环境与训练框架,降低了中小团队复现规模化强化学习的门槛;
- 冻结 MoE Router、建立奖励设计与对抗性评测防线,属于 RL 训练稳定性的工程细节,这类经验此前很少完整公开;
- 单位任务成本 0.13 美元意味着前沿智能的调用门槛被压到不足一元人民币级别,对批量调用场景影响直接;
- 模型在未做专项后训练的情况下完成 Lean 形式化证明,说明通用推理能力正在向形式化验证等硬场景迁移。
不确定之处
46 分来自 Artificial Analysis 的综合指数,与其他厂商自选基准的分数不可直接比较;小米也承认与 Claude Fable 5.1、GPT-6 Astra 等最强闭源模型仍有差距。训练成本的披露口径为两个版本合计,未拆分算力类型与单卡效率,难以换算成可对标的集群规模。材料筛选与形式化证明两个案例属于厂商自述的应用展示,尚无外部独立复核;强化学习扩展路径能否在更大参数规模上继续成立,目前只有 6 天实验窗口的证据。

