2026 年 9 月 22 日——小米 MiMo 团队今日凌晨正式发布并开源 Xiaomi MiMo-V2.6 系列,包含全模态旗舰 MiMo-V2.6-Pro 与高效推理模型 MiMo-V2.6-Flash 两款原生全模态模型;据官方发布页,Pro 在 Artificial Analysis 智能指数(AA 综合智能指数 v4.3.2)中取得 46 分,超过 Kimi K3(44 分)与 GLM-5.3(45 分),成为当前该榜单排名最高的开源权重模型。系列沿用 V2.5 定价,Pro 为输入 3 元、输出 6 元/百万 tokens。
小米称,此次发布是其探索 RSI(递归自我改进)路径的关键一步:以可验证的复杂任务为基础,规模化扩展强化学习(RL)算力,让模型在持续的探索与反馈中拓展智能边界。
1. 跑分表现
据官方发布页与 IT之家报道,MiMo-V2.6-Pro 的 AA 综合智能指数较前代提升 20 分,与顶级闭源模型相比仍有差距。官方另称,Pro 在多数 Agent Benchmark 上取得比肩 Claude Opus 5 和 GPT-5.6 Sol 的效果,Flash 则全面超越上一代 MiMo-V2.5-Pro。
| 模型 | AA 智能指数(v4.3.2) | 说明 |
|---|---|---|
| GPT-6 Astra | 53 | 闭源 |
| Claude Fable 5.1 | 53 | 闭源 |
| MiMo-V2.6-Pro | 46 | 开源权重,本次发布 |
| GLM-5.3 | 45 | 开源权重 |
| Kimi K3 | 44 | 开源权重 |
| MiMo-V2.5-Pro(前代) | 26 | 上一代 |
数据来源:Artificial Analysis 榜单(v4.3.2),经小米官方发布页与 IT之家报道转引。
2. RL 训练投入与效果
官方称,MiMo-V2.6 可能是目前国产开源模型中投入 RL 算力最多的模型之一。Pro 与 Flash 的 RL 训练历时不到 6 天并全程直播(Live RL),训练成本分别约 262 万与 85 万美元,各完成 30 步,累计约 75 万条轨迹。
| 训练指标 | MiMo-V2.6-Pro | MiMo-V2.6-Flash |
|---|---|---|
| 训练成本 | 约 262 万美元 | 约 85 万美元 |
| 训练任务平均通过率相对提升 | 12% | 25% |
| DeepSWE v1.1(样本外) | 58.4 至 72.6(约 +14) | 48.8 至 65.7(约 +17) |
本次训练从三个维度扩展 RL 算力:单次更新使用 1,568 个样本、支持 100 万上下文长度训练、单步训练 Token 达 3.5 至 3.7B;构建覆盖 Code、General、Visual、Cyber 方向的多任务训练体系;通过 Group 内相对比较提供更精准的奖励信号。训练期间冻结 MoE Router 以抑制专家负载漂移,并建立覆盖奖励设计、对抗性评测与验证器交叉校验的 Reward Hacking 防线。
3. API 定价与产品
据 IT之家报道,MiMo-V2.6 系列已上线 Xiaomi MiMo 开放平台,API 价格沿用 V2.5 系列定价;官方称在同等智能水平下,价格仅为海外模型的 1/20 至 1/60。API 调用使用全小写模型名 mimo-v2.6-pro、mimo-v2.6-flash、mimo-v2.6-pro-ultraspeed。
| 项目 | MiMo-V2.6-Pro | MiMo-V2.6-Flash |
|---|---|---|
| 输入价格 | 3 元/百万 tokens | 1 元/百万 tokens |
| 输出价格 | 6 元/百万 tokens | 2 元/百万 tokens |
| 缓存折扣 | 99% | 99% |
伴随新模型发布,MiMo Desktop 桌面客户端(支持 Windows 与 Mac)及会员订阅方案同步上线,Pro 的 UltraSpeed 超高速模式提供最高 20 倍推理速度,原邀测活动将于 1 周后结束。
4. 开源内容
小米全面开源 MiMo-V2.6-Pro 与 Flash 的模型权重和技术报告(Hugging Face 地址:https://huggingface.co/collections/XiaomiMiMo/mimo-v26),并同步开放以下配套资源:
| 开源资源 | 内容 |
|---|---|
| RL 任务环境 | 7k+ 高质量任务环境,覆盖软件工程、漏洞复现、知识型工作、网页设计开发四类 |
| 蒸馏模型 | MiMo-V2.6-Distill-Qwen-9B,RL 后 SWE-bench Verified 从 61.1 提升至 66.2 |
| RL 训练框架 | 基于 verl、uni-agent 和 mini-swe-agent 的端到端训练流程 |
| Mini-Harness | 极简可组合 Harness,支持 Multi-Harness Training 提升泛化能力 |
能力方面,官方介绍 MiMo-V2.6 融合 3D 空间推理、多模态感知与计算机操作(CUA)能力,覆盖 3D 游戏生成、Blender 建模、机械臂控制等场景;科研案例中,MiMo-V2.6-Pro 在 Lean 4 中完成了 Li–Yorke 定理《周期三蕴含混沌》的完整形式化,形成 6000 余行源码并通过 Lean 内核核验,模型未接受过针对 Lean 的专项后训练。
举手提问