2026 年 9 月 22 日——小米 MiMo 团队今日凌晨正式发布并开源 Xiaomi MiMo-V2.6 系列,包含全模态旗舰 MiMo-V2.6-Pro 与高效推理模型 MiMo-V2.6-Flash 两款原生全模态模型;据官方发布页,Pro 在 Artificial Analysis 智能指数(AA 综合智能指数 v4.3.2)中取得 46 分,超过 Kimi K3(44 分)与 GLM-5.3(45 分),成为当前该榜单排名最高的开源权重模型。系列沿用 V2.5 定价,Pro 为输入 3 元、输出 6 元/百万 tokens。

小米称,此次发布是其探索 RSI(递归自我改进)路径的关键一步:以可验证的复杂任务为基础,规模化扩展强化学习(RL)算力,让模型在持续的探索与反馈中拓展智能边界。

1. 跑分表现

据官方发布页与 IT之家报道,MiMo-V2.6-Pro 的 AA 综合智能指数较前代提升 20 分,与顶级闭源模型相比仍有差距。官方另称,Pro 在多数 Agent Benchmark 上取得比肩 Claude Opus 5 和 GPT-5.6 Sol 的效果,Flash 则全面超越上一代 MiMo-V2.5-Pro。

模型 AA 智能指数(v4.3.2) 说明
GPT-6 Astra 53 闭源
Claude Fable 5.1 53 闭源
MiMo-V2.6-Pro 46 开源权重,本次发布
GLM-5.3 45 开源权重
Kimi K3 44 开源权重
MiMo-V2.5-Pro(前代) 26 上一代

数据来源:Artificial Analysis 榜单(v4.3.2),经小米官方发布页与 IT之家报道转引。

2. RL 训练投入与效果

官方称,MiMo-V2.6 可能是目前国产开源模型中投入 RL 算力最多的模型之一。Pro 与 Flash 的 RL 训练历时不到 6 天并全程直播(Live RL),训练成本分别约 262 万与 85 万美元,各完成 30 步,累计约 75 万条轨迹。

训练指标 MiMo-V2.6-Pro MiMo-V2.6-Flash
训练成本 约 262 万美元 约 85 万美元
训练任务平均通过率相对提升 12% 25%
DeepSWE v1.1(样本外) 58.4 至 72.6(约 +14) 48.8 至 65.7(约 +17)

本次训练从三个维度扩展 RL 算力:单次更新使用 1,568 个样本、支持 100 万上下文长度训练、单步训练 Token 达 3.5 至 3.7B;构建覆盖 Code、General、Visual、Cyber 方向的多任务训练体系;通过 Group 内相对比较提供更精准的奖励信号。训练期间冻结 MoE Router 以抑制专家负载漂移,并建立覆盖奖励设计、对抗性评测与验证器交叉校验的 Reward Hacking 防线。

3. API 定价与产品

据 IT之家报道,MiMo-V2.6 系列已上线 Xiaomi MiMo 开放平台,API 价格沿用 V2.5 系列定价;官方称在同等智能水平下,价格仅为海外模型的 1/20 至 1/60。API 调用使用全小写模型名 mimo-v2.6-promimo-v2.6-flashmimo-v2.6-pro-ultraspeed

项目 MiMo-V2.6-Pro MiMo-V2.6-Flash
输入价格 3 元/百万 tokens 1 元/百万 tokens
输出价格 6 元/百万 tokens 2 元/百万 tokens
缓存折扣 99% 99%

伴随新模型发布,MiMo Desktop 桌面客户端(支持 Windows 与 Mac)及会员订阅方案同步上线,Pro 的 UltraSpeed 超高速模式提供最高 20 倍推理速度,原邀测活动将于 1 周后结束。

4. 开源内容

小米全面开源 MiMo-V2.6-Pro 与 Flash 的模型权重和技术报告(Hugging Face 地址:https://huggingface.co/collections/XiaomiMiMo/mimo-v26),并同步开放以下配套资源:

开源资源 内容
RL 任务环境 7k+ 高质量任务环境,覆盖软件工程、漏洞复现、知识型工作、网页设计开发四类
蒸馏模型 MiMo-V2.6-Distill-Qwen-9B,RL 后 SWE-bench Verified 从 61.1 提升至 66.2
RL 训练框架 基于 verl、uni-agent 和 mini-swe-agent 的端到端训练流程
Mini-Harness 极简可组合 Harness,支持 Multi-Harness Training 提升泛化能力

能力方面,官方介绍 MiMo-V2.6 融合 3D 空间推理、多模态感知与计算机操作(CUA)能力,覆盖 3D 游戏生成、Blender 建模、机械臂控制等场景;科研案例中,MiMo-V2.6-Pro 在 Lean 4 中完成了 Li–Yorke 定理《周期三蕴含混沌》的完整形式化,形成 6000 余行源码并通过 Lean 内核核验,模型未接受过针对 Lean 的专项后训练。