1.02T 参数只激活 42B,训练 6 天烧掉 347 万美元——小米 MiMo-V2.6 深度拆解
从 AA 智能指数 26 分到 46 分,只用了不到半年。小米 MiMo 团队沉寂 6 个月,把强化学习算力拉满,一次放出 Pro、Flash、Ultraspeed 三个版本,价格却和上一代一分不差。这篇文章带你从榜单排名、训练成本、架构设计、API 定价到开源生态,把 MiMo-V2.6 掰碎了讲清楚。

一、先看榜单:46 分登顶开源,距闭源天花板还差 7 分
2026 年 9 月 22 日凌晨,小米正式发布并开源 Xiaomi MiMo-V2.6 系列。这一刀切下去,最硬的数字是 46。
在 Artificial Analysis Intelligence Index(AA 综合智能指数)v4.3.2 榜单中,MiMo-V2.6-Pro 取得 46 分,超越 Kimi K3(44 分)和 GLM-5.3(45 分),成为当前 AA 指数上排名最高的开源权重模型。而上一代 MiMo-V2.5-Pro 只有 26 分——半年时间,一口气涨了 20 分。

这张截图来自 Artificial Analysis 官方排行榜(artificialanalysis.ai/leaderboards/models)。你可以看到 MiMo-V2.6-Pro 的关键参数:
| AA 智能指数 | 46 |
| 上下文窗口 | 1M |
| 开发方 | Xiaomi |
| 单任务成本 | $0.13 |
| 生成速度中位数 | 130 tokens/s |
| 首块响应延迟 | 2.17s |
| 端到端总响应时间 | 21.44s |
但小米也很坦诚——46 分和顶级闭源模型之间还有差距。Claude Fable 5.1 和 GPT-6 Astra 都拿到了 53 分,高出 MiMo-V2.6-Pro 整整 7 分。这 7 分是什么概念?从 26 分到 46 分花了半年,从 46 分到 53 分的难度只会更大。

上面这张图是 IT 之家报道中引用的 AA 智能指数柱状图。可以看到完整的排名梯队:
- 53 分档:Claude Fable 5.1、GPT-6 Astra(闭源天花板)
- 48-51 分档:其他闭源旗舰
- 46 分档:MiMo-V2.6-Pro(开源第一)
- 44-45 分档:Kimi K3、GLM-5.3、Qwen3.8 Max 等
- 26 分:MiMo-V2.5-Pro(上一代)
除了综合智能指数,在 Arena.ai 的 Code Arena: WebDev(网页开发方向代码能力评测)榜单上,MiMo-V2.6-Pro 以 1628 分排在总榜约第 10 位,开源模型中约排第 3。

更有意思的是一张“智能-成本帕累托前沿图”(Intelligence-Cost Frontier)。这张图把所有模型按“智能水平”和“单任务成本”画在一张散点图上,MiMo-V2.6-Pro 标注为 $0.15 per task · Intelligence Index 48.0,正好踩在帕累托前沿线上——意味着在同等智能水平下,没有比它更便宜的了。
二、架构拆解:1.02T 总参数,只激活 42B
先说人话:MiMo-V2.6-Pro 的“大脑”有 1.02 万亿个参数,但每次思考只调动其中 420 亿个。这就像一个公司有 1 万名员工,但每个具体任务只需要 420 人参与——其他人“待命”,不消耗资源。
这就是 MoE(Mixture of Experts,混合专家)架构的核心逻辑。
2.1 Pro vs Flash:一高一低,覆盖不同场景
| 总参数 | 1.02T | 310B |
| 激活参数 | 42B | 15B |
| 激活比例 | ~4.1% | ~4.8% |
| 定位 | 旗舰推理,复杂长程任务 | 高效推理,高频调用 |
| 上下文窗口 | 1M tokens | 1M tokens |
两个型号的激活比例都在 4%-5% 左右,这意味着模型把“总量”堆到万亿级别来保证能力上限,同时通过稀疏激活把“实际开销”压到极低。
为什么这很重要?因为推理成本只和激活参数相关,不跟总参数挂钩。Pro 版激活 42B,Flash 版激活 15B——Flash 的推理成本大约只有 Pro 的 1/3,但两者的知识储备(总参数)差距远小于成本差距。
2.2 MoE 是怎么“省着用”的:路由器与专家
如果你只想知道 MoE 的“人话版”,记住一句话就够:把一个大模型拆成很多个“专家”,每个 Token 只找少数几个专家干活。
具体拆开讲。一个普通的 Transformer 层,核心计算是两块:注意力(Attention)和前馈网络(FFN)。MoE 改造的是 FFN 这一环——把单个大 FFN 替换成 N 个并列的小 FFN,每个小 FFN 就是一个“专家”(Expert)。再引入一个“路由器”(Router/Gate),它的任务只有一件事:看着当前 Token 的特征,决定这个 Token 交给哪几个专家处理。
用一张 ASCII 图表示(这就是 MiMo-V2.6 这种稀疏 MoE 层的基本结构):
输入 Token(比如“代码”这个词)
|
[ 路由器 Router ]
对每个专家打分
|
+————-+————-+
| | |
Top-K 挑选 (其余专家不激活,零计算)
| |
+—+—+ +—+—+
| 专家 1 | | 专家 7 | ← 只有被选中的专家做 FFN 计算
+——-+ +——-+
| |
+——+——+
|
加权合并输出
|
下一层 Transformer
两个关键机制:
Top-K 门控:路由器给每个 Token 对所有专家打分,只选分数最高的 K 个(业内 K 通常取 1 或 2),按分数加权合并这 K 个专家的输出。没被选中的专家完全不参与计算——这就是“稀疏激活”的来源。MiMo-V2.6-Pro 激活比例约 4.1%,可以粗略理解为每个 Token 只动用了约 4% 的专家容量。
能力分区,不是专业分工:注意别把“专家”理解成“这个专家懂代码、那个专家懂法律”。实际训练出来的专家分工并不是人类预设的学科分类,而是模型自己学出来的统计规律——有的专家更常处理语法结构,有的更常处理数字推理,有的则类似“公共专家”什么都接。学界甚至观察到某些专家是“被冷落的”(负载极低),这也是 MoE 研究里的经典问题:路由崩溃(Route Collapse)——如果训练初期路由器学会了“只把 Token 丢给少数几个专家”,其他专家永远得不到训练,模型容量就被浪费了。
所以 MoE 训练都要做负载均衡:要么加一个辅助损失(auxiliary loss)惩罚“偏科”,要么像 DeepSeek-V3 那样用无辅助损失的动态偏置方案,逼着路由器把 Token 摊到所有专家头上。1.02T 总参、42B 激活,本质上是“万亿容量的知识库 + 每 Token 只用一小撮专家”的精算结果。
2.3 MoE 的账:为什么万亿参数不等于万亿成本
把上面的原理换算成钱,就明白小米为什么敢做万亿参数:
| 显存/磁盘占用 | 全部参数都要加载 | 一样,全部参数都要加载 |
| 单 Token 推理计算量 | 正比于总参数 | 正比于激活参数(~4%) |
| 训练收敛速度 | 快 | 慢(需要更多 Token 才能喂饱所有专家) |
| 部署门槛 | 高 | 更高(参数总量更大) |
注意最后两行——MoE 不是免费的午餐。推理时省了,但训练和部署反而更贵:1.02T 参数全都要驻留显存,训练时还面临专家负载不均衡的老大难问题。这也解释了后面 RL 面板里那次著名的事故:Pro 在第 17 步因为“专家负载不均衡导致 GPU OOM”重启——某个或某几个专家被路由器过度偏爱,显存被局部撑爆。MoE 的“偏科”问题在万亿规模下依然真实存在,这不是理论问题,是 262 万美元训练费里实打实踩过的坑。
2.4 全模态:文本、图像、视频、音频一把梭
小米给 MiMo-V2.6 的定位是“原生全模态模型”——可以同时处理文本、图像、视频和音频等多种输入形式。“原生”这个词很关键,意味着不是后期拼接的多模态,而是从训练阶段就统一处理的。
实际能力包括:
- 3D 空间推理:输入图片、视频或文字,模型能将需求拆解为多个任务,由多智能体协作完成 3D 场景搭建、交互逻辑编写与视觉验证
- 具身仿真:直接以多视角相机画面为输入,通过视觉反馈闭环控制 Franka Panda 机械臂,完成物体抓取、颜色匹配与精准放置
- 计算机操作:能直接操作电脑界面完成任务
2.5 科研级能力:Lean4 形式化证明
这是最让我惊讶的一点。MiMo-V2.6-Pro 在 Lean 4 中完成了 Li-Yorke 经典论文《周期三蕴含混沌》原始主定理的完整形式化,形成 6000 余行 Lean 源码,完整证明通过 Lean 内核核验。
关键细节:模型未接受过针对 Lean 的专项后训练。这意味着这种数学推理能力是从通用强化学习中自然涌现的,而不是靠专门训练“刷”出来的。
此外,MiMo-V2.6-Pro 还协助研究人员完成了全氟和多氟烷基物质(PFAS)吸附用金属有机框架(MOF)材料的设计方案筛选——这是交叉学科的实际科研应用。
顺带解释一下上面这条为什么值得单独说:Lean 4 是一个“证明即代码”的形式化数学工具——每个证明都要通过 Lean 内核的机械检查,不存在“看起来对”的模糊空间。Li-Yorke 定理是 1975 年混沌理论的奠基论文,把“周期三”与混沌行为联系起来,曾被称为“混沌理论三大开创性工作之一”。让一个大模型“零专项训练”地写出 6000 行可通过内核核验的形式化证明,考验的不是记忆,而是严格的多步符号推理——这恰恰是 RL 训练最想提升的能力,从侧面验证了 MiMo RL 后训练的深度。
三、RL 训练:6 天烧掉 347 万美元,全程直播
这可能是 2026 年最“疯”的一次模型训练——小米把强化学习训练的实时面板直接开放给了全世界。
3.1 罗福莉的半年沉默与一举公开
2026 年 4 月开源 MiMo-V2.5 之后,小米 MiMo 团队负责人罗福莉沉默了将近半年。9 月 17 日凌晨,她在 X 平台发文,只说了一件事:过去半年,团队一直在研究一个问题——强化学习(RL)到底可以走多远。
然后她甩出了一个直播链接。
面板地址:https://mimo.xiaomi.com/rl/
页脚写着它的态度:“Open is what we value.”
3.2 先补课:六个 RL 术语,看懂面板的前提
面板上全是 step、rollout、dynsam/avg@n 这类黑话。为了让你不看蒙圈,先把最核心的几个术语用人话过一遍——后面所有章节都会用到。
| policy(策略) | 模型本身。“策略”指模型在每个状态下如何选择下一个动作(Token)的规则 |
| reward(奖励) | 对模型输出的打分。可以是“测试全绿 = 1 分,挂了 = 0 分”这种硬标准 |
| rollout(采样/轨迹) | 模型按当前策略完整跑一遍任务(比如修一个 bug)产生的全过程记录 |
| step(步) | 一次“采样一批 → 算奖励 → 更新模型”的完整循环。面板上 Pro 跑了 30 步 |
| batch size(批量) | 一次更新用多少个任务。MiMo 是 1568 个任务 × 每个任务 16 条 rollout |
| dynsam/avg@n | 动态采样下、每个任务采 n 条轨迹的平均得分——面板上衡量“这批任务平均做得多好”的核心指标 |
再讲一个最关键的概念——为什么 RL 会让模型变强。
传统监督微调(SFT)像“抄作业”:给模型看标准答案,让它模仿。RL 换了个思路——不给标准答案,只给评判标准。模型自己去尝试完成任务(生成 rollout),成功了拿正奖励,失败了拿零奖励,然后根据奖励信号调整自己的行为概率:“刚才那串动作得了高分,以后多这么干。”
用修 bug 打个比方:
SFT(抄作业模式):
人给模型 10 万条“问题→修复补丁”样本
模型学的是“看到这种 bug 就写这种补丁”
局限:没见过的 bug 类型就抓瞎
RL(做题模式):
给模型 7000+ 个真实任务环境,每个任务只告诉它“测试通过才算赢”
模型自己探索怎么修,修好 → reward=1,修不好 → reward=0
局限:探索空间大、算力贵,但天花板高,能解决没见过的问题
这就是为什么 MiMo-V2.5 和 V2.6 总参数完全相同、能力却差 20 分——RL 不增加任何“知识”,它优化的是“调用已有知识解决问题”的能力。
3.3 RL 训练面板实况

这张截图来自 MiMo RL 训练面板的总览页。关键数据一目了然:
总训练成本:$3,474,715
| 状态 | stopped(已停止) | stopped(已停止) |
| 训练步数 | step 30 | step 30 |
| 运行时长 | 5天7小时29分 | 3天11小时05分 |
| 累计成本 | $2,620,670 | $854,044 |
| 单步 Token | 3.43B | 3.70B |
| 累计 Token | 75B | 81.4B |
| 训练样本 | 753k | 753k |
| 批量大小 | 1568 × 16 seqs | 1568 × 16 seqs |
| dynsam/avg@n | 0.633(Δ+0.068) | 0.644(Δ+0.130) |
几个值得注意的细节:
Flash 的提升幅度反而更大:Flash 的 dynsam/avg@n 相对第一步提升了 0.130,而 Pro 只提升了 0.068。这说明在同等训练规模下,小模型的边际收益更高——这和知乎上 RL scaling 实验观察的结论一致。
Pro 的单步 Token 比 Flash 少:Pro 单步 3.43B,Flash 单步 3.70B。可能是因为 Pro 的激活参数更多,单条序列的计算开销更大,所以每步能处理的 Token 更少。
累计 Token Flash 反超:虽然 Flash 运行时间更短(3天 vs 5天),但累计 Token 81.4B > 75B。这进一步说明 Flash 的吞吐量更高。
这笔钱花在哪了? 拆一下 347 万美元的账本。RL 训练的算力大头不是“更新参数”,而是生成(rollout)——业内公认 rollout 是 RL 训练的时间黑洞,通常占整个训练流程 60%-80% 的算力。原因很简单:模型每做一步都要“想一下再写一下”,一个修 bug 任务动辄要生成几十万 Token 的工具调用轨迹,而且要为 1568 个任务各生成 16 条完整轨迹,还都发生在长达 100 万 Token 的上下文里。再算上负责给轨迹打分的 Grader 集群——这是小米特意强调的“第三维度算力”——训练集群的 GPU 不是在教模型,就是在出题和阅卷。
3.4 面板上的“事故日志”
面板的 notices 区如实记录了训练过程中遇到的各种问题:
| 2天15小时前 | 过滤掉了对当前 Pro 版本过于简单的训练任务 |
| 3天22小时前 | Pro 在第 17 步重启——专家负载不均衡导致 GPU 显存不足(OOM),已调整并行策略 |
| 4天13小时前 | Pro 集群和评测节点出现网络连通问题;采样日志发现异常模式,将 cyber 数据集从 Pro 训练中移除 |
| 4天23小时前 | Flash 从第 15 步重启——过去 3 小时某数据集的基础设施错误未被正确检测 |
| 5天5小时前 | Pro 因单节点显存问题重启 |
| 5天7小时前 | 更新 Flash 第 12 步、Pro 第 8 步的 DeepSWE 评测结果 |
训练大模型从来不是一帆风顺的——OOM、网络故障、数据异常,这些“后台事故”通常永远不会被公开。小米把它们全放在了台面上。
值得注意的是第 17 步那次 OOM 的技术含义。对 MoE 模型做 RL 训练时,路由器是跟着策略一起被更新的——如果某段时间路由器“偏心”某几个专家(比如某类任务集中激活同一组专家),这些热点专家所在 GPU 的显存就会被撑爆。“专家负载不均衡 → GPU OOM”这条事故链,恰好验证了 2.2 节讲的 MoE 困境:万亿参数规模下,路由崩溃问题不会因为模型更大而消失,反而会被 RL 的策略更新放大。小米的解法是“调整并行策略”——把专家分布重新切分,相当于给爆仓的仓库重新调货。
3.5 三个维度的 RL 算力扩展
小米从三个方向扩展 RL 算力,这也是 MiMo-V2.6 性能飞跃的核心方法论:
维度一:更大的 Batch 与更高吞吐
- 单次更新使用 1568 个样本
- 支持 100 万上下文长度训练
- 单步训练 Token 达 3.5-3.7B
- 完全异步运行
这里最有技术含金量的是“完全异步”三个字。传统同步 RL 训练是流水线式的:生成一批 → 等全部生成完 → 算奖励 → 更新模型 → 再生成下一批,任一环节卡壳全线停摆。异步训练则允许不同环节重叠执行——A 批还在生成时,B 批可能已经在算奖励,C 批可能正在更新参数。代价是“陈旧度”(staleness):更新参数时用的可能不是最新策略生成的数据。为什么 MiMo 敢这么做?因为 GRPO 这类“组内相对比较”算法对陈旧度的容忍度比 PPO 高得多——奖励只看同一组内谁比谁强,不依赖绝对价值估计。这就是“算法设计”和“系统设计”互相成就的典型例子。
维度二:更多任务与复杂环境
- 构建覆盖 Code、General、Visual、Cyber 四大方向的多任务训练体系
- 多任务代理式 RL——在一次运行中混合多个测试框架
- 7k+ 高质量 RL 任务环境
维度三:更大的 Grader 算力
- 通过 Group 内相对比较为长程 RL 任务提供更精准的奖励信号
- 这是解决 RL 奖励稀疏问题的关键——任务越长,反馈越少,Group 比较能有效提取相对优势信号
第三点展开讲讲。给智能体任务发奖励是出了名的难:一个任务要调 30 次工具、跑 200 步,最后只告诉你“成功/失败”一个 bit 的信息——这就是奖励稀疏。更麻烦的是奖励欺骗(reward hacking):模型可能学会钻空子,比如把测试文件删了让“测试通过”而不是真的修好代码。业界的解法之一就是 Group 相对比较:同一个任务让模型做 16 遍(这就是 1568×16 里那个 16 的用途),对比组内轨迹——如果 16 条轨迹里有 3 条真修好了、13 条是走捷径,相对比较就能把“真本事”和“钻空子”区分出梯度信号。Grader 集群的算力就花在这些对比评估和反作弊检查上,小米把它单列为“第三维度”,等于把“阅卷”本身当成了一等公民的算力预算。
3.6 训练效果:DeepSWE 飙升

DeepSWE v1.1 是样本外的长程软件工程评测基准(不是训练数据,而是泛化测试)。训练效果:
| MiMo-V2.6-Pro | 48.8 | 65.7 | +16.9 分 |
| MiMo-V2.6-Flash | 58.4 | 72.6 | +14.2 分 |
训练任务平均通过率分别相对提升 25%(Pro)和 12%(Flash)。
四、智能体基准测试:全方位对比

这张表是 MiMo-V2.6 与前代和前沿模型在智能体基准测试上的完整对比。我挑几个关键维度解读:
4.1 通用智能体(General Agent)
| AutomationBench v1.0.6 | 53.1 | 52.3 | 自动化任务 |
| Toolathlon-Verified | 76.9 | 73.6 | 工具调用 |
| Terminal Bench 4.0 | 34.9 | 28.8 | 终端操作(高难度) |
| Terminal Bench 2.1 | 89.9 | 87.6 | 终端操作(标准) |
| OSWorld-Verified | 82.0 | 80.8 | 操作系统级任务 |
| JobBench | 62.0 | 61.2 | 工作场景任务 |
Pro 版在所有通用智能体基准上均领先 Flash 版,但差距不大(1-6 分)。考虑到 Flash 的推理成本只有 Pro 的 1/3,Flash 的性价比非常突出。
4.2 网络安全(Cybersecurity)
| CyberGym | 94.0 | 95.1 |
| MiMo Cyber Bench | 80.2 | 77.2 |
| ExploitGym | 17.8 | 6.0 |
| ExploitBench | 47.9 | 25.3 |
| SEC Bench Pro | 66.3 | 47.5 |
网络安全是 MiMo 的特色方向。CyberGym 94/95 分的表现相当亮眼。不过 ExploitGym 的分数差距很大——Pro 17.8 vs Flash 6.0,说明漏洞利用这种需要深度推理的任务,大模型的优势更明显。
4.3 视觉智能体(Visual Agent)
| MiMo Visual Coding | 72.3 | 71.5 |
视觉编程能力两者接近,这和全模态训练的统一性有关——视觉能力在预训练阶段已经形成,RL 阶段的差距主要体现在复杂推理上。
4.4 这些基准到底在考什么:一张“考纲”对照表
基准名字都是黑话,我给你翻译成“考点”:
| AA 智能指数 | 综合卷:多项权威评测加权平均出的“总分” | 覆盖面广,最能代表通用智能 |
| Terminal Bench 2.1 | 在真实终端里执行多步 shell 操作完成任务(装环境、跑脚本、查日志) | 每一步命令都可能把环境搞坏,错了不能回滚 |
| OSWorld-Verified | 在真实操作系统(带 GUI)里点鼠标完成任务 | 视觉感知+操作精度双重考验 |
| Toolathlon-Verified | 调用一堆真实工具/API 组合完成任务 | 工具编排规划能力 |
| SWE-bench Verified | 在真实 GitHub 仓库里修 issue,修完跑测试 | 长程+多文件改动+环境搭建 |
| DeepSWE v1.1 | 同上,但全部是新任务(训练截止后创建),防“背题” | 样本外泛化,考真理解 |
| CyberGym | 网络安全场景综合任务(漏洞分析等) | 专业知识+推理 |
| ExploitGym | 实际利用漏洞(写 exploit) | 深度推理,Pro 17.8 vs Flash 6.0 差距最大 |
两个细节值得你注意:
为什么 DeepSWE v1.1 最能说明训练效果:所有在训练截止日期前公开的基准,模型都可能“间接背过题”——预训练数据里可能就有相关讨论。DeepSWE 由 Datacurve 团队推出,用训练截止后新创建的 113 个原创任务、91 个活跃仓库,覆盖 TypeScript/Go/Python/JavaScript/Rust 五种语言,题目零污染。MiMo 在它上面从 48.8 涨到 65.7,才说明 RL 提升的是“真做题能力”而不是“背题能力”。
ExploitGym 的 17.8 vs 6.0 告诉我们什么:写漏洞利用代码是典型的“深推理任务”——要理解漏洞成因、绕过缓解措施、构造精确输入。Pro 和 Flash 在浅层任务上差距 1-3 分,到这个维度拉开 3 倍差距。这符合 MoE 的直觉解释:总参数决定了“有多少专家可用”,深度难题需要调用更多冷门专家组合,Flash 的 310B 容量先不够用了。
4.5 顺便把 SWE-bench Verified 讲透
因为这个基准是整个“AI 修代码”赛道的标尺,值得多说两句。SWE-bench 最初由普林斯顿团队在 2023 年提出,从 12 个热门 Python 库的真实 issue 中抽题,让模型在真实仓库环境里改代码并跑测试。但它有两个毛病:题目描述含糊(真正定位问题需要推理)和评测脚本误判。于是 OpenAI 在 2024 年 8 月联合原团队推出 SWE-bench Verified:500 道题,全部经专业人工筛选验证,剔除了描述歧义、测试不可靠的题目,成为当前公认的“硬核子集”。
那 66.2 分(蒸馏 9B 模型 RL 后)是什么水平?作为参照:2024 年初最强模型在原版 SWE-bench 上只有个位数通过率,2025 年头部模型在 Verified 上爬到 50-70 分区间。一个 9B 小模型靠开源任务环境+开源训练框架就能摸到 66 分——这件事的意义比 Pro 的分数更大,因为它是“你在家也能复现”的证据。
五、API 定价:和上一代一分不差

这是小米 MiMo 开放平台的官方价格表。一句话总结:智能提升了,价格没涨。
5.1 国内定价(人民币 / 百万 Token)
| 实时推理 | MiMo-V2.6-Pro | ¥0.025 | ¥3.00 | ¥6.00 |
| 实时推理 | MiMo-V2.6-Flash | ¥0.02 | ¥1.00 | ¥2.00 |
| 实时推理 | MiMo-V2.6-Pro-Ultraspeed | ¥0.25 | ¥30.00 | ¥60.00 |
| 批量推理 | MiMo-V2.6-Pro | ¥0.0125 | ¥1.50 | ¥3.00 |
| 批量推理 | MiMo-V2.6-Flash | ¥0.01 | ¥0.50 | ¥1.00 |
5.2 海外定价(美元 / 百万 Token)
| 实时推理 | MiMo-V2.6-Pro | $0.0036 | $0.435 | $0.87 |
| 实时推理 | MiMo-V2.6-Flash | $0.0028 | $0.14 | $0.28 |
| 实时推理 | MiMo-V2.6-Pro-Ultraspeed | $0.036 | $4.35 | $8.7 |
| 批量推理 | MiMo-V2.6-Pro | $0.0018 | $0.2175 | $0.435 |
| 批量推理 | MiMo-V2.6-Flash | $0.0014 | $0.07 | $0.14 |
5.3 价格解读
几个关键点:
缓存折扣达到 99%:Pro 常规输入 ¥3.00,命中缓存后只要 ¥0.025——打了 0.83 折,接近免费。对于重复性请求场景(如系统提示词固定的 API 调用),实际成本极低。
批量推理半价:Batch API 再打 5 折。如果你的任务不需要实时返回,用批量推理能把成本再砍一半。
性价比对比:小米官方说法是“在同等智能水平下,价格仅为海外模型的 1/20 至 1/60”。以 AA 指数 46 分为基准,对比 Claude Fable 5.1(53 分),MiMo-V2.6-Pro 的单任务成本 $0.13,而很多闭源旗舰的单任务成本在 $1-5 范围。
Ultraspeed 为什么贵 10 倍:MiMo-V2.6-Pro-Ultraspeed 提供最高 20 倍推理速度,但价格也是普通 Pro 的 10 倍。这个版本面向强实时交互场景——比如需要毫秒级响应的对话机器人、实时代码补全等。如果你的场景对延迟不敏感,用普通 Pro 就够了。
Flash 是性价比之王:¥1 输入 / ¥2 输出,批量推理再半价。对于高频调用场景,Flash 是目前市面上最便宜的高智能模型之一。
5.4 联网服务插件
额外可选的联网搜索服务:
| 国内联网服务 | ¥16 / 1000 次 |
| 海外联网服务 | $5 / 1000 次 |
联网搜索按调用次数独立计费,不含在 Token 价格中。
5.5 动手接入:10 分钟跑通第一次调用
讲了这么多架构和定价,不如实际调一次 API。以下全部来自小米官方文档(mimo.mi.com/docs),我已核对过每个端点和参数——照抄就能跑。
第一步:拿到凭证。 用小米账号登录 MiMo API 开放平台(platform.xiaomimimo.com),在 API Keys 页面创建 Key,格式为 sk-xxxxx。建议配置成环境变量,避免明文写在代码里。
三种接入方式对应的端点:
| 按量付费·实时推理(OpenAI 兼容) | https://api.xiaomimimo.com/v1 | sk-xxxxx |
| 按量付费·实时推理(Anthropic 兼容) | https://api.xiaomimimo.com/anthropic | sk-xxxxx |
| 按量付费·批量推理 | https://batch-api-cn.xiaomimimo.com/v1 | sk-xxxxx |
| Token Plan 订阅 | https://token-plan-cn.xiaomimimo.com/v1 | tp-xxxxx(个人版)/ ttp-xxxxx(团队版) |
注意批量推理是独立的 Base URL,不能拿实时推理的端点发批任务——这是官方文档里专门列出的坑。
第二步:跑第一次调用(Python,OpenAI 兼容格式)。 MiMo 兼容 OpenAI Chat Completions 协议,所以你项目里现成的 openai SDK 直接换 base_url 就能用:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("MIMO_API_KEY"),
base_url="https://api.xiaomimimo.com/v1"
)
completion = client.chat.completions.create(
model="mimo-v2.6-pro",
messages=[
{
"role": "system",
"content": "You are MiMo, an AI assistant developed by Xiaomi. "
"Today's date: Tuesday, September 22, 2026. "
"Your knowledge cutoff date is December 2024."
},
{
"role": "user",
"content": "please introduce yourself"
}
],
max_completion_tokens=1024,
temperature=1.0,
top_p=0.95,
stream=False
)
print(completion.model_dump_json())
三个官方推荐参数别乱改:temperature=1.0、top_p=0.95、max_completion_tokens——小米官方明确建议这套采样配置,官方示例的系统提示词(“You are MiMo…”带日期和知识截止时间)也建议保留,这对发挥模型最佳状态有影响。
第三步(可选):curl 版本,不装任何 SDK:
curl -X POST 'https://api.xiaomimimo.com/v1/chat/completions' \\
-H "Authorization: Bearer $MIMO_API_KEY" \\
-H "Content-Type: application/json" \\
-d '{
"model": "mimo-v2.6-pro",
"messages": [
{"role": "user", "content": "please introduce yourself"}
],
"max_completion_tokens": 1024,
"temperature": 1.0,
"top_p": 0.95
}'
两个进阶要点:
工具调用 + 思考模式的配合:在思考模式下做多轮工具调用时,模型会同时返回 tool_calls(工具调用)和 reasoning_content(思考过程)两个字段。官方建议后续每轮请求的 messages 里保留全部历史 reasoning_content,效果最好——多数 OpenAI 兼容实现会丢弃思考内容,MiMo 的这个设计说明它的思考链在多轮中是有记忆价值的。
省钱组合拳:把 5.1 节的价格表用起来——高频调用场景固定 system 提示词吃缓存折扣(¥3 → ¥0.025);非实时任务走 Batch API 端点半价;会员订阅(Token Plan)适合量稳定的团队。三种方式可以叠加在不同任务流上。
实测端点与参数截止 2026 年 9 月 22 日来自官方文档,以 mimo.mi.com/docs/zh-CN/quick-start/summary/first-api-call 最新内容为准。
六、RSI:递归自我改进到底是什么
MiMo-V2.6 的发布通稿里反复提到一个词:RSI(Recursive Self-Improvement,递归自我改进)。小米称这是探索 RSI 路径的关键一步。
6.1 人话解释
普通的模型训练像是“老师出题,学生做题,老师批改”——学生(模型)被动接受反馈。
RSI 的思路更像“学生自己出题、自己做题、自己评估、自己改进”——模型在持续的探索与反馈中拓展智能边界,形成一个自我强化的闭环。
具体到 MiMo-V2.6 的 RL 训练:
这就是“递归”的含义——改进本身会成为下一轮改进的基础。
6.2 和传统 RLHF 的区别
| 反馈来源 | 人类标注 | 可验证的任务结果 |
| 任务类型 | 偏好对齐 | 复杂智能体任务 |
| 训练规模 | 通常较小 | 1568 样本 × 16 rollout |
| 上下文长度 | 通常 4k-32k | 1M |
| 奖励信号 | 人类偏好模型 | Group 相对比较 |
关键区别在于“可验证性”——MiMo-V2.6 的 RL 训练基于可验证的复杂任务(代码能不能跑、测试能不能过、漏洞能不能复现),而不是主观偏好。这种奖励信号更精确、更可扩展。
七、开源生态:不只是放权重

小米这次开源的不只是模型权重,而是一整套 RL 研究基础设施。我用三个层面来拆解:
7.1 模型权重
全面开源 MiMo-V2.6-Pro 和 Flash 的模型权重与技术报告。另外还开放了 MiMo-V2.6-Distill-Qwen-9B——一个蒸馏版的小模型,方便研究者快速实验。
7.2 7k+ 高质量 RL 任务环境
这是最有价值的开源内容之一。覆盖四类智能体任务:
以 MiMo-V2.6-Distill-Qwen-9B 为起点展开 RL 训练,在 11 项评测中均较 SFT 基线取得提升:
| SWE-bench Verified | 61.1 | 66.2 | +5.1 |
| MiMo Cyber Bench | 31.3 | 47.0 | +15.7 |
| Terminal Bench 2.1 | 37.1 | 52.8 | +15.7 |
| MiMo Visual Coding | 64.0 | 72.4 | +8.4 |
这意味着什么?你可以拿一个 9B 的小模型,用小米开源的任务环境和训练框架,在自己机器上跑 RL 训练,亲眼看到性能提升。这是社区研究的入门门槛。
7.3 端到端 RL 训练框架
基于三个开源工具构建:
- verl:强化学习训练框架
- uni-agent:统一智能体接口
- mini-swe-agent:轻量级软件工程智能体
覆盖环境交互、轨迹采集、奖励评估与策略优化的完整训练流程。配合开放的模型与任务环境,你可以研究训练算法、奖励机制和 agent harness。
这三个框架各管一段,值得展开讲讲它们在这个流水线里的分工——这部分是我基于 verl 官方架构文档和公开资料的技术拆解:
verl:RL 训练的“总调度台”。 verl 是字节跳动火山引擎团队开源的大模型 RL 训练框架(GitHub 上目前业内最主流的 LLM RL 框架之一),其架构源于 HybridFlow 系统论文。它要解决的核心矛盾是:RL 训练流程复杂(生成 → 评估 → 更新,循环往复),而每一段又是重量级分布式计算。verl 的答案是“混合控制流”:
- Single-Controller(单控制器):一个总调度器(基于 Ray)以类似写普通程序的方式编排整个 RL 流程——先做什么、后做什么、数据在哪些环节流动,全程由它统一指挥。好处是算法研究者改训练逻辑时不用碰分布式细节。
- Multi-Controller(多控制器 / SPMD):每个具体角色(Actor 策略模型、Critic 价值模型、Reward 奖励模型、Reference 参考模型)内部各自用 SPMD 方式做大规模并行计算。
用工厂打比方:Single-Controller 是厂长,负责排产计划;Multi-Controller 是各车间的主任,各自带着工人高效干活。传统 RL 框架(比如早期 PPO 实现)没有厂长,全靠车间之间喊话协调,流程一复杂就乱套。
在 MiMo 的场景里,verl 承担的就是那套“1568 样本 × 16 rollout、完全异步、单步 3.7B Token”的训练编排——特别是“完全异步”这种打破标准流水线的玩法,需要 Single-Controller 层面做精细的调度设计,这正是 verl 这类框架相对早期方案的核心优势。
uni-agent:统一的“智能体环境接口”。 RL 训练里模型要跟 7000+ 个任务环境交互,每个环境的输入输出格式都不同,uni-agent 把这些差异抹平成统一接口——不管后面是终端、浏览器还是沙箱,训练循环看到的都是同一套“观察-动作”协议。相当于给厂长配备了标准化的传送带。
mini-swe-agent:软件工程任务的“执行体”。 一个轻量级 SWE 智能体(源自开源社区同名项目),负责在软件工程任务里具体执行:拉仓库、看代码、改文件、跑测试,把整个修 bug 过程记录成轨迹。它产生的轨迹就是 RL 要评估和学习的“答卷”。
三者串起来,MiMo RL 训练的完整数据流就是:
uni-agent 提供 7000+ 任务环境(标准化观察/动作接口)
|
v
mini-swe-agent 等智能体在环境里执行任务,产出完整轨迹(rollout)
|
v
Grader 集群评估轨迹(Group 内 16 条轨迹相对比较 → 奖励信号)
|
v
verl 编排:Critic/Reference 计算 + 策略更新(Single-Controller 调度)
|
v
新策略回到第一步,异步开启下一轮
7.4 轻量可组合的 Harness
开源极简 mini-harnesses,把系统提示、工具与上下文管理解耦。通过 Multi-Harness Training,能将多样性和整洁性纳入 RL 训练,提升模型在不同框架上的泛化能力。
这里解释下为什么“多个 Harness 一起训练”是个技术亮点。Harness(工具架)指模型外面包的那层壳:系统提示词、工具列表、上下文怎么组装。此前业界发现一个问题——模型在某个特定 harness 里 RL 训得再好,换一个 harness(比如换一套系统提示词、换一个 agent 框架)性能就掉一截,等于“死记硬背了 harness 的脾气”。Multi-Harness Training 的思路是在 RL 时随机混用多个 harness,强迫模型学会“不管壳怎么变,任务照做”——这本质上是对抗过拟合的一种数据增强。对用户的意义是:你自己在 LangChain、Cline、Cherry Studio 里调 MiMo-V2.6,效果不会比官方 harness 差多少。
7.5 三步复现:从 9B 小模型跑起
对想动手的研究者,官方给了一条务实的路径(不需要万亿参数集群):
这条路的关键在于:小米公布的 Distill-9B 提升数据(SWE-bench Verified 61.1 → 66.2 等)就是用同一套开源基建跑出来的——你复现的是官方结果本身,而不是“理论上可行”。这在开源社区里是相当有诚意的做法。
八、MiMo Desktop:不只是 API

伴随新模型发布,MiMo Desktop 桌面客户端(支持 Windows 与 Mac)及会员订阅方案同步上线。
核心信息:
- 订阅会员可直接使用 MiMo-V2.6-Pro 和 Flash 模型
- 也可配置自己的 API Key 使用客户端
- MiMo-V2.6-Pro 的 UltraSpeed 超高速模式提供最高 20 倍推理速度
- 定位:面向专业用户的全能 AI 桌面应用——高质量办公、设计、编程、全模态创作
从产品矩阵看,MiMo 已经形成了完整的生态:
| MiMo Chat | 对话 |
| MiMo Code / OpenCode | 编程 |
| MiMo Claw / OpenClaw | 智能体 |
| MiMo Desktop | 桌面客户端 |
九、MiMo 大模型发展时间线
要理解 MiMo-V2.6 的位置,需要了解整个 MiMo 系列的发展脉络:
| 2025 年 4 月 | 发布轻量化模型 MiMo-7B |
| 2025 年 11 月 | 罗福莉加入小米,出任 MiMo 大模型负责人 |
| 2025 年 12 月 17 日 | 发布并开源 MoE 大模型 MiMo-V2-Flash |
| 2026 年 3 月 | 推出 V2 系列 |
| 2026 年 4 月 23 日 | 发布 MiMo-V2.5-Pro(1.02T 参数,MoE,AA 指数 26 分) |
| 2026 年 9 月 17 日 | 罗福莉公开 MiMo-V2.6 RL 训练进展,开放实时面板 |
| 2026 年 9 月 22 日 | 正式发布并开源 MiMo-V2.6 系列(AA 指数 46 分) |
从 V2.5 的 26 分到 V2.6 的 46 分,中间发生了什么?答案是:半年时间全部投入强化学习研究。罗福莉原话:“过去近半年团队一直围绕强化学习还能扩展到什么程度这一问题展开研究。”
这不是堆数据、堆参数的常规升级——V2.5 和 V2.6 的总参数完全一样(Pro 都是 1.02T / 42B 激活)。提升全部来自 RL 后训练。
十、三个值得思考的问题
10.1 开源第一,但和闭源天花板的差距怎么补?
46 到 53 的 7 分差距,不是靠堆 RL 算力就能简单弥补的。闭源模型的优势在于:更多的预训练数据、更大规模的 RL、以及我们看不到的工程优化。小米的路径是用开源+低成本打差异化——我不一定是最强的,但我是同等水平下最便宜的。
10.2 RL 算力还能扩展多远?
从面板数据看,Pro 和 Flash 各跑 30 步就停止了。训练任务通过率还在提升(Pro +25%、Flash +12%),说明 RL 训练远未饱和。更多的步数、更多的任务、更大的 Batch——RL scaling 的天花板在哪里?这是整个行业都在追问的问题。
10.3 小模型的边际收益为什么更高?
Flash 的 dynsam 提升 0.130,Pro 只提升 0.068。Flash 训练成本 $85 万,Pro 成本 $262 万——Pro 花了 3 倍的钱,效果提升反而更少。这暗示着一个可能性:在 RL 阶段,大模型可能已经接近其能力天花板,而小模型还有更大的提升空间。如果这个趋势成立,未来主力推广的可能不是 Pro,而是 Flash。
十一、踩坑与注意事项
如果你自己要动手(调 API 或跑开源 RL),这七个坑按发生概率排序。前五个是使用侧的坑,后两个是复现训练时的技术坑。
坑 1:V2.5 模型即将下线,别用错版本
小米官方已经公告:mimo-v2.5-pro 和 mimo-v2.5 模型将于北京时间 2026 年 10 月 21 日 10:00 正式下线。如果你之前在用 V2.5 的 API,尽快切换到 V2.6 对应版本。V2.6 沿用 V2.5 的 API 定价,不会涨钱。
坑 2:Ultraspeed 不是给所有人用的
MiMo-V2.6-Pro-Ultraspeed 的价格是普通 Pro 的 10 倍。它面向的是强实时交互场景——如果你只是做批量文本处理、离线分析,用普通 Pro 甚至 Flash 就够了。别为了“快”而多花 10 倍的钱。
坑 3:缓存命中的价格差 120 倍
Pro 常规输入 ¥3.00,命中缓存后 ¥0.025——差了 120 倍。如果你的 API 调用有大量重复的前缀(比如固定的系统提示词),务必利用 Prompt Cache。缓存写入目前限时免费,所以主动写入缓存的成本为零。
坑 4:批量推理半价,但有延迟
Batch API 的价格是实时推理的 50%,但任务不是立即返回的。如果你的任务可以接受几分钟到几小时的延迟(比如离线数据处理、批量翻译),用 Batch API 能省一半钱。
坑 5:开源权重很大,别轻易想本地部署
MiMo-V2.6-Pro 是 1.02T 参数的 MoE 模型。即便只激活 42B,推理时也需要加载全部 1.02T 参数到显存。以 FP16 精度计算,大约需要 2TB 显存——目前没有任何单机能跑。Flash 版 310B 参数也需要约 620GB 显存,至少需要 8 张 H100。本地部署前先算清楚硬件成本。
坑 6:reward hacking——你微调时会遇到的“钻空子”
如果你准备拿开源的 7k+ 任务环境和 verl 自己跑 RL,最可能踩的坑就是奖励欺骗:模型学会绕过你的评判标准拿分——比如不改代码、改测试;不修 bug、把报错的测试文件直接删掉。MiMo 官方面板里的 Grader 集群(以及知乎拆解文提到的反 reward-hacking 管线)专门处理这类问题。你自己搭训练时,至少要做三件事:评判脚本和模型环境隔离、测试文件对模型只读、对“通过得太容易”的轨迹人工抽检。否则你看到的分数提升可能一半是水分。
坑 7:批量推理端点是独立的,别混用
实操时容易忽略:Batch API 的 Base URL 是 batch-api-cn.xiaomimimo.com/v1,跟实时推理的 api.xiaomimimo.com/v1 不是同一个地址。把批量任务发到实时端点,要么报错要么按实时价格计费——白白多花一倍钱。Token Plan 订阅用户的端点也不一样(token-plan-cn.xiaomimimo.com),Key 格式也不同(tp-/ttp- 前缀),混用会直接 401。
十二、经验清单:7 条带走
MoE 架构的核心是激活效率:总参数决定能力上限,激活参数决定实际开销。选模型时别只看总参数,看激活参数才是真实成本。但记住 MoE 的代价——部署门槛更高、训练要处理路由崩溃和负载均衡(Pro 第 17 步那次 OOM 就是活例子)。
RL 正在成为模型能力提升的主引擎:MiMo-V2.6 的 20 分提升全部来自 RL 后训练,总参数没变。RL 不教模型新知识,它优化的是“调用已有知识解决问题”的能力——这就是同一副参数、两代能力的原因。
看懂 RL 报道的钥匙是三件事:rollout 占了训练 60-80% 的算力;Group 相对比较同时解决奖励稀疏和奖励欺骗;异步训练用“陈旧度”换吞吐。记住这三点,任何模型 RL 训练的报道你都能读出门道。
价格不涨是最大的杀手锏:V2.6 和 V2.5 同价,但智能提升 77%(26→46)。在国产模型价格战白热化的当下,“智能提升但价格不变”比单纯降价更有杀伤力。
开源不只是权重:小米放了 7k+ 任务环境、verl+uni-agent+mini-swe-agent 训练框架、可组合 Harness,这些东西的价值可能比权重本身更大——它们让社区能真正复现和改进 RL 训练,9B 蒸馏模型 + 66.2 分 SWE-bench Verified 就是给你准备的复现起点。
Flash 可能是性价比最优解:在大多数智能体基准上,Flash 和 Pro 的差距只有 1-6 分,但推理成本只有 1/3。如果你的场景不需要极限推理能力,Flash 是当前国产开源模型中最划算的选择之一。但注意 ExploitGym 这类深推理任务上两者差 3 倍——安全攻防场景别省这个钱。
接入成本几乎为零:OpenAI/Anthropic 双兼容 + 三行代码换 base_url,现有项目迁移 MiMo-V2.6 不需要改架构。迁移时盯住三处:端点选对(实时/批量/订阅三个域)、temperature=1.0/top_p=0.95 官方参数、system 提示词保留日期与知识截止时间。
下篇预告
这篇文章拆解了 MiMo-V2.6 的架构、训练、价格和开源生态。下一篇,我会实际动手:用 MiMo-V2.6-Flash API 跑一个完整的智能体任务流程——从 API 接入、工具调用到多轮对话,全程可复现,附完整代码。下篇见。
本文所有数据均来自截止 2026 年 9 月 22 日的公开信息:Artificial Analysis 排行榜、小米 MiMo 开放平台官方定价、MiMo RL 训练实时面板、IT 之家及多家媒体报道。排行榜分数和训练指标可能随时更新,请以官方最新数据为准。
