小米 MiMo-V2.6-Pro:开放权重模型的新前沿
小米进入前沿模型竞争
小米发布了 MiMo-V2.6 系列模型,其中包括两个“原生全模态”模型:
- MiMo-V2.6-Pro:目前小米能力最强的模型。
- MiMo-V2.6-Flash:在智能水平、效率和成本之间取得平衡。
- MiMo-V2.6-Pro-UltraSpeed:面向极致生成速度需求,宣称在相同质量下最高可实现 20 倍输出速度提升。
这对小米而言是一个值得关注的节点。它过去更常被视为手机和硬件公司,而不是传统意义上的中国前沿 AI 实验室。但 MiMo-V2.6 的发布,尤其是开放权重版本的表现,使其进入了大模型社区的讨论中心。
第三方评测中的表现
在 Artificial Analysis 的 Intelligence Index 中,MiMo-V2.6-Pro 被列为开放权重模型中的第一名,指数得分为 46。
该模型还被标注为在“智能水平 vs. 每任务成本”的帕累托前沿上:
- 每个 Intelligence Index 任务成本约 0.13 美元;
- 模型为开放权重;
- 文章标题信息称其训练成本约为 300 万美元。
需要注意的是,这些指标来自特定评测体系,并不等同于所有场景下的通用排名。不同基准、任务类型和部署条件可能会给出不同结果。
训练透明度受到关注
MiMo-V2.6 发布前,小米团队曾公开展示最终阶段的强化学习训练过程,包括内部训练指标。这种做法在大模型训练中并不常见,因此引发了社区关注。
其中一位关键人物是罗福莉,她此前曾在 DeepSeek 工作,后来加入小米。相关训练过程展示了小米在强化学习阶段的一些方法和监控指标。
技术报告中的强化学习扩展方向
根据技术报告,MiMo-V2.6 在强化学习计算上主要沿三个方向扩展:
1. 更大的 batch 与更高吞吐
模型训练采用全异步架构,并使用较大的 batch:
- 每次更新包含 1,568 个样本;
- 训练上下文长度最高达到 100 万 token;
- 每步训练规模约为 35 亿至 37 亿 token。
这表明团队试图通过更高吞吐和更长上下文,提升长任务与复杂任务上的学习效率。
2. 更多任务与更丰富环境
训练任务覆盖多个方向,包括:
- 代码;
- 通用智能体任务;
- 视觉任务;
- 网络安全相关任务。
这些任务被混合在多个评测与训练框架中,目标是让不同能力之间形成相互强化,而不是只针对单一能力进行优化。
3. 更多评审计算
技术报告提到,训练中使用了组内相对比较,为长程强化学习任务提供更精细、更多样的奖励信号。
这种做法的目标包括:
- 改善长任务中的奖励判断;
- 形成一定程度的自我改进循环;
- 引导模型用更短路径完成任务;
- 减少每个任务消耗的 token 数。
为什么值得关注
MiMo-V2.6-Pro 的意义不只在于单个排行榜成绩,还在于它体现了几个趋势:
- 硬件公司正在进入前沿模型竞赛:小米并非传统“AI 六小虎”之一,但正在投入基础模型研发。
- 开放权重模型继续逼近闭源模型体验:开放权重生态仍在快速迭代。
- 强化学习训练规模与透明度成为竞争点:更长上下文、更大 batch、更复杂任务环境,正在成为模型后训练阶段的重要变量。
- 成本效率成为模型竞争的核心指标之一:每任务成本与能力的组合,越来越受到社区关注。
总体来看,MiMo-V2.6-Pro 是近期中国开放权重大模型中值得跟踪的一个版本。它的真实价值仍需在更多独立评测、实际部署和开发者使用中继续验证。
