小米开源MiMo-V2.6:刷新开源榜,性能逼近顶级闭源模型

小米今日发布并开源MiMo-V2.6双版本,刷新开源模型AA指数排名,性能大幅提升,API定价极具性价比。
9月22日,小米正式发布并开源了全新的 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型。作为小米探索 RSI(递归自我改进)路径的关键一步,该系列通过大规模扩展强化学习(RL)算力,旨在让模型在持续的探索与反馈中拓展智能边界。
性能突破:刷新开源榜单,逼近顶级闭源模型
得益于在 RL 算力上的激进投入,MiMo-V2.6 系列取得了显著的性能提升。在权威的 Artificial Analysis Intelligence Index(AA 综合智能指数)v4.3.2 中,MiMo-V2.6-Pro 以 46 分的成绩登顶,超过了 Kimi K3(44 分)和 GLM-5.3(45 分),成为当前排名最高的开源权重模型。与上一代相比,其分数增长了 20 分。
尽管如此,小米官方也坦诚,该模型与 Claude Fable 5.1 和 GPT-6 Astra(均为 53 分)等顶级闭源模型相比仍存在一定差距。但在长程软件工程评测基准 DeepSWE v1.1 上,MiMo-V2.6 表现优异:Pro 版本得分从 48.8 提升至 65.7,Flash 版本从 58.4 提升至 72.6,平均通过率也分别提升了 25% 和 12%。
训练策略:高吞吐与多任务探索
MiMo-V2.6 的强大能力源于其“硬核”的训练策略。据悉,这是国产开源模型中投入 RL 算力最多的模型之一。Pro 与 Flash 两个版本仅耗时不到 6 天,成本分别约为 262 万美元与 85 万美元,各完成 30 步训练,累计约 75 万条轨迹。
小米在三个维度扩展了 RL 算力:
- 更大的 Batch 与吞吐: 单次更新使用 1568 个样本,支持 100 万上下文长度训练,单步训练 Token 达 3.5 至 3.7B。
- 更多任务与环境: 构建了覆盖 Code、General、Visual、Cyber 等方向的多任务训练体系。
- 更强的 Grader 算力: 通过 Group 内相对比较为长程 RL 任务提供更精准的奖励信号。
应用场景:从 3D 建模到具身智能
MiMo-V2.6 的能力已超越单纯的文本处理,融合了 3D 空间推理、多模态感知与计算机操作能力。
- 游戏开发: 用户只需输入图片、视频或文字,模型即可将其拆解为多任务,通过多智能体协作完成 3D 场景搭建、交互逻辑编写与视觉验证。
- 具身仿真: 模型可直接以多视角相机画面为输入,通过视觉反馈闭环控制 Franka Panda 机械臂,完成物体抓取、颜色匹配与精准放置。
- 科研辅助: 在科研领域,MiMo-V2.6 协助筛选了 PFAS 吸附用金属有机框架(MOF)材料,并完成了数学经典论文的完整形式化证明(6000 余行 Lean 源码)。
开源生态与定价:极具竞争力的性价比
小米不仅开源了模型权重,还同步开放了技术报告、Distill-Qwen-9B 及配套 RL 研究资源。
- 开源资源: 社区将获得 7k+ 高质量 RL 任务环境(覆盖软件工程、漏洞复现等),以及基于 verl、uni-agent 等构建的端到端 RL 训练框架和轻量可组合的 Harness。
- API 定价: 该系列沿用 V2.5 系列的定价策略,Flash 版本输入/输出价格为 1/2 元,Pro 版本为 3/6 元,并提供 99% 缓存折扣。这意味着在同等智能水平下,其价格仅为海外模型的 1/20 至 1/60。
- 桌面端体验: 伴随新模型发布,MiMo Desktop 桌面客户端及会员订阅方案同步上线。订阅会员可使用 Pro 和 Flash 模型,并开启 UltraSpeed 超高速模式(推理速度最高 20 倍)。
对于开发者与研究人员而言,小米此次开源不仅提供了一个性能强劲的模型,更提供了一套经过验证的训练实践和工具链,极大地降低了探索前沿 AI 技术的门槛。