← 文章 / AI技术
mi 6小时前 · 2026-09-22 22:19:30 · 3 阅读

小米 MiMo-V2.6 系列三款模型正式发布

今天,我们正式发布并开源 Xiaomi MiMo-V2.6 系列模型。这是我们在 RSI(递归自我提升)道路探索上的关键一步:在可验证的复杂任务基础上,扩大强化学习(RL)的算力规模,让模型通过持续的探索与反馈不断突破智能边界。

平坦近路走的人多,崎岖远路却鲜有人抵达终点。在智能可以被轻易复制的时代,我们选择把算力投入到真实环境中,让模型在迭代的反馈循环中试错学习。这条路更慢,也更少被看见。MiMo-V2.6 的 6 天 Live RL 训练,是我们沿这条路留下的一段公开跋涉;这 6 天背后,是长达半年的基础研究积累和工程试错。

MiMo-V2.6 系列包含两款原生全模态模型:Pro 和 Flash。得益于扩大后的 RL 算力,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index(AA 综合智能指数)中获得 46 分,超越 Kimi K3 和 Qwen3.8 Max,成为当前最强的开源模型;不过与最强的闭源模型 Claude Fable 5.1 和 GPT-6 Astra 相比仍有一定差距。

图片

MiMo-V2.6 系列沿用 V2.5 系列的 API 定价。智能性能升级,价格保持不变,“智能与成本”的 Pareto 前沿再次向外推进。MiMo-V2.6-Pro 刷新了国产大模型的性价比纪录:在相同智能水平下,价格仅为海外模型的 1/20 到 1/60

图片

大规模扩展 RL,并全面开源

在强化学习(RL)训练阶段,MiMo-V2.6 很可能是迄今算力投入最大的国产开源模型之一。经过大规模、多任务强化学习训练后,MiMo-V2.6-Pro 在大多数 Agent 基准测试上的表现已与 Claude Opus5 和 GPT-5.6 Sol 相当;而 MiMo-V2.6-Flash 则全面超越了 MiMo-V2.5-Pro。

图片

在整个过程中,我们克服了强化学习训练中的基础研究和工程挑战,并通过直播方式记录了官方的实验历程。不到 6 天内,MiMo-V2.6-Flash 和 MiMo-V2.6-Pro 各完成了 30 步训练,累计轨迹数约 75 万条,训练成本分别约为 85 万美元和 262 万美元;训练任务的平均通过率分别相对提升了 25% 和 12%,而在样本外的长程软件工程评估基准 DeepSWE v1.1 上,分别提升了约 17 分(从 48.8 到 65.7)和约 14 分(从 58.4 到 72.6),这体现了强化学习的高样本效率、持续改进能力及样本外泛化能力。

图片

本次训练主要从以下三个维度扩展了强化学习的算力:

  1. 更大的批次规模与更高的吞吐量:结合大批次规模与全异步架构,每次更新使用 1,568 个样本,支持 1M 上下文长度 训练,每个训练步骤处理的 token 数量达到 3.5B~3.7B

  2. 更多任务与更复杂的环境:构建覆盖代码、通用、视觉和网络等多领域的多任务训练系统,并集成多种 Harness,以 促进不同能力维度的协同提升

  3. 更强的 Grader 算力:通过组内相对对比,为 Long-Horizon RL 任务提供更精准、更多样的奖励信号,构建模型自我改进的闭环,引导模型以更短的路径和更少的 Token 完成任务

随着训练规模扩大,我们冻结 MoE Router 以抑制专家负载漂移,并建立覆盖奖励设计、对抗评估、异常检测及验证器交叉验证的 Reward Hacking 防御体系,从而提升训练稳定性和奖励可靠性。

为支持大规模混合任务的多智能体强化学习,我们设计了统一的轨迹表示与惩罚机制以细化学习信号,支持各类多智能体框架的高并发交互,解耦控制面与数据面以迁移海量轨迹,稳定混合批次中各任务的采样比例,并优化训练与推理引擎的效率及一致性。

我们已开源上述技术成果及配套资源,包括完整技术报告、训练环境和 RL 代码,旨在帮助更多研究者复现和验证相关结果,共同探索大规模 RL 和模型自我改进的更多可能性。

从 Vibe Coding 到 Vibe World

MiMo-V2.6 整合了3D 空间推理、多模态感知和计算机用户操作(CUA)能力,进一步拓展了编程能力的边界,将自然语言驱动的编程任务延伸至面向交互式世界构建的"Vibe World"。

3D 开放世界游戏

在游戏开发中,用户输入图片、视频或文本后,MiMo-V2.6 将需求分解为多个任务,通过多智能体协作完成:构建 3D 游戏场景、编写交互逻辑以及视觉验证。随后,它基于渲染结果进行持续修正,最终生成符合用户意图的可运行交互式世界。

Blender 3D 建模

MiMo-V2.6 可以根据用户的文字描述或参考图片,在 Blender 中完成物体和场景的 3D 建模,生成可用于动画制作、3D 打印和游戏开发的 3D 资产。

具身智能

在具身仿真环境中,MiMo-V2.6 可以直接以多视角相机图像作为输入,持续进行推理和决策,通过视觉反馈闭环控制 Franka Panda 机械臂,完成物体抓取、颜色分类和精准放置等任务。

Computer Use Agent

MiMo-V2.6 将多模态感知与原生训练的动作能力相结合,进一步拓展了 Computer Use 能力。它能够理解复杂的图形用户界面,使用常见的办公和生产力工具完成信息检索、编辑和数据处理等任务,还能根据视觉反馈检查结果、排查问题并调整后续操作。

推进前沿科学研究

即便没有针对科研任务做过专门的强化学习,MiMo-V2.6 也已在多个研究领域展现出应用潜力。从材料设计到数学形式化,下面的案例展示了模型如何将推理、编程和工具调用能力应用于具体的科研任务。

材料研究的 Co-Scientist

MiMo-V2.6-Pro 协助研究人员完成材料设计与计算筛选。在小米前沿材料研究团队多轮提示与交互下,它针对被称为"永久污染物"的全氟和多氟烷基物质(PFAS)的吸附问题,提出了多个金属有机框架(MOF)材料设计方案。在此过程中,模型检索并整理相关文献和专利,提出研究假设,并评估设计方案的新颖性。

随后,它进一步开展了"干实验":调用开源计算工具自动搭建仿真环境,计算所设计的 MOF 材料与 PFAS 之间的结合强度,筛选出最具潜力的候选材料,供后续通过"湿实验"进行验证。

图片

形式化数学证明

MiMo-V2.6-Pro 协助研究人员在 Lean 4 中完成了 Li 和 Yorke 经典论文《Period Three Implies Chaos》(周期三蕴含混沌)中主要定理的完整形式化工作。该定理揭示:对于区间上的连续自映射,若存在周期为 3 的轨道,则必然存在所有正整数周期的轨道,以及一个不可数的混沌集合。

在研究人员设计的探索策略引导下,MiMo-V2.6-Pro 通过 Sub-Agent 协作推进定理陈述与证明的形式化工作。经过后续修订与整合,该项目最终生成了超过 6,000 行 Lean 源代码,其完整证明已通过 Lean 内核验证,且未留下任何未证明的占位符。由于该模型并未针对 Lean 进行专门的后续训练,此案例展示了其参与复杂形式化证明任务的能力。

图片

代码驱动的内容创作与美学表达

MiMo-V2.6 系列显著提升了模型创作精美数字产品的能力,涵盖前端网页、Figma 设计稿、幻灯片、SVG、视频、音乐等多个领域。在设计评估排行榜 Design Arena 上,MiMo-V2.6-Pro 的表现已接近 Claude Opus 5 和 GPT-5.6 Sol 的水平。

图片

前端与 PPT 的美学表达

MiMo-V2.6 能将简单指令转化为完整的前端界面和 PPT,生成结构化布局,并精心打磨组件、交互元素及丰富的动画效果。它还熟练运用 Figma 及图像/视频生成工具,产出与整体风格相匹配的视觉创意,保持字体、配色及图文排版的统一性,并在美学表达与阅读及交互体验之间取得平衡。

视频创作

MiMo-V2.6 具备端到端的高质量视频创作能力。在创意与产品宣传视频场景中,MiMo-V2.6 能根据用户需求完成视觉设计、镜头与动态效果编排、配乐合成及节奏对齐;在科普视频场景中,它能将傅里叶分解、凸包等抽象概念转化为通俗易懂的解释和连贯的动画,并调用 MiMo-V2.5-TTS 合成与画面精准对齐的配音,从而将复杂知识转化为受众易于理解的生动内容,实现从概念拆解到最终视频输出的全流程自动化。

音乐创作

MiMo-V2.6 进一步增强了模型在音乐理解、审美判断及知识应用方面的能力,并探索了其在音乐创作中的应用。它已展示出创作 Demo 级音乐作品的能力,同时也具备辅助专业作曲家和编曲师进行创作工作的潜力。

在此示例中,MiMo-V2.6-Pro 按要求创作了一首包含约十种乐器的管弦乐作品。在生成乐谱后,它自主将作品转换为 MIDI 格式。这首作品展示了模型对不同乐器间分工与配器关系的理解,以及将音乐知识应用于旋律创作和整体编排的能力。

开始使用

使用小米 MiMo 桌面客户端

随着新模型的发布,MiMo 桌面客户端及会员订阅计划同步上线。欢迎通过下方链接下载体验。订阅会员即可使用 MiMo-V2.6-Pro 和 Flash 模型,也可配置专属 API Key 来使用客户端。

🔗: https://mimo.xiaomimimo.com/desktop/

MiMo 桌面客户端随 MiMo-V2.6-Pro 的 UltraSpeed 模式同步上线,提供高达 20 倍的推理速度,以支持对实时交互和响应延迟敏感的场景。

原有的邀请制测试将在一周后结束。已获得测试资格的用户在切换模型名称后,可继续使用服务。

访问 Xiaomi MiMo API

与此同时,MiMo-V2.6 系列已登陆 Xiaomi MiMo 开放平台,API 价格保持不变。

MiMo-V2.6-Pro 还在开放平台上提供 UltraSpeed 超高速模式,推理速度最高可达 20 倍。

模型定价如下:

图片

全面开源

我们已完整开源 MiMo-V2.6-Pro 和 Flash 模型的权重及技术报告,同步发布 MiMo-V2.6-Distill-Qwen-9B 及配套的强化学习(RL)研究资源,并分享了经过验证的训练实践。详细开源内容如下:

  • 7k+ 高质量 RL 任务环境:覆盖软件工程、漏洞复现、知识密集型工作、网页设计与开发四类 agent 任务。从 MiMo-V2.6-Distill-Qwen-9B 开始进行 RL 训练,在全部 11 项基准测试上均超越 SFT 基线:SWE-bench Verified 从 61.1 提升至 66.2,MiMo Cyber Bench 从 31.3 提升至 47.0,Terminal Bench 2.1 从 37.1 提升至 52.8,MiMo Visual Coding 从 64.0 提升至 72.4;

  • 端到端 RL 训练框架:基于 verl、uni-agent 和 mini-swe-agent 构建,覆盖环境交互、轨迹采集、奖励评估与策略优化的完整训练流程。支持开源模型与任务环境,方便社区在训练算法、奖励机制和 agent harness 层面开展研究与迭代。

  • 轻量可组合的 Harness:开源极简 mini-harness,将系统提示词、工具与上下文管理解耦,构建多样且可控的训练配置。通过 Multi-Harness Training,把多样性与整洁性融入 RL 训练,提升模型在不同框架(包括未见过的框架)上的泛化能力,同时支持社区自由组合框架组件、扩展训练配置,持续探索新的研究方向。

图片

希望此次分享能助力社区在强化学习算法和 Agent 机制上达成共识,为相关研究奠定共同基础,推动 Agentic RL 研究的持续进步。

开源链接:https://huggingface.co/collections/XiaomiMiMo/mimo-v26

注意:调用 API 时,请使用全小写模型名称:mimo-v2.6-pro、mimo-v2.6-flash 和 mimo-v2.6-pro-ultraspeed。

更新时间:2026 年 9 月 22 日Cline 配置Xiaomi MiMo 桌面版 — 测试版现已上线
原始来源: mi

评论 (0)