← 文章 / AI技术
The Decoder 1小时前 · 2026-09-22 20:06:13 · 2 阅读

小米高性价比旗舰模型 MiMo 登顶开源榜,Anthropic 指控其借助 Claude 训练

Image description

要点

  • 小米新发布的 MiMo-V2.6-Pro 模型登顶当前开源 AI 模型排行榜,且成本远低于竞争对手。
  • 性能飞跃得益于大规模扩展的强化学习,小米还开源了相关工具和训练任务。
  • 与此同时,Anthropic 指责小米通过 Claude 模型不当抽取数据,用于训练自家模型系列。

小米发布了 MiMo-V2.6 系列模型,其旗舰模型登顶开源模型排行榜,而单个任务的成本仅为竞争对手的零头。性能提升来自大幅扩展的强化学习,不过小米同时也被指从 Anthropic 的 Claude 那里“借了力”。

据小米介绍,两个新模型中较大的 MiMo-V2.6-Pro 在分析机构 Artificial Analysis 的 Intelligence Index 上拿到 46 分,成为目前最强的开源 AI 模型,超越了 Kimi K3 和 Qwen 等对手。真正令人惊讶的是价格:输入每百万 token 仅 0.435 美元,输出每百万 token 仅 0.87 美元。

按 Artificial Analysis 的测算,单次测试任务成本约为 0.13 美元,远低于同等能力模型的价格。这让该模型站在了所谓的智能与成本的 Pareto 前沿上。

Image: Artificial Analysis
图片来源:Artificial Analysis

Pro 是一个混合专家(mixture-of-experts)模型,总参数量达 1.02 万亿,但每次请求仅激活 420 亿参数。此外还有更小、更高效的 MiMo-V2.6-Flash。

性能提升来自强化学习

小米将性能飞跃归功于大幅扩展的强化学习(RL),即通过试错、反馈和奖励进行训练。公司沿三个方向扩展了这一阶段:每个训练步骤使用更多数据、更多样化的任务环境,以及更多用于评判解决方案的算力。

小米表示,这一强化学习流程耗时不足六天,Pro 版本成本约为 262 万美元,Flash 版本约为 85 万美元。在 DeepSWE 编码测试中,Pro 的得分从 58.4 提升至 72.6,Flash 则从 48.8 升至 65.7。

为确保在此规模下训练的稳定性,小米冻结了模型内部的分布机制,并增加了多层保护机制,以防止“奖励作弊”——即模型并非真正解决任务,而是钻空子骗取奖励的行为。

约 7,000 个带有自动评分器的任务

除了模型本身,小米还发布了一个名为 Pro-UltraSpeed 的极速变体,输出速度最高可达 20 倍。最引人注目的是,该公司开源了其 RL 工具包,包括技术报告、完整训练框架、用于进一步训练的小型模型,以及约 7,000 个带有自动评分器的现成训练任务(涵盖软件开发、网络安全、办公处理和网页设计),此外还有约 1,000 个音乐创作任务。

这些任务来源于多种渠道。部分代码来自员工和用户的真实 GitHub 拉取请求,而其他任务描述则由语言模型生成。网络安全任务基于 OSS-Fuzz,这是一个包含数万真实软件漏洞的集合,而办公环境则是通过合成方式构建的。

鲜明的开源姿态,以及 Anthropic 的指责

这种开放性姿态与 两周前 Anthropic 提出的指控 形成了鲜明对比。在其威胁情报报告中,Anthropic 审查了 2025 年 12 月至 2026 年 8 月期间发现的 Claude 滥用案例,并点名了七家参与针对该模型行动的实验室:阿里巴巴、Moonshot AI、DeepSeek、智谱、小米、MiniMax 和 SenseTime。

据称,这些实验室总共生成了约 1.9 亿次交互,以汲取 Claude 的能力来训练自家模型,Anthropic 将这种做法称为非法蒸馏。

小米的名字赫然在列。在一件编号为 GTG-16008 的案件中,Anthropic 追踪了 2026 年 3 月至 4 月间长达 20 天内的超过 40 万次交互。在这些交互中,小米将用户与其自有 MiMo 模型的对话及编码会话,通过 OpenClaw 和 OpenCode 工具传入 Claude,旨在为未来模型的训练丰富数据。报告几乎没有记录内部蒸馏教师模型所依赖的早期训练数据和教师数据的来源。

换句话说,该报告指控小米录下了用户与其 MiMo 模型的对话,并将这些数据输入 Claude 以提取训练数据——正是这些数据如今将小米推到了开源模型排行榜的顶端。

原始来源: The Decoder

评论 (0)