一个模型家族,两项金牌成果:针对IOI和IMO微调Nemotron
国际信息学奥林匹克竞赛(IOI)和国际数学奥林匹克竞赛(IMO)考察的是不同的能力。IOI 要求在严格的时间与提交限制下,编写能通过隐藏测试用例的算法和代码;IMO 则要求提供严谨的自然语言证明。在其中任何一项比赛中取得成功都难如登天。若能在两项比赛中均拔得头筹,则预示着更广泛的实力。
我们近期的结果表明,Nemotron 是构建世界级专业模型的强大且适应性强的基础。基于 Nemotron 3,我们的团队利用监督微调(SFT)、强化学习(RL)和基于反馈的推理,构建了在 IMO 2026 和 IOI 2026 均达到金牌水平的系统。
| 竞赛 | Nemotron 特化配置 | 成绩 |
|---|---|---|
| IOI 2026 | 配备 SFT 和 GenCorrect 的 Nemotron-3-Ultra-CC | 535.4/600,高于 361.12 的金牌分数线及 498.27 的人类最高分 |
| IMO 2026 | Nemotron 3 Ultra 通用版、SFT 和 RL 检查点,组成生成-验证-优化系统 | 30/42,高于 29 分的官方金牌分数线 |
IOI 的成绩来自一次实时的前瞻性运行,在时间、网络访问和提交约束方面与人类选手完全一致。这是一项非官方的无监督基准测试,未计入 IOI 官方排名。IMO 系统提交的证明均由 IMO 官方评分员打分。
可复用的特化配方
“易于微调”的意义应超越仅仅让检查点可训练。它应意味着,一个强大的基础模型能够通过清晰且可复用的配方,适应高要求的领域。
在这两个项目中,该配方包含四个部分:
- 从强大的 Nemotron 基础模型开始。
- 整理特定领域的问题和高质量推理轨迹。
- 应用标准的后置训练方法,如 SFT,以及在有益处的情况下使用 RL。
- 将专业模型与推理循环配对,该循环负责生成、评估和改进候选答案。
虽然训练和推理过程开销不小,但底层方法成熟且可复现。我们无需为每个挑战任务从头构建新的基础模型,只需针对特定任务对 Nemotron 进行专业化调整即可。
从通用编码能力到 IOI 金牌
针对竞赛编程,我们筛选了 22,000 道题目并生成合成的推理轨迹,用于训练两个专用模型。Nemotron-3-Nano-CC 总参数量 300 亿,激活参数量 30 亿,同时接受了 SFT 和 RL 训练;Nemotron-3-Ultra-CC 总参数量 5500 亿,激活参数量 550 亿,仅接受了 SFT 训练。
在 2025 年 IOI 上的表现提升直观地体现了专业化训练的价值。Nano 模型的得分从后训练前的 130 分提升至 SFT 后的 280 分,再到 RL 后的 291 分。结合 GenCorrect(我们的迭代式“生成-评估-优化”策略),其得分达到 468 分,超过了 438.3 分的金牌门槛。采用相同的测试时策略,Ultra-CC 更是取得了 502 分的成绩。
这些实验还表明,不同规模下的适配策略无需保持一致。对于 Nano 模型,大部分增益来自 SFT,RL 则带来了较小但稳定的提升。而对于更强的 Ultra 模型,仅需一轮 SFT,其在 IOI、ICPC 和 LiveCodeBench Pro 上的表现便已全面超越完成全套后训练的 Nano 模型。这一发现指导了用于 2026 年 IOI 的竞赛专用 Ultra-CC 系统的构建,该系统最终获得了 535.4 分(满分 600)。
教 Nemotron 证明、检查与修正
IMO 项目将同样的思路应用于奥数。基于 Nemotron 3 Ultra,我们分别用 SFT 和 RL 各训练了一个专用模型。
SFT 语料库包含 414,890 个经过质量过滤的样本,涵盖 15,818 道独特的证明题。这些数据不仅教导模型输出最终答案,还覆盖了证明生成、优化、验证及元验证,使模型能够学会构建论证、识别逻辑漏洞、回应质疑以及判断证明是否完整。RL 模型则基于 9,597 道接近模型能力边界的证明题进行训练。
在开发实验中,两个后训练后的 checkpoint 都优于公开发布的通用模型。SFT checkpoint 在第一轮搜索中表现最强,而 RL checkpoint 拿到了整体最佳的单 checkpoint 成绩。两者优势互补,因此最终系统同时使用了这两个专用模型和通用模型。
对于每道 IMO 题目,模型会生成候选证明、打分、给出批改意见,并对最有希望的尝试进行迭代改进。最终提交的答案由一个单独的高算力阶段选出。整个系统完全用自然语言运行,不依赖形式化证明器、外部工具或联网。它最终得分为 42 分中的 30 分,其中六道题里有四道拿到满分,超过了官方金牌分数线。
微调与测试时算力相辅相成
我们此前发布的 IOI 2025 Hugging Face 博文已经展示了测试时算力如何把开源权重模型推向金牌水平。这次的新结果补充了关键一环:更好的专业化模型能为推理系统提供更优质的候选解、更可靠的评判者和更有效的改进。
在 IOI 上,GenCorrect 把微调带来的增益通过多轮反馈放大成了更大的提升。在 IMO 上,组合互补的 SFT 和 RL checkpoint 比单纯从一个 checkpoint 采样更多次更有价值。两种情况下,最佳结果都来自把能力出众的专用模型与一套能够搜索、验证并持续改进的系统相结合。
这个区别很重要。奖牌不是仅靠微调拿到的,也不是仅靠暴力采样堆出来的,而是来自对模型、数据和推理流程的协同设计。
在 Hugging Face 上开放模型、数据与配方
我们希望这些成果的应用范围能超越竞赛本身。Nemotron Labs IMO 2026 资源集汇集了 SFT 和 RL 检查点、两个训练数据集,以及新发布的 Nemotron-IMO-Bench——一个包含 200 道奥林匹克级别难题的基准测试。IMO 论文详细阐述了训练方法及“生成-验证-优化”系统,而 NeMo-Skills 仓库则包含 IMO 推理流程、提示词、提交证明以及可复现的快速入门指南。在竞赛编程方面,Nemotron-3-Ultra-CC 模型已上线 Hugging Face,IOI 论文提供了训练配方及 GenCorrect 方法论。IOI 的评估与推理流程同样可以在 NeMo-Skills 中找到。
总体而言,IMO 和 IOI 为这一简单理念提供了极具挑战性的有力证据:Nemotron 可以被微调成世界级的领域专家,再结合透明的推理工作流,从而解决处于人类竞赛前沿的难题。
我们很期待看到 Hugging Face 社区接下来会创造什么。


