人工智能 · 奥数
Nemotron 以 30/42 触及 IMO 2026 金牌线,全程未用形式化证明器
NVIDIA 的 Nemotron 3 Ultra 检查点仅凭自然语言证明就达到了 IMO 2026 的金牌线。论文公开了数据、代码和一个包含 200 道题的基准测试,但该分数为自报。

论文《An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics》的摘要称,该系统在 IMO 2026 中拿下 42 分中的 30 分,达到金牌线。论文的 Hugging Face 页面对这个数字的说明仅止于此。它没有点出评分者是谁,没有说明分数来自竞赛本身的阅卷还是内部流程,也没有按题目拆解这 30 分。在团队之外有人复现这次运行之前,应将其视为作者的自我报告。
该页面在条件设定上则具体得多。整套流水线完全以自然语言运作:没有形式化证明器,没有外部工具,无法联网。
三个检查点,两个训练阶段,一轮筛选
一切都从 Nemotron 3 Ultra 出发。团队以这个通用可用模型为基座,在其之上后训练出两个专家检查点,手段包括监督微调和强化学习。这样一来,搜索回路里就有三个模型,而非一个。
在推理阶段,这些检查点驱动一个迭代循环:生成候选证明、验证它、改进它,然后重复。随后一个算力预算高得多的独立阶段挑出最终提交的解答。把筛选与生成分开是一个预算决策:大部分时间花在低成本的迭代上,昂贵的那一轮留给最后定稿。
摘要把这一结果称为开源模型测试时计算(test-time-compute)流水线,这意味着推理设计与训练同等重要。摘要没有说明搜索为每道题生成多少候选、验证器如何给它们打分,也没有说明筛选阶段的优化目标是什么。这些细节决定了这套配方能否迁移。
发布内容包含什么
这篇论文交付的不只是一份文字说明。
| 产物 | 内容 |
|---|---|
| 两个后训练检查点 | 搜索所依赖的专家模型 |
| 训练数据 | 以 nvidia/Nemotron-Math-Proofs-v3-SFT 和 nvidia/Nemotron-Math-Proofs-v3-RL 的名义发布 |
| 训练与推理代码 | 流水线本身 |
| 提交的解答 | 系统对 IMO 2026 各题的作答 |
| Nemotron-IMO-Bench | 200 道全新的奥数级题目 |
其中两项比其余更重要。提交的解答是系统对竞赛题目的真实作答,正是它让外部审计成为可能。而 Nemotron-IMO-Bench 补充了作者称为全新的 200 道题,为下一支团队提供了尚未被吸收进训练数据的测试集。
在 Hugging Face 上,检查点 nvidia/Nemotron-3-Labs-Ultra-Math-RL 作为一个引用该论文的模型出现,两个训练集则以 nvidia/Nemotron-Math-Proofs-v3-SFT 和 nvidia/Nemotron-Math-Proofs-v3-RL 的名义出现。这是一次真实的开源发布,但还不是一次被复现的发布。从公开一套配方,到确认它在作者自身环境之外同样有效,中间这道缺口尚无人填补。
为什么自然语言是更冒险的那一半
形式化证明助手会把一段论证变成机器可以逐行核查的东西。这套流水线拒绝了这条路。它以普通的数学文字书写和推理,没有证明器可以兜底,也没有任何外部资源可供查阅。
这笔交易是用确定性换取可读性。自然语言证明的读感与人类解答一致,而从论文的表述看,这正是其用意所在。但验证环节就位于被评估的流水线内部,因此系统在一定程度上有自评之嫌。机器可核查的证明凭据不会有这个问题,语言模型验证器则有。
摘要没有说明验证阶段核查什么、它多久会误拒一份正确的证明,也没有说明一道典型题目需要多少轮改进。缺少这些数字,金牌之说就建立在一个读者无法检视的评分流程之上。
一条开放的金牌级流水线改变了什么
如果这一结果站得住,其意义在于公开了什么,而不在于分数本身。权重、训练数据、代码和解答合在一起,让另一个实验室无需从零重建就能尝试同样的运行。
这落在一个已经逐渐远离静态测试的基准评测格局中。随着模型在固定题集上训练殆尽,这些题集已失去大部分诊断力,业界正转向动态评测和专家级考试。在这一背景下,一个自报的奥数成绩比过去更难定位。它只是一个团队、一篇论文给出的一个亮眼数字,而评测栈正出自构建该系统的人之手。
值得关注的是这次发布。42 分中的 30 分能否经受外部审计,目前仍无定论。
- 来源 : Nemotron hit IMO 2026's gold threshold at 30/42, without a formal prover — 2026-09-11
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。