发生了什么
英伟达研究团队公布了一套纯自然语言推理的数学奥赛方案:以 Nemotron 3 Ultra 为基础,经后训练得到两个专家检查点,在 2026 年国际数学奥林匹克(IMO)中取得 42 分制下的 30 分,达到金牌线。技术报告于 9 月 9 日发布在 arXiv,检查点、训练数据、训练与推理代码、实际提交的解答以及一套含 200 道新题的基准同步公开。
技术路径
- 基础模型为 Nemotron 3 Ultra,混合专家架构,总参数 5500 亿,单次激活约 550 亿。
- 两个专家检查点分别通过监督微调与强化学习得到;监督数据约 41.5 万条,其证明由 DeepSeek-V4-Pro 生成。
- 推理阶段完全在自然语言内完成,不使用 Lean 等形式化证明器、不调用外部工具、不联网,模型自身同时承担生成与验证职责。
- 每个问题产生 384 份候选证明,两个专家各判定 8 次,只有全部 16 次判定一致才被接受;被拒证明最多修订 8 轮,最终候选再经 48 次奥赛式评分排序。
算力账目与开放边界
团队公开了完整算力口径:定位最终提交证明约消耗 1464 个 GB200 GPU 小时,全流程约 4800 GPU 小时。检查点以英伟达 OpenMDW 许可发布,单个检查点下载量达 1.12 TB,模型卡建议至少 8 张 B200、合计约 1.5 TB 显存。新增的 Nemotron-IMO-Bench 含 200 道奥赛题,由资深命题人 Titu Andreescu 参与编写,用于缓解竞赛题目被训练数据污染的长期问题。
解读时需要注意的地方
报告本身披露了验证环节的偏差:基于模型的评分器给出的成绩约为 32 分,比官方评定的 30 分高 2 分,作者称这是「模型验证共有的盲区」。此外,比赛计时结束后系统仍继续搜索,八个多小时后为最难的第六题生成了一份新证明,其自建验证器并未接受该证明,但非官方的人工重新评分为 4/7 分,额外消耗 890 GPU 小时——官方成绩仍记为 30 分。
对计划复现的应用方而言,真正的门槛不在模型权重,而在测试时算力预算:要让这套流程跑出金牌级结果,需要 GB200 级集群与数千 GPU 小时的投入,这更适合作为专用推理服务的后端,而非通用对话场景。该工作的方法论价值在于证明了一件事——把通用基础模型转化为领域专家,可以用「后训练出专家检查点 + 编排式推理流水线」这一可复制的组合来完成,而不必依赖符号系统。

