返回行业动态
研究前沿

GPT-6 Astra 攻下 FrontierMath Tier 4 最后一题:Epoch AI 宣布该层级饱和,评测重心转向开放问题

Epoch AI 更新 FrontierMath 评测,宣布研究级 Tier 4 层级饱和:OpenAI 的 GPT-6 Astra 取得 97.6% 并解出最后一道未被攻克的题目。该层级从首发约 5% 到被刷穿约 14 个月,评测重心转向尚未解决的开放问题与 Lean 形式化证明。这提示企业以「当前模型做不了某类推理」为前提的能力假设需要更短的复检周期。

来源:Epoch AI(FrontierMath 官方评测项目)原标题:FrontierMath: Benchmarking AI against advanced mathematical research查看原文
深蓝色科技插画:一堵布满发光数学公式与几何符号的巨墙被中央一道白色光束贯穿,四周环绕发光的神经网络节点与数据网格

北京拓实科技原创(AI 生成配图)

发生了什么

Epoch AI 于 9 月 10 日更新其 FrontierMath 评测结果,宣布 Tier 4 层级已进入饱和状态。OpenAI 的 GPT-6 Astra 在该层级取得 97.6% 的成绩,并解出了此前从未被任何模型攻克的最后一道题。按 Epoch AI 的累计统计口径,Tier 4 的每一道题都至少被某个模型在某次尝试中成功解出,该层级因此不再具备区分前沿模型数学推理能力的作用。

关键节点

  • Tier 4 于 2025 年 7 月 11 日上线,题目由数学教授与博士后围绕自身研究方向设计,首发时榜单最高成绩约 5%
  • 2026 年 6 月 Epoch AI 完成 v2 审计:修正 12 道题、移除 7 道题,最终保留 43 道
  • v2 口径下,GPT-5.6 Sol 为 83.0%,Claude Fable 5 为 90.2%,GPT-6 Astra 升至 97.6%
  • 最后一道题由马凯特大学数学副教授 Jay Pantone 出题,其公开表示 Astra 的解法与自己的思路接近,而不是数值捷径

为什么重要

这条消息的价值不在于单道题被解出,而在于研究级评测基准的生命周期正在明显缩短。FrontierMath 的设计初衷是延缓被刷穿,参与者包括陶哲轩、Timothy Gowers、Richard Borcherds 等菲尔兹奖得主,Epoch AI 曾在公开样题页面写明其中一些题可能数十年内不会被 AI 解决。从约 5% 到宣布饱和,前后约 14 个月。对企业技术选型而言,这意味着任何以「当前模型做不了某类长链条推理」为前提的能力假设,都需要更短的复检周期;同时也说明头部模型在长链条推理任务上的迭代速度仍未放缓。

仍需观察

Tier 4 饱和并不等于数学已被 AI 解决。FrontierMath 项目已延伸至下一阶段:一是 Open Problems,直接使用数学界尚未解决的研究问题,答案是计算可验证的;二是 FrontierMath Erdős,把开放问题形式化为 Lean 命题,要求模型给出可通过形式化验证的完整证明。在 Erdős 的 68 道题中,GPT-6 Astra 仅解出 2 道。同一周,25 位菲尔兹奖得主联署《A Severe Misalignment of AI in Mathematics》,批评以竞速方式刷穿著名难题对数学研究生态的影响。评测结论可以反映能力水位,但不能直接折算为采购或估值判断。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。