Back to News

GPT-6 Astra solves last unsolved FrontierMath Tier 4 problem; Epoch AI declares benchmark saturated

#frontiermath#gpt-6-astra#benchmark#ai-mathematics

OpenAI's GPT-6 Astra has solved the last unsolved FrontierMath Tier 4 problem, leading Epoch AI to declare the benchmark saturated. All Tier 4 problems have now been successfully solved at least once by AI, with OpenAI reporting a 97.6% score for Astra. The benchmark, launched in November 2024 to resist AI saturation, saw top scores around 5% at its Tier 4 debut in July 2025.

Coverage timeline

  1. 量子位量子位

    AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4 henry 2026-09-12 15:33:54 来源: 量子位 FrontierMath Tier 4,饱和了 henry 发自 凹非寺 量子位 | 公众号 QbitAI 刚刚,最后一道FrontierMath Tier 4难题,被GPT-6 Astra攻破了。 至此,这套曾经被视作 大模型数学噩梦 的研究级测试,所有题目都已经至少被AI成功解出过一次。 Epoch AI也正式给它下了结论, FrontierMath Tier 4,饱和了。 虽然从上面的图里看,Astra还没有直接干到100%,OpenAI自己公布的成绩也是97.6%。 但按照Epoch的算法,“全部解出”指的是把不同模型、不同时间的尝试累积起来以后,Tier 4里的每一道题都已经有过成功解答。 而Astra干掉的,正是此前唯一还没有被AI攻破的那一道。 (简单理解就是Astra可能在某次测试中出错了,但它对的那道题是此前没被解出来的) 有一说一,这个发展速度还是相当离谱的。 如果你关注模型评测的话,就知道2025年7月11日,Tier 4刚刚推出时,榜上最高成绩只有大约5%。 现在刚过了一年零2个月,这个曾经的“高墙”已经变成了“台阶”,最后一道难以被AI通过捷径绕道解决的问题也被跨越。 出题人自马凯特大学数学副教授 Jay Pantone 也表示,以往AI都会找数值捷径,而这一次,AI的解法和自己相当接近。 不过,就在最近GPT-6 Astra集中向数学界猛攻,三天两头解决千禧年难题之际,Pantone表示自己已经很难惊讶了! 可以说,数学俨然已经成了Astra最近刷存在感最猛的地方之一。 从不足2%,到专门加一道“研究级防线” FrontierMath最早于2024年11月7日发布,而它诞生的目的,本身就是为了避免数学Benchmark过快被AI刷穿。 当时像GSM8K、MATH这样的传统数学Benchmark已经越来越难拉开头部模型之间的差距,于是Epoch AI联合60多位数学家,重新设计了一批此前从未公开过的原创题。 其中,就包括陶哲轩、Timothy Gowers、Richard Borcherds等菲尔兹奖得主。 陶哲轩当时看完其中一些研究级题目后直言,这些题“极其困难”,甚至判断最难