Meta AI wins gold in five STEM Olympiads using pure reasoning
Meta announced on X that its AI model achieved gold or gold-level results in five STEM Olympiads, including perfect scores in two physics theory exams, without using tools such as search, coding, or calculators. The model, an internal training version from the Muse Spark series, used multi-agent orchestration and parallel reasoning, and even identified an error in an official answer, leading to a physical gold medal from the IPhO committee. Meta has not yet published a technical report, and some results are described as 'gold-level performance' rather than officially certified.
Coverage timeline
机器之心机器之心
编辑|Panda 今天凌晨, OpenAI 免费了 GPT-5.6 Luna 。几乎在同一时间段,另一家曾经打造出 Llama 系列、随后在大模型竞赛中一度掉队的公司也发了声——Meta 在 𝕏 上宣布,它把自家 AI 模型送进了五项 STEM 学科奥林匹克竞赛,全部拿到金牌或金牌水平成绩,其中两项物理竞赛的理论考试直接满分。 更惊人的是,Meta 表示,其 AI 是纯靠推理能力取得的这些成绩:「我们禁止了所有工具的使用,这意味着没有搜索、没有编码,也没有计算器。」 对此,曾在 OpenAI、DeepMind、谷歌大脑工作过的 Meta 研究者 Lucas Beyer 还在 𝕏 上揶揄了 Gary Marcus 和 Yann LeCun。不过,这两位长期批评自回归 LLM 的著名研究者并未直接答复。 看起来,Meta 似乎又重新支棱起来了? 不过,Meta 目前尚未发布相关技术博客或研究报告,但参与了该项目的 Meta 研究者 Shuchao Bi 也发了两条推文,补充了更多细节,包括该模型是是来自 Muse Spark 系列的内部训练版本,使用了多智能体编排与并行推理。 不仅如此,Meta 的模型还答对了官方答案错误的问题。Shuchao Bi 说:「这一发现最终防止了人类参赛者的答卷被错误评分。IPhO 委员会好心地向我们寄送了一枚实体金牌。」 成绩单 Meta 列出的五项成绩是:亚洲物理奥林匹克竞赛(APhO)理论考试满分,国际物理奥林匹克竞赛(IPhO)理论考试满分,国际数学奥林匹克竞赛(IMO)金牌,国际化学奥林匹克竞赛(IChO)金牌水平表现,以及罗马尼亚数学大师赛(RMM)金牌水平表现。 先说这几项赛事的分量。IMO 2026 年第 67 届在上海举行,百余国选手用两场各 4.5 小时的考试解六道题,满分 42 分。RMM 每年 2 月在布加勒斯特举行,只邀请十几支最强国家队,题目难度公认不亚于 IMO。IPhO 与 APhO 分别是全球和亚洲规格最高的中学物理竞赛。 成绩上,两项物理写的是「满分」,IMO 写的是「金牌」,IChO 和 RMM 写的却是「金牌水平的表现」。后一种措辞在这个领域通常意味着成绩未经赛事组委会正式评定,而是按当年金牌分数线自行对照得出的结果。 Meta 同时表示,感谢这些竞赛的选手与组委会「对我们参赛的支持」,这暗示至少
