SAI audit: only 8 of 105 ICML 2026 oral papers fully reproduced
The Chicago-based nonprofit SAI audited all 168 oral papers at ICML 2026, attempting full reproduction by running code and comparing results. Of 105 papers fully assessed, only 8 reproduced over 80% of claims, and the median reproduction score was 28-30%. Common issues included broken code, missing files, and results that did not match the paper; four papers relied on defunct models.
Coverage timeline
机器之心机器之心
前沿实验室的人几乎不读论文了? OpenAI 的一位研究员一句话扫射三大顶会: 太多夸大其词和造假 ! 事情的起因,是一篇效果好得让人想不通的 ICLR 论文,网友研究了一下才发现其中的「 秘诀 」。 在顶会发论文都「进化」成这样了吗? 一看代码是否开源,二看实验方法里有没有藏着什么「歪门邪道」,三才是跑出来的结果又能不能支撑核心结论 —— 这一层层拷问下来,顶会论文究竟有几篇经得起检验? 还真有人这么干了。 105 篇中,只有 8 篇「合格」 今年 7 月,由芝加哥大学计算机科学与数据科学副教授谭宸浩联合创办的 SAI,公布了一次大规模「实验审稿」。 他们选中的,是 ICML 2026 全部 168 篇 Oral 论文。 今年 ICML 共收到 23918 篇投稿,最终只有 168 篇获得 Oral 资格,占比约 0.7%。 换句话说,SAI 检查的已经是两万多篇投稿中筛出的最顶层。 除了和传统审稿人一样阅读论文的方法、实验设计和结果,SAI Review 还会下载代码、模型和数据,配置环境并运行实验,最后把运行结果与论文原文逐项对照。 SAI 审查了全部 168 篇 Oral,其中只有 104 篇论文代码开源,最终完成了 105 篇完整复现。 其中, 只有 34 篇复现了超过 40% 的主张;复现比例超过 80% 的,只剩 8 篇 。 无论每篇论文至少包含 1 项、3 项还是 5 项可验证主张,复现得分中位数始终在 28%—30%,整体分布变化不大。 排除未运行、提前中止或超出硬件能力的实验后,复现得分中位数仍只有 42%—50%;当每篇论文至少包含 3 项可验证主张时,中位数稳定在 42%。 复现里最常见的问题都遇到了:代码无法运行、文件缺失、说明不完整、依赖损坏,或者代码跑出的结果和论文对不上。 还有 4 篇论文依赖已经下线的模型。后来的研究者即使愿意花钱、花时间,也不可能重新得到相同结果。 SAI 还列举了两个更具体的例子。 一篇论文把「只训练基础模型 0.77% 的参数」写成主要卖点,实际发布的检查点却训练了 6.31% 的参数,约为宣称数字的 8 倍 。 另一篇论文展示了由裁判模型评分的可靠性表格, 开源代码中却找不到这个裁判模型 ,也没有脚本能够算出表格里的数字。 劣质论文,收益高风险低 SAI 的复现结果可以说是相当糟糕。 更糟糕的是,这里发现的问
