AI 倒查百年论文:99.2% 顶刊存疑
同行评审、顶会接收、SCI 收录——这些曾经代表学术研究最高可信度的标签,正在被 AI Agent 系统性地「打假」。2026 年 7 月起,多个研究团队用 AI Agent 对 ICML、NeurIPS、ICLR 的近年论文进行批量复现与错误检测,结果触目惊心:99.2% 的顶刊论文至少含 1 个可客观验证的错误。论文正在从「研究终点」变成「验证起点」。
ICML 2026 复现审计:168 篇里 8 篇达 80% 复现率
2026 年 7 月 22 日,一家美国研究审查公司组织了一轮系统性的 ICML 2026 口头报告论文复现审计,使用的工具是 AI Agent 而不是人工。
审计范围与方法
ICML 2026 共接收 168 篇口头报告论文,其中 92 篇包含至少 5 条可供验证的结论性声明。AI Agent 的任务是逐条核对每条声明的代码、数据、运行环境与最终结果。
关键数据
| 复现率区间 | 论文数 | 占比 |
|---|---|---|
| 全部 8 成以上结论可复现 | 8 篇 | 8.7% |
| 超过 4 成结论可复现 | 34 篇 | 37.0% |
| 不足 4 成结论可复现 | 58 篇 | 63.0% |
换句话说,能够让 AI Agent 跑出 80% 结论的论文仅有 8 篇,而无法复现超过半数结论的论文高达 58 篇。
复现失败的四类原因
复现失败并不等同于研究造假,审计方明确区分了两者。失败原因主要包括:
- 代码缺失:关键训练脚本、配置文件或随机种子未上传
- 依赖断裂:依赖库版本与论文声明不一致,运行时报错
- 结果不符:代码能跑通,但输出与论文报告的指标存在显著差异
- 模型下线:4 篇论文依赖的预训练模型已下线,意味着实验结果永久无法被任何人复现
更离谱的是「数字注水」案例:一篇论文的核心卖点是「仅训练基础模型 0.77% 的参数」,但其开源的 checkpoint 实际训练了 6.31% 的参数,相差约 8 倍。另一篇论文贴了一张基于某评判模型的可靠性表格,但开源代码中根本不包含该评判模型,也没有任何脚本能生成表格里的结果。
Agent Reproduction Challenge:复现赛同步失守
几乎同一时间,Hugging Face 与 AlphaXiv 联合发起了「Agent Reproduction Challenge」,邀请研究者用 AI Coding Agent 复现 ICML 2026 接收论文。
挑战赛的设计思路是:把复现成本从「博士生一学期」压缩到「AI Agent 几小时」。然而赛事结果并不乐观,多个团队反馈:很多论文连最基本的依赖环境都装不起来,AI Agent 不得不反复修改 Dockerfile 才能勉强进入训练阶段,部分论文的实验跑出来的结果与作者报告的相差超过 30%。
这从另一个角度印证了审计结论——复现失败不是个例,而是系统性问题。
GPT-5 论文检查系统:99.2% 论文至少 1 个错
如果说复现审计解决的是「能不能跑出来」,那么 GPT-5 驱动的 Paper Correctness Checker 解决的就是「论文文本本身有没有写错」。
2025 年底发布的一个研究项目使用 GPT-5 对已发表在顶会顶刊的论文做客观错误检测。研究者的立场非常明确:只看客观错误,不看创新性,不看研究价值。
错误密度
- 平均每篇论文 4.7 个客观错误
- 99.2% 的论文至少含 1 个错误
- 数学与公式错误占比最高,达 54.0%
- 30.8% 的 NeurIPS 论文和 23.8% 的 ICLR 论文包含至少 1 个可能影响结果解读的实质性错误
错误随时间在变多
| 年份 | NeurIPS 篇均错误数 |
|---|---|
| 2021 | 3.8 |
| 2025 | 5.9 |
| 涨幅 | +55.3% |
ICLR 的年度投稿量已从 2018 年的 1013 篇上升至 2026 年的 19619 篇,近 20 倍的投稿膨胀让同行评审的负担远超人力极限,错误率随之攀升是必然结果。
75 年前的化学数据被 AI 翻案
更令人震撼的是历史文献的错误密度。
浙江实验室理论化学家 Pios 在用 AI 预测分子沸点时,发现结果与一份 75 年前的化学数据库存在明显冲突。他第一反应是「肯定是我错了」,但手动回溯原始文献后发现:AI 是对的,那份 75 年前的数据本身就有问题。
Pios 随后扩大核查范围,又发现了一份约一个世纪前、被学界公认权威的沸点测量值同样存在错误。而这份数据已经被无数后续论文引用、吸纳。
一处最初出现在某篇论文中的错误,沿着引用链传递,形成事实上的学术共识——这是错误长期未被发现的核心机制。
工具能力边界:精确率 83.2%,仍需人审
需要清醒认识的是,AI 事实核查工具目前还不足以担任科学文献的判官。
以 GPT-5 驱动的 Paper Correctness Checker 为例:
- 检测精确率为 83.2%
- 每次检测中仍有约 40% 的真实错误未被检出
这意味着 AI 工具的输出需要人工二次审核。但即便如此,AI 已经把「系统性地重审百年科学文献」从不可能变成了可能。
给科研人的实践建议
对于想进入这个新方向的科研人来说,AI 倒查论文不仅是学术打假工具,更是选题金矿:
- 转变思路:从「找新选题」转向「找旧论文里的异常点」,重点关注被大量引用但争议较少的经典论文
- 构建知识地图:用 AI 工具梳理论文引用谱系,识别引用链中的可疑节点
- 重新审视经典:用 AI 重新跑那些「不可能错」的经典实验,挑战长期被接受的假设
写在最后
论文发表不再意味着研究宣告「胜利」,而只是再次进入下一轮 AI 验证的开始。99.2% 的错误率不是学术圈的耻辱,而是 AI 重整科学史的起点——当 AI 把复现成本降到几小时、把错误检测做到规模化,那些沉睡了百年的数据终于有机会被重新审视。
科研的范式正在从「发表即终点」走向「复现即起点」。下一个重大突破,或许就藏在那 99.2% 的错误里。