跳到主要内容

AI 倒查百年论文:99.2% 顶刊存疑

同行评审、顶会接收、SCI 收录——这些曾经代表学术研究最高可信度的标签,正在被 AI Agent 系统性地「打假」。2026 年 7 月起,多个研究团队用 AI Agent 对 ICML、NeurIPS、ICLR 的近年论文进行批量复现与错误检测,结果触目惊心:99.2% 的顶刊论文至少含 1 个可客观验证的错误。论文正在从「研究终点」变成「验证起点」。

ICML 2026 复现审计:168 篇里 8 篇达 80% 复现率

2026 年 7 月 22 日,一家美国研究审查公司组织了一轮系统性的 ICML 2026 口头报告论文复现审计,使用的工具是 AI Agent 而不是人工。

审计范围与方法

ICML 2026 共接收 168 篇口头报告论文,其中 92 篇包含至少 5 条可供验证的结论性声明。AI Agent 的任务是逐条核对每条声明的代码、数据、运行环境与最终结果。

关键数据

复现率区间论文数占比
全部 8 成以上结论可复现8 篇8.7%
超过 4 成结论可复现34 篇37.0%
不足 4 成结论可复现58 篇63.0%

换句话说,能够让 AI Agent 跑出 80% 结论的论文仅有 8 篇,而无法复现超过半数结论的论文高达 58 篇。

复现失败的四类原因

复现失败并不等同于研究造假,审计方明确区分了两者。失败原因主要包括:

  1. 代码缺失:关键训练脚本、配置文件或随机种子未上传
  2. 依赖断裂:依赖库版本与论文声明不一致,运行时报错
  3. 结果不符:代码能跑通,但输出与论文报告的指标存在显著差异
  4. 模型下线:4 篇论文依赖的预训练模型已下线,意味着实验结果永久无法被任何人复现

更离谱的是「数字注水」案例:一篇论文的核心卖点是「仅训练基础模型 0.77% 的参数」,但其开源的 checkpoint 实际训练了 6.31% 的参数,相差约 8 倍。另一篇论文贴了一张基于某评判模型的可靠性表格,但开源代码中根本不包含该评判模型,也没有任何脚本能生成表格里的结果。

Agent Reproduction Challenge:复现赛同步失守

几乎同一时间,Hugging Face 与 AlphaXiv 联合发起了「Agent Reproduction Challenge」,邀请研究者用 AI Coding Agent 复现 ICML 2026 接收论文。

挑战赛的设计思路是:把复现成本从「博士生一学期」压缩到「AI Agent 几小时」。然而赛事结果并不乐观,多个团队反馈:很多论文连最基本的依赖环境都装不起来,AI Agent 不得不反复修改 Dockerfile 才能勉强进入训练阶段,部分论文的实验跑出来的结果与作者报告的相差超过 30%。

这从另一个角度印证了审计结论——复现失败不是个例,而是系统性问题

GPT-5 论文检查系统:99.2% 论文至少 1 个错

如果说复现审计解决的是「能不能跑出来」,那么 GPT-5 驱动的 Paper Correctness Checker 解决的就是「论文文本本身有没有写错」。

2025 年底发布的一个研究项目使用 GPT-5 对已发表在顶会顶刊的论文做客观错误检测。研究者的立场非常明确:只看客观错误,不看创新性,不看研究价值

错误密度

  • 平均每篇论文 4.7 个客观错误
  • 99.2% 的论文至少含 1 个错误
  • 数学与公式错误占比最高,达 54.0%
  • 30.8% 的 NeurIPS 论文和 23.8% 的 ICLR 论文包含至少 1 个可能影响结果解读的实质性错误

错误随时间在变多

年份NeurIPS 篇均错误数
20213.8
20255.9
涨幅+55.3%

ICLR 的年度投稿量已从 2018 年的 1013 篇上升至 2026 年的 19619 篇,近 20 倍的投稿膨胀让同行评审的负担远超人力极限,错误率随之攀升是必然结果。

75 年前的化学数据被 AI 翻案

更令人震撼的是历史文献的错误密度。

浙江实验室理论化学家 Pios 在用 AI 预测分子沸点时,发现结果与一份 75 年前的化学数据库存在明显冲突。他第一反应是「肯定是我错了」,但手动回溯原始文献后发现:AI 是对的,那份 75 年前的数据本身就有问题。

Pios 随后扩大核查范围,又发现了一份约一个世纪前、被学界公认权威的沸点测量值同样存在错误。而这份数据已经被无数后续论文引用、吸纳。

一处最初出现在某篇论文中的错误,沿着引用链传递,形成事实上的学术共识——这是错误长期未被发现的核心机制。

工具能力边界:精确率 83.2%,仍需人审

需要清醒认识的是,AI 事实核查工具目前还不足以担任科学文献的判官。

以 GPT-5 驱动的 Paper Correctness Checker 为例:

  • 检测精确率为 83.2%
  • 每次检测中仍有约 40% 的真实错误未被检出

这意味着 AI 工具的输出需要人工二次审核。但即便如此,AI 已经把「系统性地重审百年科学文献」从不可能变成了可能。

给科研人的实践建议

对于想进入这个新方向的科研人来说,AI 倒查论文不仅是学术打假工具,更是选题金矿:

  1. 转变思路:从「找新选题」转向「找旧论文里的异常点」,重点关注被大量引用但争议较少的经典论文
  2. 构建知识地图:用 AI 工具梳理论文引用谱系,识别引用链中的可疑节点
  3. 重新审视经典:用 AI 重新跑那些「不可能错」的经典实验,挑战长期被接受的假设

写在最后

论文发表不再意味着研究宣告「胜利」,而只是再次进入下一轮 AI 验证的开始。99.2% 的错误率不是学术圈的耻辱,而是 AI 重整科学史的起点——当 AI 把复现成本降到几小时、把错误检测做到规模化,那些沉睡了百年的数据终于有机会被重新审视。

科研的范式正在从「发表即终点」走向「复现即起点」。下一个重大突破,或许就藏在那 99.2% 的错误里。