
近期研究利用AI Agent对顶会论文进行大规模复现审计,发现99.2%的论文存在至少一个客观错误。这意味着,科研人员,尤其是学术新人,可以通过查文献挑错、写勘误来开辟全新的研究方向和发表成果的途径。
科研领域是否已无新问题可寻?优秀的研究方向是否已被前人占据?近期,一项利用AI Agent对学术论文进行大规模“打假”的研究给出了出人意料的答案:已发表的顶刊论文中,绝大多数都存在可被验证的问题。这一发现,或许为科研工作者,特别是学术新人,开辟了一条全新的研究路径。
Agent 掀起顶会论文“打假”风暴 在学术出版体系中,论文能登上顶级会议(如ICML、NeurIPS)通常意味着已通过同行评审。然而,受限于审稿人的精力和时间,他们几乎无法逐一从头下载数据、运行模型或复现实验来验证每项结论。随着AI领域论文数量的爆炸式增长,模型日益复杂、实验规模愈发庞大,一篇论文背后的代码、数据、参数设置可能涉及数百个细节,论文的可验证性因此变得岌岌可危。 如今,AI Agent的出现极大地降低了验证和复现的成本。据报道,2026年7月22日,美国某研究审查公司利用AI Agent对ICML 2026全部168篇口头报告论文进行了系统性的结果复现审计。结果显示,在92篇拥有至少5条可供验证结论性声明的论文中,AI Agent能够成功复现超过四成结论的仅有34篇,而能复现八成以上结论的仅有8篇。 需要强调的是,“无法复现”与“研究造假”之间存在本质区别。复现失败的原因多种多样,包括代码缺少关键文件、依赖库版本断裂、运行结果与论文描述不符等。更值得注意的是,有4篇论文依赖的模型已经下线,导致其实验结果永久无法被任何人复现。此外,一些错误堪称离谱:例如,一篇论文将“仅训练基础模型0.77%的参数”作为核心卖点,但其实际开源的checkpoint却训练了6.31%的参数,相差约8倍;另一篇论文展示的可靠性表格声称基于某评判模型,但其开源代码中根本不包含该模型。 无独有偶,2026年抱抱脸(Hugging Face)与AlphaXiv联合发起的“Agent Reproduction Challenge”挑战赛,也旨在利用AI Coding Agent对ICML 2026接收论文进行自动化复现,结果同样不容乐观。
更令人惊异的是论文错漏检测的趋势。2025年底,一项研究开发了基于GPT-5的论文检查系统,专门分析已发表在顶级AI会议和期刊上的论文,寻找可以客观验证的问题。研究者明确表示,他们只关注“客观错误”,不评判论文的创新性和研究价值。 最终结果显示,平均每篇论文被检测出4.7个客观错误,99.2%的论文至少被标记出一个问题。从错误类型看,数学与公式错误占比最高,达到54.0%(包括方程式写错、推导逻辑漏洞、证明中的错误假设等)。大约30.8%的NeurIPS论文和23.8%的ICLR论文包含至少一个可能影响结果解读的实质性错误。更值得关注的是时间趋势:NeurIPS论文的篇均错误数已从2021年的3.8个上升至2025年的5.9个,涨幅高达55.3%。 或许在今后,论文发表不再意味着研究宣告“胜利”,而只是进入了下一轮AI验证的开始。
这一现象对于正在为选题发愁的科研人员来说,可能是一个意外的“利好”。查文献挑错、写勘误,本就是学术圈内正经的产出形式,如今看来,这完全是一片学术蓝海。具体可以从以下几个方面入手: 1. 转变研究思路,不卷前沿卷过去:从“找新选题”转向“找旧论文里的异常点”,重点关注那些被大量引用但争议较少的经典论文。毕竟“99.2%的论文至少有一处错误”。
最近,浙江实验室的理论化学家Pios在使用AI预测分子沸点时,发现结果与一份75年前的化学数据库存在明显冲突。在手动回溯原始文献后,Pios惊讶地发现AI竟然是对的。随后,他利用AI继续核查,竟发现一份约一个世纪前、被学界公认权威的沸点测量值也是错的。这些错误数据已被经年累月地引用、吸纳于后续研究之中。 这类问题长期未被发现,与科学文献的规模直接相关。现代科学论文的数量已远超任何个体研究者的阅读极限,例如,仅ICLR的年度投稿量就从2018年的1013篇上升至2026年的19619篇。在这样的规模下,一处最初出现在某篇论文中的错误一旦被后续文献反复引用,就会沿着引用链持续传递,形成事实上的学术共识。 如今,至少在技术能力上,人们首次具备了大规模重审过往科学文献的可能。但以GPT-5驱动的Paper Correctness Checker为例,其检测精确率为83.2%,且每次检测中仍有约四成真实错误未被检出。因此,此类AI事实核查工具本身尚不足以担任科学文献的“判官”,其输出结果最终还需要人工审核。
这一趋势也为国内AI与学术领域带来了新的思考。国内大模型厂商如百度(文心一言)、阿里(通义千问)、深度求索(DeepSeek)等,在提升模型逻辑推理和事实核查能力方面持续发力。这些技术能力同样可以应用于学术论文的辅助审校。国内科研社区或许可以借鉴这一思路,开发基于中文语境的论文检测工具,对国内期刊和会议论文进行系统性“体检”,从而提升整体科研质量。
Agent是如何对论文进行“打假”的? AI Agent通过自动化方式对论文中的结论性声明进行复现审计。它能够下载论文关联的代码和数据,尝试运行模型并比对结果,从而发现论文中无法复现的结论或客观错误。
不等同。无法复现的原因很多,包括代码缺失、环境配置问题、数据未公开等,这些可能只是科研过程中的疏漏,而非故意造假。但依赖已下线模型的论文,其结论确实可能永远无法被验证。
主要错误类型包括数学与公式错误(如方程式写错、推导逻辑漏洞)、实验设置描述不符(如参数数量、模型版本不匹配)以及引用数据错误等。其中数学与公式错误占比最高,达到54%。
它开辟了新的研究选题方向。科研人员,特别是学术新人,可以转而关注已发表论文中的错误和异常点,通过撰写勘误或进行验证性研究来产出学术成果,这被视为一片“学术蓝海”。
目前不能。AI核查工具的检测精确率约为83.2%,仍有约四成真实错误无法被检出。因此,AI工具可以作为辅助手段,但最终的审核和判断仍需人工完成。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

千问办公开源首个项目 MyContext,通过分析飞书、钉钉等日常办公数据,自动蒸馏出个人工作档案,为 AI Agent 提供持续更新的上下文,解决 AI 办公中“缺乏个人记忆”的痛点。

用 161 个 RSS 信源和 AI Agent 搭建私人资讯筛选系统,从被动接收转为主动溯源,教你如何调教 AI 主编、生成个性化「赛博报纸」,彻底解决信息过载问题。

Databricks完成50亿美元融资,估值达1900亿美元。文章分析其产品布局、增长逻辑,并探讨数据基础设施如何成为AI Agent落地关键,以及国内厂商在该领域的进展。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。