ProofreaderPro.ai
AI校对与编辑

幻觉引用审计:投稿前的核查

幻觉引用审计能够在投稿前发现伪造的AI参考文献,避免在提交后才暴露问题。通过PubMed中1/277的发生率、一套四数据库工作流,以及能标记这些问题的免费工具,我们可以更有把握地提前拦截。

Lisa|Jul 11, 2026|11 分钟阅读
幻觉引用审计:投稿前的核查 - ProofreaderPro.ai Blog

一项投稿前的幻觉引用审计,如今已成为“让桌面屏幕保持干净”与“触发研究诚信警报”之间的分水岭,而它之所以重要,已经被量化出来了。Maxim Topaz所带领的哥伦比亚团队对收录于PubMed Central的250万篇生物医学论文进行审计后,揭示了我们一直暗自担心的事实:在生成式AI工具开始成为普通研究者起草工作流的一部分的同一时期,被纳入同行评审生物医学期刊印本的虚假参考文献数量出现了急剧上升。到2026年最初七周为止,每277篇PubMed收录论文中就有1篇至少引用了某个在PubMed、Crossref、OpenAlex或Google Scholar的任一数据库中都找不到的参考文献。两年前,这一比例还是每2,828篇中1篇。也就是说,伪造引用进入文献的发生率在12倍量级上升,而涨幅最大的部分几乎从2024年年中按计划时间点开始。

Topaz这项审计是我们目前掌握的最“干净”的数据,但它并非唯一的证据来源。ArXiv宣布,对那些在论文中发布带有明确的AI生成错误(包括幻觉引用)的作者实施为期一年的投稿禁令。GPTZero对4,841篇NeurIPS 2025获接收论文的分析发现,在经过三到五位专家评审的筛查之后,仍有53篇论文中至少包含100条已确认的幻觉引用。迪肯大学的一项研究则从GPT-4o生成的参考文献中发现:56%的条目要么是假的,要么包含错误;而这类伪造条目中,有64%附带了一个与真实但无关论文相连的DOI,这种“真DOI但指错文献”的类型,往往最难被识别。

好消息是:一项投稿前的幻觉引用审计通常需要20分钟到两小时(取决于你的参考文献列表规模),并且在编辑或审稿人看到之前就能捕获几乎所有此类错误。本文就是该审计流程。我们将讨论:2026年幻觉引用通常呈现的样子、四数据库的核验工作流、逐步的投稿前清单、用于自动化的工具,以及当你在已在审稿中的稿件里发现幻觉引用时应该怎么做。

幻觉引用审计是什么?

幻觉引用审计是一种投稿前核查:将稿件中的每一条参考文献与PubMed、Crossref、OpenAlex和Google Scholar进行逐一核验,以在编辑或审稿人看到之前捕捉伪造或不匹配的引用。根据参考文献列表的规模不同,这一流程通常需要20分钟到两小时,并能捕获几乎所有这类错误。之所以重要,是因为在2026年的前七周里,每277篇PubMed收录论文中就有1篇至少引用了某个在这四个数据库中任何地方都不存在的参考文献,相较于2023年每2,828篇中1篇的比例,增长了12倍。

为什么幻觉引用正在成为筛查难题

大约在2024年下半年,编辑开始在技术界面上注意到幻觉参考文献的出现。到2026年年中,所有主流医学与生命科学期刊都会在其院内的审前流程或对同行评审者的指导中纳入“参考文献是否存在”的检查。“发表Topaz审计”的《柳叶刀》来信,在一定程度上也是期刊对其自身入口进行加固的公开承诺。

从实际运行角度看之所以关键,是因为幻觉引用不再被当作疏忽造成的错误处理;它被当作研究诚信的警示信号。从“作者把年份搞错了”到“作者并未阅读该来源,因为它根本不存在”,这一步跨越并不长,而编辑现在也被训练去做出这种判断。在大多数期刊中,60条条目列表里只要有一条引用错误就足以让稿件被退回;而在最严格的期刊(《柳叶刀》、BMJ、以及若干Nature Portfolio期刊)中,它甚至可能触发对接机构的研究诚信办公室进行转介。

arXiv的政策也用更尖锐的方式强调了同一点:任何作者提交包含幻觉引用的论文,都可能被arXiv禁发一年。禁令期结束后,之后每一次arXiv投稿都必须先在有声誉的场所完成同行评审,arXiv才会接收。这基于一条未经核验的引用所导致的“永久性声誉不对称”。“虚假引用导致的PubMed问题”并不只是PubMed的问题。

幻觉引用的真实样貌

多数作者会把幻觉引用想象得很“明显破损”:标题格式不正确、期刊名称不存在、年份被设在未来。这些确实存在,而且构成了问题中最容易发现的30%。剩下更难的70%看起来合乎常理,能够通过快速目视检查。

我们观察到四类反复出现的模式。

模式1:真实作者、真实期刊、看似合理的标题,但没有该论文。 该模型从训练数据中拼装引用,这些数据告诉它哪些作者在哪些期刊上、关注哪些主题。输出看起来像真正的参考文献。DOI若存在,要么无法解析,要么解析到的是另一篇完全不同的论文。

模式2:真实论文,但作者或年份错误。 模型知道论文确实存在,但把某个元数据字段匹配错了。该引用能通过Google Scholar的标题检索,但在DOI查询上失败。由于被引用的论断可能确实存在于真实论文中(只是作者或年份不同),因此这一类常常是最难被察觉的。

模式3:真实DOI,但对应的论文无关。 以迪肯研究为例:模型生成了一条看上去很合理的引用,并附上能解析的DOI,但该DOI指向的是完全无关的研究成果。直观看起来DOI是真的,但只有阅读所链接的论文,问题才会显现。这就是64%的那一类。

模式4:引用周围被“折磨/扭曲”的措辞链条。 Cabanac Problematic Paper Screener已经标记了超过19,000篇包含“经由改写软件生成、被扭曲措辞”的论文,这些措辞通常围绕编造的引用集中出现。比如:用“Joined Together States”替代美国(United States);用“bosom peril”指代乳腺癌;用“kidney disappointment”指代肾衰竭。如果围绕某条引用的文段看起来像是经过“改写-洗稿”处理过的,那么该引用也更可能是幻觉。我们关于改写的说明(preserves citations)讨论了导致“模式4”首先出现的技术差距。模式4与模式1至3具有相关性,并非独立存在。

这些模式之所以重要,是因为单一数据库的检查远远不够。仅做标题检索的Google Scholar查找会漏掉模式2和3。只做DOI的Crossref检索会漏掉模式1。之所以采用四数据库工作流,是因为每个数据库都能捕捉到不同的失败模式。

如何核验AI引用:四数据库工作流

我们将幻觉引用定义为:在任一PubMed、Crossref、OpenAlex或Google Scholar都找不到的引用。对于我们的投稿前审计,我们依赖这四个来源,因为它们分别覆盖了彼此之间的空白。

PubMed. 对生物医学与临床文献的覆盖最好。如果某条参考文献有PMID,就直接使用PMID查询。否则,就用“标题 + 第一作者的姓”进行检索。PubMed会拒绝许多“真实但匹配错误”的引用,而Crossref可能会接受。

Crossref. 对所有研究领域的DOI覆盖最好。使用该doi.crossref.org查询(或通过其公开API api.crossref.org/works/[DOI])按DOI查找参考文献。如果查询不成功,那么它几乎可以确定是幻觉;如果成功,再核对目标论文的标题、作者和年份。

OpenAlex. 覆盖范围最广、且免费,并且能发现PubMed与Crossref未覆盖的引用(人文社科、计算机科学会议论文、地区性期刊)。按标题查找参考文献,并确认作者是否正确。OpenAlex同样有用,因为它能呈现那些以预印本形式存在、但尚未以带DOI的正式出版物出现的引用。

Google Scholar. 建议作为最后一步:覆盖最广,但精度最低。若某条参考文献在PubMed、Crossref、OpenAlex或Google Scholar均未出现,那么在功能上它几乎可以确定为幻觉引用。若它只出现在Google Scholar,但结构化数据库中都没有,则需要高度怀疑:它可能确实存在(灰色文献、学位论文、没有DOI的会议论文、等),但在投稿之前仍需要人工核验。

如果手动进行,处理每条参考文献大约需要一分钟。60条参考文献就是一小时的工作量;200条系统综述则接近三小时。审计虽然繁琐,但操作是机械性的,因此非常适合自动化;下一节我们会介绍自动化工具。

提交前审核您的参考文献列表

我们的校对员在一次扫描中,将每条引文与 PubMed、Crossref、OpenAlex 和 Google Scholar 逐一核对,标记虚构引用,并导出一份干净的报告。

免费试用

投稿前审计:逐步执行

我们对每一篇在起草过程中“接触过生成式AI工具”的稿件都使用一份可重复的清单。共8步,且不需要任何付费工具。

1. 将参考文献列表导出为扁平化格式。 从你的文献管理器导出(Zotero、Mendeley、EndNote、Paperpile)为BibTeX或RIS。如果你的论文是用Word起草且没有使用文献管理器,那么把参考文献列表粘贴到纯文本文件中。对每一条条目进行编号。你需要这些编号来跟踪哪些引用已经完成核验。

2. 标记所有你不认识的标题。 如果你连那篇论文都无法想象出来,那么基本就意味着你并没有真正读过它。幻觉引用是“最可能为假”的那一类。为进行最彻底的检查,请将它们标出来。

3. 解析每一个DOI。 将每个DOI粘贴到https://doi.org/[DOI]。如果DOI无法解析,那么该参考文献就是幻觉;如果可以解析,就把目标论文的标题与作者与自己的引用进行对照。任何不一致通常都属于模式3幻觉。

4. 在PubMed或Crossref中核验每一条非DOI引用。 用“标题检索 + 第一作者姓氏”进行核查。如果该论文存在,就为你的记录保存PMID或DOI;如果在任一数据库都找不到,那么进入第5步。

5. 在OpenAlex和Google Scholar中交叉核查升级项。 如果某条引用在Crossref和PubMed都失败,那么OpenAlex与Google Scholar的检查就是最终的判定依据。四个数据库都失败,说明它就是幻觉引用的证据。如果某条引用只出现在Google Scholar中,那么需要人工检查其所链接的来源。

6. 对预印本:同时核验预印本和任何已发表版本。 一个常见的2024年中之后的模式:模型引用了一个真实预印本,但却编造了同一研究对应的、并不存在的期刊出版版本。针对任何预印本引用,请明确检查arXiv、bioRxiv、medRxiv和SSRN。

7. 抽样核对文内论断与原始来源。 打开原始论文,并检查它是否支持你所引用的那个具体论断:至少覆盖你参考文献的10%(或者在系统综述情形下覆盖全部)。迪肯研究中56%的错误率包含了模式2的案例:即被引用的论文存在,但并不支持该论断。

8. 记录审计过程。 保存审计日志(包括:哪条参考文献已被核验、核验使用了哪些数据库、在什么日期完成)。如果期刊在同行评审期间追问,有证据可出示。如果审稿人质疑某条特定引用,你也可以指向你的核验步骤。

运行审计的成本是两小时。跳过审计的成本(如果被发现)从技术筛查退稿到arXiv禁令不等。做完审计。

自动化审计的工具

你可以把8步全部手动完成。使用工具会让你更快。

Crossref公共API。 免费,不需要注册。端点api.crossref.org/works/[DOI]会返回包含规范标题、作者和年份的JSON。只需一段约20行的Python脚本遍历你的参考文献列表并请求该端点,就能在每条引用的几秒钟内捕捉模式1与3。这是最轻量的自动化方式,通常也足够应对60条参考文献的论文。

Scite(scite.ai)。 核验参考文献,并报告后续论文是否以“支持”或“反驳”的方式引用了该工作。由于它会与实际内容进行关联理解,因此比其他工具更擅长捕捉模式2(真实论文、但错误论断)。它有免费层;要实现完整集成,付费版本是必要的。

Problematic Paper Screener(Cabanac、Labbe、Magazinov)。 免费、开放,主要用于发表后的筛查,但其检测器在模式4的投稿前是很有用的。你可以在dbrech.irit.fr/pls/apex/f?p=9999:1处搜索。它有助于确认:围绕你的引用的文段并没有被改写-洗稿到那种“看起来像论文工厂输出”的程度。

内置于文献管理器的参考文献核验功能。 如果Zotero识别到幻觉引用,那么其“Find Available PDF”(查找可用PDF)功能就无法正常工作。Mendeley用于填充元数据的功能也会产生同样效果。这并不是专门的幻觉检测器,但当你按正常方式使用它时,它确实能识别出最容易出错的问题。

我们的校对器 我们的AI校对器通过一次遍历执行四数据库审计,突出显示幻觉引用与不匹配的引用,并导出一份干净的日志,方便你随稿保存。我们将此工具作为更大范围AI校对工具集的一部分提供,适用于研究论文,覆盖与之相关的语法、引用格式化以及带有干净参考文献审计结果的审阅追踪(tracked-changes)流程。

在进行完整校对之前先做一次独立检查时,我们的免费AI 引文检查器会直接在浏览器中对粘贴的参考文献列表执行相同的存在性检查,核对 Crossref、Semantic Scholar 和其他开放注册库,而且无需注册。

在多数情况下,Crossref API脚本加上一份人工升级清单就能为大多数作者把问题覆盖到90%。工具的价值在系统综述、投稿数量多的研究团队,以及当“单次漏检幻觉引用”的代价很大时尤为凸显(例如向《柳叶刀》或NEJM投稿,在先前已触发标记后向arXiv再次转载)。

如果你发现幻觉引用怎么办

你会发现的。以我们的经验来看,几乎所有接触过LLM的参考文献列表至少都有一条。根据稿件所处阶段,你有两种选择。

投稿前。 最简单的情形。移除该引用,或用确实支持该论断的真实参考文献替换,或重写围绕该论断的句子以删除不受支持的内容,并在你的审计日志中记录此次修改。

在同行评审中。 一旦确认存在幻觉,请尽快以书面形式通知负责处理的编辑。提供修正后的参考文献列表,并说明你做了什么:发现了什么、你如何发现的、你如何核验了其余参考文献。编辑通常更愿意回应能够自我纠正的作者,而不是等到被审稿人发现后才纠正的作者。

已接收但尚未发表。 立即联系编辑部生产负责人。大多数出版方会在校样阶段接受“延迟更正”,前提是这类更正被呈现为对研究诚信的自我纠正,而不是例行编辑。

已发表。 联系期刊并申请更正声明;在严重情况下,申请更正更正(corrigendum)。如果幻觉引用在论文中支撑的是一个实质性论断,修正可能需要扩展到该论断本身。这条路径是大多数人最希望避免的;而审计正是为了防止这种情况发生。

如果你使用过任何与参考文献列表相关的AI工具(例如改写器或引用生成器),请在你的稿件中提交AI披露声明。你也可以在投稿信中披露你做过审计并完成了自我纠正。这听起来是一种专业做法,而不是令人警觉的信号。

常见问题

Q: 2026年幻觉引用有多常见?

哥伦比亚的分析(Topaz等,发表于《柳叶刀》2026)发现:在2026年最初七周内发表、且被PubMed收录的论文中,每277篇里就有1篇包含至少一个参考文献。相较于2023年每2,828篇中1篇的比例,上升了12倍。这个趋势仍在加速。对于审稿严格的会议,GPTZero对NeurIPS 2025的分析发现:在被接收的4,841篇论文中,有53篇包含至少100条幻觉引用,占会议的约1%。

Q: 为什么64%那类“DOI为真”的情况最难捕捉?

当LLM编造一个参考文献时,有时会从训练数据中插入一个真实DOI,但该DOI指向的是另一篇不同的论文而非被引用内容。DOI能解析、目标论文存在,而快速目视检查似乎没有问题。只有当你点击该DOI链接进入被引用的论文后,才会发现:该被引文献的标题、作者甚至内容与引用本身并不匹配。迪肯研究表明,在用GPT-4o生成的伪造引用中,有64%都出现了这一情况:仅解析DOI是不够的,还需要核验链接到的论文是否确实对应你的引用。

Q: arXiv真的会因为幻觉引用把我禁掉一年吗?

是的,前提是过失具有明确性。Thomas Dietterich宣布了2026年5月的arXiv政策,该政策旨在处理这样一类情形:作者在未核验的情况下直接粘贴LLM输出,导致幻觉引用、聊天机器人占位符文本残留或数据等问题。arXiv也明确表示:真正存在争议或处于边界状态的情形不在此范围内。禁令期结束后,所有后续arXiv投稿都必须先在有声誉的场所完成同行评审,arXiv才会重新接收。

Q: 我能不能直接把参考文献列表丢给ChatGPT或Claude来核验?

不行。产生幻觉引用的同一个模型,也可能同样幻觉地“核验”结果。我们已经看到LLM会自信地“确认”那些编造的DOI确实有效。核验必须基于外部的结构化数据库(PubMed、Crossref、OpenAlex、Google Scholar),这些数据库拥有权威元数据,而不是让另一个LLM来做。

Q: 如果一条引用只出现在Google Scholar上怎么办?

只出现在Google Scholar、但在PubMed、Crossref或OpenAlex中都没有出现的引用,更像是可疑而非已确认的幻觉引用。一些真实来源(例如学位论文、没有DOI的会议论文、工作论文、地区性期刊)可能出现在Google Scholar中,但缺少结构化数据库覆盖。需要人工检查所链接来源。如果你能打开论文并核验论断,那么该引用确实存在,只是未被更充分地收录;可以带着信心去引用它。如果无法打开来源,或链接失效,就应当将其视为幻觉引用并移除或替换。

期刊投稿专用引文核查校对员

针对 PubMed、Crossref、OpenAlex 和 Google Scholar 的一次扫描虚构引用审计,并提供可下载的验证日志供您存档。

Lisa - Author at ProofreaderPro.ai
LisaCMO

Lisa 拥有 NYU 的语言学 PhD 学位,她一直对计算机如何利用应用语言学来理解和用人类语言进行交流以及协助编辑人类书面内容感到好奇。 她目前担任 ProofreaderPro 的首席营销官,领导文案、社交媒体、电子邮件和线下渠道的营销工作。

继续阅读

立即试用 AI校对器 免费版

立即开始免费使用
Proofreader Pro AI
使用ProofreaderPro.ai优化您的研究,全球领先的AI驱动校对工具,专为学术文本量身定制。
ProofreaderProAI, Greenleaf Ave, Staten Island, 10310 New York
© 2026 ProofreaderPro.ai. 领先的学术校对、编辑和人性化工具, 由我们精心打造 ❤️ 以及语法上通顺的表达句式 🌳s