如何使用 AI 对 PDF 进行摘要(并保留引用)
在使用 AI 对 PDF 进行摘要的同时,确保每条引用都不被遗漏。了解如何借助 NotebookLM、Claude 和 Scholarcy 验证来源,并避免出现“幻觉式”参考文献。
对任何“用 AI 给 PDF 摘要并保留引用”的工作流来说,最棘手的部分是“信任”:摘要本身通常读起来没问题,但附在摘要里的引用可能并不真实。我们指导的一位二年级博士候选人就是在做系统综述时半途才发现这一点,当时她已经把 187 份 PDF 排队等待处理。问题出在她的摘要电子表格:大约 60 条记录引用了并未出现在源 PDF 中的论文。她当时使用的工具是一个免费的、类似 ChatGPT 的 PDF 摘要器,它能够凭借训练数据记忆流畅地产生“支持性引用”,并把这些引用直接挂到摘要句子上,但完全没有验证所引用的论文是否真的出现在文档里。如果她没有先核查前十条记录,就会有这些“幽灵引用”进入她的论文。清理工作花了两周。
这种失效模式是 2026 年用 AI 摘要学术 PDF 的核心风险。摘要本身通常是准确的;但附着在摘要上的引用往往并不可靠。风险主要有两种形态。第一种是遗漏:摘要把原本在段落中引用三处来源的内容压缩成一个不带归属的单一结论,断开了后续你需要用来捍卫该结论的证据链。第二种是幻觉:模型会从训练记忆中生成流畅的引用,看起来合情合理,但实际上并未出现在源 PDF 中。两者都容易忽略,而且在事后很难察觉。
这篇文章提供的是能够同时避免上述两种失效模式的工作流。我们将讨论:为什么通用型 PDF 摘要器会剥离或编造引用;一个“可安全引用的摘要”应保留的四类元数据;逐步工作流如何生成可验证的摘要;真正的“可安全引用摘要”应当长什么样;简要的工具选择建议;以及每位研究者都应该知道、并学会捕捉的常见失败情形。
如何在不丢失引用的情况下,对 PDF 的 AI 摘要输出进行整理?
选择具备引用感知能力的工具,而不是通用摘要器:NotebookLM 会把每一句摘要锚定到 PDF 中的源文本片段,这使得“幻觉式引用”在架构层面更难发生。提示模型保留源文中的任何文内引用,加入每条主张出现时的页码,并明确标注推断。然后在信任整批结果之前,先把前 3 份摘要中的引用与源 PDF 逐条核对。
为什么通用型 AI PDF 摘要器会剥离或编造引用?
关键的架构原因是:我们在关于“幻觉引用”的文章中讲过的同一个原因:LLM 分词器并不会把引用片段赋予特殊地位。当模型在总结 PDF 时,会把源文当作一个 token 序列来读取,并生成一个近似内容的摘要。源文中的引用("(Smith, 2024)")只是和其他 token 一样的普通 token。输出中的引用可能来自三种来源之一:从源文复制而来(最佳情况)、从记忆中重生成(高风险,容易幻觉)、或者完全省略(最常见的失败)。
这三种行为在不同工具上的表现并不一致。ChatGPT 的默认 PDF 摘要通常在短小且干净的片段中出现文内引用时会保留;但在密集段落里,它往往会丢掉或重写引用。Claude 对从记忆中生成引用更保守,但在长文档中仍会丢失部分引用。NotebookLM 最强,因为它会把每一句摘要锚定到 PDF 中的源片段:这使得幻觉在架构层面难以发生,而不仅仅是“被抑制”。Scholarcy 是学术专用并为该场景构建,但它的摘要粒度有时比所需的“引用密度”要更粗。
因此一个操作层面的含义是:对于“摘要”而言,工具选择比提示工程更重要。没有引用锚定约束的通用型 LLM 会生成读起来很顺、并且看似引用充分但其实部分错误的摘要。具备引用感知的工具则会生成有时不那么优雅、但始终可追溯的摘要。只要这份摘要会用于你自己的写作,就应该选择后一种。
一个可安全引用的摘要需要保留的四类元数据
并非每个摘要都需要同等强度的引用处理。下面这四类元数据就是“菜单”;选择与自身使用场景匹配的等级即可。
1. 源文中的文内引用。 当源 PDF 写的是 "(Martinez & Chen, 2024) found that...",一个可安全引用的摘要就应当把这种归属保留在摘要中本身。摘要不应该把归属压缩成 "researchers have found that...",也不应把该主张错误地归到论文作者名下,而是应当归属到被引用的来源。文内引用是回溯到原始证据的证据链;一旦丢失,证据链就断了。
2. 参考文献列表锚点。 摘要应当包含足够的关于该来源论文的元数据(作者、年份、期刊、DOI),使你在自己的写作中能够正确引用,而无需再次打开 PDF。多数工具都能轻松做到;失败模式通常发生在工具生成的 DOI 或年份与实际论文不一致,这种情况少见,但在每批次中核查一次仍然值得。
3. 页码或章节锚点。 摘要句子应能回链到源文中该主张出现的具体页码或章节。NotebookLM 原生支持;Sharly AI 会提供页码引用;而 Claude 和 ChatGPT 除非你明确要求它们包含页码,否则不会自动给出。页码锚点能让你在写作时核对主张,而无需重读整篇论文。
4. 置信度标记。 一个区分 "the paper says X(论文说的是 X)" 与 "I infer the paper means X(我推断论文的意思是 X)" 的摘要,比把两者都压成同一类表述更有用。某些工具(NotebookLM、Scholarcy)会保留这种区分;而多数基于 LLM 的工具会把它们合并。修复方式是“提示级别”的:要求模型明确标注不确定的推断。
能够同时保留以上四类元数据的摘要,生成所需时间更长、阅读起来也不如不保留元数据的摘要那么顺滑。但它也是唯一适合作为你自己写作引用的摘要类型。只要你打算把某个来源用于自己的研究,这种权衡就是值得的。
如何在不丢失引用的情况下,对学术 PDF 进行摘要?
五个步骤。该工作流假设你是在对一批 PDF 进行总结,目的是做文献综述或系统综述;如果只是单篇论文,请跳过第 1 步。
步骤 1:对 PDF 进行标准化。 确保你批次中的每个 PDF 都可以提取文本(而不是扫描图像)。对任何扫描版 PDF 运行 OCR(ABBYY FineReader、Adobe Acrobat Pro 或免费的 Tesseract 流程)。如果不做 OCR 就对扫描 PDF 摘要,质量会一致地很差;引用尤其会以随机字符字符串的形式“漏出来”。该步骤每个 PDF 约需 10 到 30 秒。
步骤 2:根据文档长度与引用密度来选择工具。 对单篇、少于 20 页且引用密度正常(少于 60 条参考文献)的论文,推荐通过文件上传界面使用 Claude Sonnet。对要为文献综述处理的一批论文、且源片段可追溯性至关重要的场景,推荐 NotebookLM。对需要结构化数据抽取的系统综述(样本量、干预、结局),推荐 Scholarcy 或自定义的 Claude 提示。就“引用安全性”而言,工具选择比提示工程更关键。
步骤 3:明确要求保留四类元数据。 使用通用的“总结这篇论文”提示会产生会丢掉引用的摘要。我们使用的提示模板如下:
Summarize this paper in 150-300 words. For every claim in the summary: 1. Preserve any in-text citation from the source (e.g., "Smith (2024) found that..."). 2. Include the page number where the claim appears. 3. Mark with [INFERENCE] any claim that is your inference rather than a direct statement in the paper. 4. At the end, list the paper's full citation in APA format and any methodology details (sample size, study design, primary outcome) that appear in the abstract or methods section.
提示开销是客观的(约 50 个 tokens),但输出质量差异是有意义的。NotebookLM 不需要这种提示,因为它的架构能自动处理步骤 1-3;而 Claude 和 ChatGPT 在加入该提示后都会显著改善。
步骤 4:在信任整批结果之前,先核对前 3 份摘要中的引用。 打开前 3 篇论文对应的源 PDF,确认摘要中的每一条文内引用确实出现在源文中。如果你看到摘要里出现了源文中不存在的引用,那么工具很可能在“幻觉”。此时应更换工具(最可靠的是 NotebookLM),或进一步收紧提示。这个核查步骤就是用来捕捉文章开头提到的系统综述失效模式的唯一关键检查。
步骤 5:将内容导出为结构化格式,并保留元数据。 每篇论文一行的电子表格(列包含 citation、summary、page references、methodology details、your notes 等)能让摘要在下游写作中保持可用。避免使用会丢失“每篇论文一行”结构的自由文本导出。能导出到 CSV 或 BibTeX-with-notes 的工具,更容易与文献管理器集成。
完整工作流每个 PDF 大约需要 5 到 10 分钟,其中约 60% 的时间用于核对(步骤 4)。核对步骤正是将“可安全引用摘要”和“流畅但错误”的摘要区分开来的关键。
一个可安全引用的摘要到底长什么样?
为把四类元数据标准落到实处,这里给出同一篇论文用两种方式摘要的示例。
不关注引用的摘要(通用 ChatGPT 默认):
This study examined the effects of a new intervention on cognitive decline in older adults. The researchers found significant improvements in working memory and processing speed. The intervention was well-tolerated and showed promise for clinical application. Future research should explore long-term effects.
这份摘要表达很流畅,读起来也像是胜任能力较强的写作。问题是它对引用毫无帮助。摘要中的主张没有把它们归属到论文所引用的原始来源。"researchers found(研究者发现)" 的写法把任何内部引用都压成了同一种叙述声音。没有提供页码引用,因而无法用于核验。如果你想在自己的写作里引用它,你将不得不重新打开 PDF。
可安全引用的摘要(NotebookLM 风格 + 明确提示):
Kowalski et al. (2024) examined the effects of a 12-week cognitive-training intervention on working memory in adults aged 65-80 (n = 247) [p. 3]. The intervention produced significant improvements in working memory (d = 0.42, p < .001) and processing speed (d = 0.31, p = .003), replicating earlier findings from Park and Liu (2021) [p. 8]. The intervention was well-tolerated with no adverse events reported [p. 11]. The authors note that the 12-week duration may be insufficient to detect long-term effects, and recommend a 24-month follow-up study [p. 14, discussion]. [INFERENCE: The effect sizes are moderate, which is consistent with the cognitive-training literature reviewed in the introduction (Park & Liu, 2021; Wei et al., 2023) but smaller than the original training paradigms from the 1990s.] 完整引用:Kowalski, M., Singh, R., & Patel, A.(2024)。老年人认知训练:一项为期12周的随机试验。《认知增强期刊》,18(3),234-251。https://doi.org/10.1007/s41465-024-00345-x Methodology: n = 247, ages 65-80, 12-week randomized controlled trial, primary outcome working memory composite, secondary outcome processing speed.
第二份摘要大约是第一份的两倍长度。它同样也让你可以在不重新打开 PDF 的情况下,准确撰写一段引用该论文的文献综述文字。源文中的每一条文内引用都被保留下来了;页码引用也很明确;推断被清晰标注;完整参考文献信息也已准备好直接粘贴到你的文献管理器中。
对任何你打算在自己研究中引用的来源而言,第二种格式至少应当达到这一标准。
一段话讲清工具选择
我们更广泛的 AI 文献综述工作流文章 讲到了多论文场景;而用于可安全引用的 PDF 摘要的“短版”工具选择建议是:当需要可追溯、锚定到引用的摘要时选 NotebookLM(免费档、需要 Google 账号、最适合文献综述批量处理);对单篇长 PDF 的一次性摘要用文件上传方式选 Claude Sonnet(200K 上下文窗口足以在一次传入中覆盖大多数期刊文章);在系统综述中需要结构化数据抽取时选 Scholarcy(付费,但结构化输出能节省数小时);阅读时要针对单个 PDF 进行对话式问答则选 ChatPDF(适合问“这篇论文对 X 有什么说法?”)。我们的 AI 摘要器 用四类元数据标准把“保留引用模式”封装起来。对任何你计划引用的来源,避免使用通用的免费 PDF 摘要器;幻觉风险是客观存在的。
常见失败情形及如何捕捉
我们在审计的文献综述中看到的失败模式共有五种。每一种都有对应修复方案。
失败 1:编造支持性引用。 摘要把一个主张归因给源 PDF 中并不存在的论文。修复:对任何批次先核对前 3 份摘要与源 PDF;如果出现幻觉引用,更换工具(最可靠是 NotebookLM),或收紧提示以要求必须锚定到源片段。
失败 2:归属被压塌。 摘要把 "Smith (2024) found X, but Jones (2023) found Y" 变成了 "researchers have found mixed results(研究者发现结论不一)"。修复:在提示中明确要求保留文内引用;选择能原生处理该需求的工具(NotebookLM、Scholarcy)。
失败 3:方法学细节错误。 摘要报告的样本量、研究设计或主要结局与实际论文不一致。该问题比引用幻觉少见,但一旦发生后果更严重。修复:在提示中加入 "extract methodology details verbatim from the methods section(从方法部分逐字抽取方法学细节)";并核对第一批次。
失败 4:通用式摘要重写。 所谓“摘要”本质上只是对论文摘要(abstract)的改写,且没有从正文部分提取任何新增信息。它对快速概览可能有用,但对文献综述毫无价值,因为文献综述需要正文里的方法、结果与局限。修复:对正文内容提出明确要求;并通过抽查摘要之外的章节来验证。
失败 5:引用格式漂移。 摘要保留了引用内容,但呈现格式与源文不同(例如把括号式改成叙述式,或反过来)。它通常不如前四类问题那么严重,但仍值得捕捉。修复:提示模型保留原始引用格式;如果你需要事后统一规范,引用格式指南中心 会覆盖规范的经典格式。
除了“保留引用”这一角度,我们的文章也介绍了更广泛的论文摘要工作流见如何用 AI 总结研究论文的文章;而本文则是该工作流的 PDF 专项与“引用安全性”扩展。
常见问题
Q: 2026 年,哪个 AI 工具最适合用于总结学术 PDF?
合适的工具取决于你的使用场景。对文献综述而言,批量处理 PDF 且最看重引用可追溯性时,NotebookLM 最强。对单篇较长论文(最多约 500 页),用文件上传方式的 Claude Sonnet 能在一次传入中使用其 200K 上下文窗口。对需要结构化数据抽取的系统综述,Scholarcy 是为该目的“量身打造”。对阅读过程中针对单个 PDF 进行对话式问答,ChatPDF 速度最快。对你计划引用的来源,避免使用通用型免费 PDF 摘要器;在学术使用中,幻觉式引用是核心失效模式。
Q: 当我用 ChatGPT 总结我的 PDF 时,它会不会编造引用?
会,尤其在密集段落中,或当提示要求它“明确生成引用”但没有把引用锚定到源片段时。我们的建议是:不要让任何 LLM 去“根据来源生成引用”;相反,要求它“保留源文中出现的任何文内引用”,并“为每条主张加入其出现页码”。这样能把引用处理锚定到“源片段可核验”而不是“模型训练记忆”。
Q: 我怎样用 AI 总结一篇 60,000 字的论文?
使用支持长上下文的工具:Claude Sonnet(200K tokens 能在一次传入中覆盖典型论文)或 NotebookLM(会自动分块并保持跨分块一致性)。不要一次性把整篇论文都总结掉,而是按章节逐步摘要;每章摘要更有助于你撰写自己的文献综述部分,并且分块能给你可复查的检查点。避免用 GPT-5 做整篇论文的全文传入摘要;虽然 128K 上下文对大多数章节足够,但用于完整文档会不太舒适。
Q: 我可以在自己的论文中引用 AI 生成的 PDF 摘要吗?
你引用的是原始论文,而不是摘要。摘要只是一个帮助你阅读与记忆来源的工具;引用应该指向源论文本身。如果摘要帮助你形成某个洞见,那么该洞见属于你,但引用指向支撑该洞见的那篇论文。关于我们在稿件中披露 AI 工具使用的更广泛处理方式,请参阅我们的 AI 披露指南;它是该主题在该系列中的最紧密配套文章。
Q: 如何为系统综述从 PDF 中提取结构化数据?
使用具备结构化输出能力的工具:Scholarcy 适用于专门的抽取(把样本量、干预、结论等作为命名字段输出),或使用 Claude 提示要求把相同字段以 JSON 或 CSV 格式输出。结构化输出应当始终至少在你的批次中对前 10 篇论文与源 PDF 进行核验;结构化抽取工具往往比叙事式摘要更可靠,但在我们的编辑测试中仍会在大约 5-10% 的情况下产生字段错误。
基于来源的摘要、页码引用、推断标记,以及用于文献综述的结构化导出。免费版覆盖完整的一批。
