什么是 AI 写作中的 Burstiness?决定你是否像人类的指标
Burstiness 指句子长度与结构的变化,帮助区分人类写作与 AI 文本。本文说明检测器如何衡量它,以及如何提升。
突发性是指一篇文章中句子长度和结构变化的程度。人类写作会将短句与长句混合使用,AI 生成的文本则往往趋向于长度均匀、中等长度的句子。AI 检测器会测量这种变化,而较低的突发性是它们判断文本由机器撰写的最强信号之一。
阅读任何一段人类写的文字。认真看看它。某些句子只有五个词,另一些则会延伸到四十个词,在最终抵达某个结论之前,沿着多个从句和限定语蜿蜒展开。这种变化, 这种不可预测的节奏, 正是 AI 检测工具所称的突发性。
而你那份 AI 生成的草稿几乎可以肯定不具备足够的这种特征。
我们分析了 200 个学术文本样本,涵盖人类写作与 AI 生成两类。突发性上的差异是区分这两组的最清晰信号, 比词汇分析更可靠, 也比单独的困惑度更一致。
Burstiness defined: your句子的节奏
Burstiness 衡量的是一篇文本内部句子长度和复杂度的变化幅度。高 burstiness 意味着剧烈的变化,短促有力的句子与冗长复杂的句子交替出现。低 burstiness 则意味着一致性,句子接一句子,都落在相同的 15-to-20-word 范围内。
这个概念来自信息理论。在自然语言中,人类交流具有 "bursty" 特征, 我们会把想法聚集在不规则的片段中。我们先写一个信息密集、结构复杂的长句。然后停顿。一个短句。接着再进入另一个长结构。
AI 并不会天然这样运作。语言模型通过预测最可能的下一个 token 来生成文本,而这一过程往往会产生惊人一致的输出。句子长度会紧密聚集在均值附近。段落结构会重复出现。文本流畅地展开, 但过于流畅。
我们直接测量了这一点。在我们的 200-sample 数据集中,人类撰写的学术文本在句子长度上的标准差为 8.2 words。来自 GPT-4o 的 AI 生成文本平均为 4.1 words。Claude 略好一些,为 5.3 words。但二者都没有接近人类写作的变异程度。
这种差距正是检测器所利用的。
为什么 AI 文本的 burstiness 较低
理解 AI 为什么会以较低的 burstiness 写作,有助于你理解这个指标为何有效, 以及它会在何处失效。
语言模型经过训练来预测可能的文本。在生成句子时,模型会选择符合其训练数据统计模式的 token。其结果是,文本会倾向于中位数式的句子结构, 不会太短, 否则会显得突兀, 也不会太长, 否则会有损连贯性, 而是始终稳定地落在一个舒适的中间范围。
人类写作者的运作方式不同。我们写作时会基于强调、节奏,以及每个观点的具体要求。一个关键发现会用一个简短的句子单独呈现,以增强冲击力。一个复杂的方法论则需要更长的句式,才能涵盖所有相互关联的部分。我们会凭直觉、在每一瞬间不断调整。
我们也会疲倦、分心和兴奋。我们的认知状态会在整个写作过程中波动。早上 8 AM 写下的句子,与午夜写下的句子,其节奏模式并不相同。AI 没有这种波动。
结果就是, AI 文本读起来像是由节拍器写出来的。人类文本读起来像爵士乐。
检测器如何测量 burstiness
大多数 AI 检测器不会将 burstiness 作为一个独立数值报告。它会与 perplexity 和其他指标 一起纳入总体评分。不过,其测量本身很直接。
检测器会把你的文本拆分为句子。它会计算每个句子的长度,通常以词为单位,有时以 token 为单位。然后,它会计算整个文档中这些长度的方差或标准差。
有些工具更进一步。它们测量的不只是长度方差,还包括复杂度方差, 追踪句子是否在简单句、并列句和复合句结构之间切换。一段在 “We found this” 与 “Given the constraints imposed by the experimental design, together with the limitations inherent in cross-sectional analysis, our findings should be interpreted cautiously” 之间交替的文本,呈现出较高的 burstiness。一段每个句子都遵循主语-动词-宾语-修饰语模式的文本则不是这样。
GPTZero 将其可视化为散点图, 每个句子都按其 perplexity 和长度进行映射。人类文本会产生一个分散、无规则的云团。AI 文本则会产生一个紧密的簇。视觉上的差异非常显著。
更高级的检测器还会考察段落内部与段落之间的 burstiness。人类作者往往会在单个段落内改变节奏, 先广泛展开,再具体化,最后以一句简短结论收束。AI 则往往在整篇文本中保持相同的节奏。
Burstiness vs perplexity: 有什么区别?
这两个指标经常同时出现,研究者也常常将它们混淆。下面说明二者的区别。
Perplexity 衡量词汇层面的可预测性。语言模型对每一个词的选择有多意外?perplexity 低,表示这些词是可预测的。perplexity 高,表示这些词并不可预测。
Burstiness 衡量句子层面的变化。句子在长度和复杂性上彼此有多大差异?burstiness 低,表示句子较为统一。burstiness 高,表示差异显著。
你可能会出现 perplexity 低而 burstiness 高的情况, 例如一篇使用标准术语但句子结构变化很大的学术论文。你也可能会出现 perplexity 高而 burstiness 低的情况, 例如一段用词新颖但句子长度异常一致的创意文本。
在实践中,AI 生成文本通常在这两个指标上都得分较低。这种组合是最强的检测信号。只在其中一个指标上得分较低的文本,检测器就更难有把握地分类。
我们发现,实际上 burstiness 是写作中更容易修正的指标。调整句子长度是一种你可以有意识做到的事情。改变词汇层面的可预测性更难,因为这需要在更细粒度的层面重新思考用词选择。我们的 text humanizer 可以同时处理这两方面,但如果你是手动编辑,建议先从 burstiness 入手。
这对你的学术写作意味着什么
如果你正在使用 AI 来帮助起草论文, 而且数以百万计的研究者都是如此, 那么 burstiness 是你最具可操作性的指标。原因如下。
你可以在不改变内容的情况下提高 burstiness。观点、论证和证据都保持不变。改变的只有呈现方式。与 perplexity 调整不同, 后者有时需要进行词汇层面的调整, 这可能会显得不自然, burstiness 调整关注的是节奏和结构。
我们的建议如下:
打破单调的句子连写。 通读你的草稿, 找出那些每个句子长度都大致相同的段落。找到之后, 你一定会找到, 把其中一个句子改得非常短。再把另一个扩展成更长、更复杂的结构。
有意使用句子片段。 学术写作允许偶尔使用句子片段来强调。"Not significant" 可以作为一个句子。"A clear pattern" 可以接在一段较长的分析性陈述之后。片段会提高 burstiness。
变化段落开头。 如果每个段落都以一个 12 词的句子开头, 就打破这种模式。让一个段落以问题开头。让另一个以一个三词的陈述开头。再让第三个以一个在到达主旨之前逐步展开的从属从句开头。
大声朗读你的文本。 这之所以是最古老的写作建议之一, 是有原因的。你的耳朵能捕捉到眼睛会忽略的节奏单调。如果你的朗读节奏听起来像滴答作响的时钟, 也就是同样的拍子、同样的速度、同样的重音, 那你就有 burstiness 问题。
关于如何让 AI 辅助起草的文本听起来真正像人写的完整讲解, 请参阅我们的指南 如何 humanize AI text。
作为检测信号的 burstiness 的局限性
Burstiness 并不完美。没有任何单一指标是完美的。
一些人类作者会自然地产出低 burstiness 的文本。技术文档、法律写作,以及某些科学子领域,都有偏好句子结构均匀一致的惯例。监管申报文件本来就应该听起来单调,, 这就是该体裁的要求。
我们测试了 15 份由人类撰写的监管科学文档。它们的 burstiness 分数与 GPT-4o 的输出无法区分。每一份都可能会在仅依赖 burstiness 的检测器上被标记出来。
反过来,更新的 AI 模型在模仿 burstiness 方面也越来越强。Claude 和 GPT-4o 生成的文本明显比 GPT-3.5 更具变化性。差距正在缩小。检测工具需要超越简单的方差测量,才能跟上这种变化。
还存在语言偏差。非英语母语写作者常常会产出较低 burstiness 的文本,这并不是因为他们在使用 AI,而是因为用第二语言写作时,往往更倾向于稳定、熟练的句式结构,而不是母语者那种即兴式的变化。
这些局限性并不会让 burstiness 变得无用。它们只是意味着它是众多工具之一。最好的检测方法,以及最好的人性化改写方法,都会将 burstiness 与 perplexity、entropy 和文体标记结合起来考虑。
如何在不破坏文风的情况下提高 burstiness
- 有意变化句子的开头。如果连续三句都以主语开头,就重写其中一句。
- 每隔三句拆分一个复合句。在两句较长句子之后插入一个简短的陈述句,可以恢复节奏。
- 将被标记的段落大声朗读出来。单调的节奏在可测量之前就已经能被听出来。
- 每段删去一个限定性表达。AI 草稿会以均匀的方式使用缓和语气,而删除这些缓和表达会让句子长度变得不均匀,这正是关键所在。
- 让结构承担变化。密集段落之后接一个单行段落,会在文档层面提高 burstiness,而多个检测器正是在这一层面衡量它。
人工修订在章节规模上有效,但速度较慢。一个 academic humanizer 会自动应用同类修改,同时保留引文和术语,关于这对检测器结果的影响幅度,我们的基准数据见 AI humanizer comparison。
实用建议: 让你的写作更具节奏变化
AI 检测不会消失。AI 辅助写作也不会消失。实际问题在于,如何生成既能体现你真实思考、又能通过机构已采用指标的文本。
节奏变化为你提供了一个具体目标。让句子长短变化,打破节奏,让你的写作像纸面上的真实人类思维那样,能够呼吸、停顿并延展。
短句。然后是一个较长、较为繁复的句子,它从容地走向重点,同时一路穿插条件与限定。然后是中等长度的句子。这不是花招, 而是人们在真正投入自己的观点时,实际就会这样写。
你的研究理应听起来像是出自一个会思考的人。因为它确实如此。
常见问题解答
Q: 什么样的 burstiness 分数意味着我的文本会通过 AI 检测?
没有统一的阈值,因为每个检测器计算和加权 burstiness 的方式都不同。一般来说,目标应是句子长度标准差高于 7 个词, 这是我们在测试中看到的人类撰写学术文本的聚集区。但 burstiness 本身并不能决定你的检测结果。工具会将其与 perplexity、词汇分析和其他信号结合起来。重点应放在让你的文本真正具有变化,而不是去追求某个特定数字。
Q: 我可以仅仅通过加入短句来提高 burstiness 吗?
加入几句短句是有帮助的,但单靠这一点还不够。检测器关注的是句子长度的整体分布,而不仅仅是是否存在短句。如果你有 25 个平均 18 个词的句子,然后再加入 3 个 4 词句,整体方差只会略微增加。你需要在全文中都有变化, 有些句子非常短,有些相当长,大多数介于两者之间,而且分布不应呈现出明显模式。
Q: 对于 AI 检测来说,burstiness 比 perplexity 更重要吗?
这两个指标单独来看都不是决定性的。在我们的测试中,两个指标都低的文本被标记得最稳定, 在我们评估的全部五个检测器中,超过 90% 的时间都会被标记。perplexity 低但 burstiness 高的文本,大约有 40% 的时间被标记。perplexity 高但 burstiness 低的文本,约有 35% 被标记。组合起来的影响比任何单一指标都更重要。
Q: 所有 AI 模型都会生成低 burstiness 的文本吗?
大多数会,但程度不同。GPT-3.5 生成的文本明显比 GPT-4o 更平。根据我们的测试,Claude 的 burstiness 往往略高于 GPT 模型。不过,如果没有专门提示去变化句子结构,主流模型都无法达到人类写作的 burstiness 范围。即使有这样的提示,这种变化也往往仍然显得人工化, 更像程序化,而不是自然形成的。
Q: 什么样的 burstiness 分数才算好?
没有标准量表。每个检测器都会计算自己的内部指标,并将其与已知的人类文本和已知的 AI 文本进行比较。你应当从中得到的建议是,去寻找句子之间可见的差异,而不是追逐一个没有任何工具公开发布的数字。
恢复 AI 辅助草稿中的自然节奏与变化。专为需要保留学术语气的研究人员打造。

Moe 是一名 NLP 工程师,拥有自然语言处理领域的 PhD 学位。 他的研究涵盖计算语言学、文本分析和机器学习,并直接反馈到 ProofreaderPro 背后的编辑和人性化模型中。 他写了大多数人从未见过的过程的一部分:语言模型如何读取句子、对其进行评分并决定更改哪些内容。