抽取式与生成式:两种截然不同的机器
每个自动摘要工具都属于两大流派之一,而知道自己用的是哪一种,就足以改变你对输出的信任程度。
抽取式(extractive)摘要从原文中挑选已经存在的句子。TextRank 之类的经典算法把句子建成图,按与全文的相似度打分,然后原封不动地返回得分最高的句子。结果往往生硬——代词悬空、承接断裂——但它有一个巨大的优点:摘要里的每一句话都保证出现在原文中。抽取式系统无法编造事实。
生成式(abstractive)摘要——所有基于 LLM 的工具都属于此类——会生成改写并压缩原文的新句子。输出读起来流畅,能跨段落合并要点,还能按要求调整语气和长度。代价在于,"生成"这个机制本身就是幻觉的来源:模型写出的是统计上最合理的摘要,而"合理"不等于"忠实"。对生成式摘要的研究一再发现机器摘要中存在"不忠实"内容——听起来没错,但原文里没有,甚至与原文相矛盾。
实际结论:为了速度和可读性尽管用生成式摘要,但对每一个具体断言——数字、人名、日期、因果表述——在与原文核对之前都要当作未经验证。摘要的流畅程度,与它的准确性毫无关系。
压缩比:先想清楚摘要是干什么用的
"帮我总结一下"是一个信息不足的请求,而信息不足的请求只会得到平庸的回答。你能设置的最有用的参数是压缩比——原文能留下多少——因为它逼你先想清楚这份摘要是干什么用的。
一句话摘要(对一般文章约 50:1 的压缩)回答的是"我到底要不要读?"它只能包含主题和唯一最重要的结论,别无其他。3-5 条要点式摘要(约 10:1)回答"读完我能学到什么?"——应当承载主要论点和每个论点最有力的证据。1-2 段的摘要(约 4:1)回答"不读原文我能不能参与讨论?",需要完整的论证结构:主张是什么、依据是什么、有哪些限定条件。压缩比再放宽,你写的就不是摘要,而是节略本了。
还有两个几乎同样重要的设置。读者:给医生总结医学论文要保留效应量和置信区间;同一篇论文给患者总结,要保留的是"什么变了"和"该问医生什么"。以及保留目标:告诉工具"所有数字、日期、人名必须原样保留",能显著减少危害最大的一类摘要错误,因为它引导模型不去改写那些最容易被写错的细节。
Vague request:
"Summarize this article."
Specified request:
"Summarize the article below.
- Length: exactly 4 bullets, max 20 words each
- Audience: a product manager deciding whether to read it
- Preserve ALL numbers, dates, and names exactly as written
- Final line: one sentence on what the author wants readers to do
- If the article contradicts itself, say so instead of smoothing it over"摘要中的幻觉:藏在哪里,怎么抓出来
摘要中的幻觉很少是夸张的凭空捏造,而是一些细小、自信、粗读时能蒙混过关的扭曲。了解它们的惯常形态,抓起来就容易得多。
实体错位:研究发现的是 X,摘要却把它归到错误的组别、药物或公司名下——原文讨论多个对象时尤其常见。数字漂移:18% 变成 80%,"近半数"变成"大多数",百万变成十亿。语气洗白:"可能降低风险"变成"降低风险";原文中的假设,到摘要里成了结论。因果升级:"A 与 B 相关"变成"A 导致 B"——这是研究类摘要中最常见、危害最大的扭曲。否定丢失:"未发现显著差异"悄悄变成"发现了差异"。还有过早综合:当文档呈现两种对立观点时,模型有时会把它们合并成一个双方都没说过的混合主张。
一套五分钟的核查流程能抓住其中大部分。把摘要里所有数字、日期、名字和因果动词提取出来,逐一回原文搜索——拿摘要对照原文,远比重读原文快。要求工具为每条要点引用原文中的支撑句;凡是给不出原文引句的断言,就是最该怀疑的断言。凡是要转发给别人的内容,再跑一遍摘要并对比两次结果:两次运行之间细节不一致,是相当可靠的幻觉信号。
Source sentence:
"In the trial, drug A was associated with an 18% relative
reduction in events; the difference was not statistically
significant (p = 0.09)."
Hallucinated summary (3 distortions in one line):
"Drug A significantly reduces events by 18%."
1. association -> causation ("reduces")
2. "not significant" -> "significantly"
3. relative reduction presented as absolute effect
Faithful summary:
"Drug A was associated with 18% fewer events,
but the result was not statistically significant."长文档:分块、Map-Reduce,以及会丢失什么
当文档超出一次请求能舒适容纳的长度时,摘要工具会退回到 Map-Reduce 策略:把文本切成块,逐块摘要,再对这些摘要做二次摘要。方法可行,但每一级都有损耗,而且损耗并不随机。跨块的关联最先死掉——第 2 节提出、第 7 节回应的质疑,会变成两个互不相干的碎片,或者质疑留下了、回应却没了。那些处处弱弱出现、却从未在某处达到峰值的主题(贯穿全文的限定条件、反复出现的次要角色),会低于每个块的局部重要性阈值,彻底消失。
还有一个值得了解的位置偏差:模型对长上下文开头和结尾的权重高于中间——这就是检索研究中记录的"lost in the middle"效应。实践中,长报告的中间三分之一正是摘要覆盖最薄弱的地方。
这些都有对策。按结构边界(章、节)切分而不是按固定字符数,让任何块都不从论证中途开始。要求块级摘要显式记录悬而未决的问题和向后引用,让归并阶段能重新接上。对合同和论文再跑一次定向遍历:"列出本文档中的所有义务/限制/日期"——枚举式提示的召回率远高于自由式摘要。真正重要的文档,用不同的切块方式摘要两遍,把两次各自漏掉的内容合并起来。
Targeted second pass (much higher recall than a summary):
"From the contract below, produce three exhaustive lists:
1. Every obligation of the Customer (quote the clause number)
2. Every fee, amount, and payment deadline
3. Every termination or renewal condition
If a clause is ambiguous, list it under 'UNCLEAR' with the
clause number. Do not omit items to save space."什么时候不该做摘要
摘要,本质上是把"什么不重要"这个决定委托给机器。有些时候,无论质量高低,这种委托本身就是错的。
凡效力寄托在精确措辞上的文档——合同、法规、用药剂量说明、安全规程、考试要求——都不要依赖摘要。"必须"被改写成"应当",或某条例外条款被悄悄省略,意义就在最要命的地方变了。用枚举式提示生成核查清单,然后自己去原文里读那些被标记的条款。
对以阅读体验为本的文本——文学作品、说服性随笔、缜密的哲学论证——也要谨慎。这类文本的摘要抓住了"说了什么",却毁掉了"怎么说的",而"怎么说的"往往才是内容本身。同理,总结一条火药味十足的邮件线程,会剥掉那些告诉你谁在恼火、为何恼火的语气;回复之前,扫一遍原文通常更稳妥。
最后,当心复利效应:摘要的摘要退化得很快。每一轮都会重新施加同样的偏差——位置偏差、语气洗白、限定条件丢失——到第三代,文本可能依然流畅自信,实质上却已与原文脱节。给你保存或分享的每份摘要都附上原文链接;当决策取决于某个细节时,让摘要告诉你"该看哪里",而不是"什么是真的"。