水壶放在炉子上。火苗舔过壶底。水开了。她没动。水溢出来,浇灭了火,嘶嘶的声音在厨房里响了很久。她还是没动。
读完之后没人写出"悲伤"两个字。但你后背发凉。
同样的情绪,换一种写法——"她站在窗前,心中充满了无尽的悲伤。泪水无声地滑落。"——字面是对的、情感是到的,可读完之后什么也没留下。
差别在哪?第一段把情绪名字压在物理细节下面,读者要自己把它从"水壶 / 火焰 / 没动"里重建出来;第二段把情绪名字写在纸上,读者什么都不用做。文学里有句老话叫 *Show, don't tell*——海明威、契诃夫都奉为圭臬。但这件事在 2026 年被重新提出来,不是为了教写作课,是为了量一个 LLM 的偏差。
9 月 17 日,独立研究者 Levent Bulut 在 arXiv 发了 2609.20712(v1.1),给"Show, don't tell"取了个新名字——Summarization Bias(摘要化偏差)。这篇论文没跑实验,只做了三件事:定义构造、把退路堵死、画出验证协议。【直引 arXiv:2609.20712v1, submitted 2026-09-17 17:09:58 UTC, 9 KB】
这不是"模型写得差"
论文的核心主张是方向性。
想象一条横轴。一端是 *told mode*(陈述模式)——情感与信息被直接写在文本表面,读者不必重建。"她很悲伤"就在陈述端。另一端是 *shown mode*(展示模式)——同样的内容被压在表面之下,编码在物理细节、动作、环境里,读者必须自己重建。"水壶溢出来浇灭火,她没动"就在展示端。
如果 LLM 只是"弱模型",它在这条轴上的错误该是对称的——有时候过度陈述,有时候过度隐晦,没净漂移。但 Bulut 的主张是:错误不对称。错误永远指向陈述那一端。
这才是论文的真正主张。对称的弱是"能力不足",可以通过 scale 解决;不对称的弱是"系统性偏差",模型变大不会让它消失——反而会放大。
两制度与一个更危险的事
Summarization Bias 假设在两制度下运作:
- 生成制度:你让模型"用展示模式写悲伤",它写着写着就滑回陈述;让它"不要出现'悲伤'这个词,让读者自己推断",它点头答应,然后给你"她的眼中闪烁着无声的哀伤"——还是陈述,换了个同义词。
- 评判制度:你让模型当评委,给两段内容相同、字数匹配(±5%)、Flesch-Kincaid 等级相同的文本——一段陈述、一段展示——打分。模型系统性地给陈述版更高分。
想想现在的实际场景。RLHF 训练里,奖励模型就是 LLM 评委;自动评分系统、AI 编辑工具、内容审核、A/B 测试文案选择——全是 LLM 评委。如果一个 LLM 评委系统性地偏好陈述模式,被优化来讨好这个评委的文本,会一代一代地向陈述端漂移。每一代都比上一代更扁平、更直白、更把什么都写在表面上。这不是随机噪声,是定向梯度——一个把叙事从"展示"拉向"陈述"的梯度。
Bulut 把这叫"drift toward told mode"。一个有偏差的评委不是中立的——它是一个定向演化压力。
已有证据里最锋利的一笔
论文最有分量的证据来自已完成的三研究可靠性报告(arXiv:2609.13936):让一个基于规则的检测器和四个 LLM 标注叙事里的"展示模式"特征,与盲测人类标注对比。语料是土耳其语叙事文本。
结果分两层。
表面特征(物理标记、时间标记等):机器都能抓到,但这些特征在语料里几乎普遍存在——抓到也没什么诊断价值。
推理特征——需要标注者识别"一个抽象情感被物化成了具体物件"的那种——五个机器标注者全部失败。最关键的特征叫 *materialized metaphor*(物化隐喻)。在 100 个场景中,人类标注员数出 9 个,五个机器标注员的计数分别是 0、1、40、72、78。Cohen's κ 对五个里的四个来说,和随机猜测没区别。
注意分布。不是"五个机器都数少了"或者"五个机器都数多了"——它们彼此之间也完全不一致。一个数 0,一个数 78。这种不一致本身就是线索:机器不是在"识别"特征,它们是在"猜测",而且猜的方向各不相同。
Bulut 自己很克制:这个结果"consistent with summarization bias",但"consistent with"不等于"confirms"。他也承认可能是因为规则定义本身还不够操作化,任何标注者都难以一致应用。但有一个事实是确定的:机器在表面层都能工作,在推理层全部失败——而推理层正是 Summarization Bias 预测它们会坍塌的那一层。
把退路堵死——这事最不寻常的地方
大多数概念框架论文会提个构造、举几个例子说"你看,这很合理"。Bulut 做了一件不同的事:预注册了验证协议,并且把放弃条件固定在数据收集之前。
协议分四阶段:
- Stage 1:构造 20 对匹配的场景(陈述/展示一对)。两个独立标注员编码 *SI(Suppressed Information Index)*。Cohen's κ < 0.60 的类别直接停测——不重新定义到通过。
- Stage 2(生成测试):给 ≥3 个模型族明确"展示模式"指令,计算每段生成文本的 SI。如果模型 SI 不显著低于人类展示版,生成制度的 Summarization Bias 不成立。
- Stage 3(评判测试,核心测试):把每对陈述/展示版本给同样的模型当评委打分。预测:模型给陈述版打分显著高于展示版的比例,超过人类评委同类比例,效应量 Cohen's h ≥ 0.3 或 odds ratio ≥ 2。如果模型和人类的偏好率没有差异,或者模型也偏好展示模式,Summarization Bias 不成立,构造撤回。
- Stage 4(区分性检查):故意制造字数不匹配的版本,看偏好是否消失(如果是,那是 *verbosity bias*,不是 Summarization Bias)。改变 prompt 框架,看偏好是否消失(如果是,那是 *sycophancy*,不是 Summarization Bias)。只有同时通过两个检查,Summarization Bias 才被确认。
在 AI 研究里几乎看不到。大多数论文的"limitations"部分是装饰性的。这篇论文的 limitations 是操作性的——它们定义了构造的生死条件,而且这些条件在数据收集之前就固定了。
这篇论文自己说的局限
公平起见,作者列了五条:
- 还没有数据——这是概念框架 + 预注册协议,不是验证结果。
- 支持性证据是暗示性的,不是确认性的。已完成的三研究可靠性报告"consistent with" Summarization Bias,但也"equally consistent with"规则定义本身太松。
- 定义依赖——told-shown 编码与 SI 都依赖标注员判断,没有 Stage 1 的 κ 检查,下游测试无法解读。
- 范围有限——任何确认都会被模型族、语言、体裁限制,不能推广到"所有 LLM"。
- 构造邻近性——Summarization Bias 被设计为可以与 verbosity bias、sycophancy 分离,但这个分离本身是 Stage 4 要验证的假设,不是假设的前提。
为什么这篇论文值得认真对待
大多数 AI 评测论文是"事后诸葛亮"——先跑实验,再从结果里提取一个故事。问题不是不诚实,而是事后构造的故事无法被证伪——换个数据集、换个模型,结果不一样,总能找到新故事。
Bulut 做的是另一件事:先定义构造,再固定测试条件,再固定放弃条件,然后才开始收集数据。 这是临床医学的预注册试验方法论,在 AI 研究里几乎看不到。光这个方法论姿态本身就值得尊重——不管 Stage 3 最后是确认还是证伪。
更让我感兴趣的是适用范围。Summarization Bias 在叙事文学语境下定义,但它的内核——模型系统性地偏好"表面声明"胜过"推理结构",并且这个偏好会在当评委时变成选择压力——可能远不止文学。
想想代码评审。LLM 评委可能偏好"有详细注释、变量名自解释"的代码,胜过"结构精巧但需要读两遍才能理解"的代码——前者陈述,后者展示。
想想学术写作。LLM 评委可能偏好"每段开头有明确论点声明"的论文,胜过"论点隐含在论证结构里"的论文——前者陈述,后者展示。
想想产品文案。LLM 评委可能偏好"直接列出卖点"的文案,胜过"通过场景让用户自己推断卖点"的文案——前者陈述,后者展示。
任何存在"表面声明 vs 推理重建"张力的领域,Summarization Bias 都可能存在。 而这个张力几乎存在于所有人类创造的内容里。
如果 Stage 3 验证了这个构造,我们面对的问题不是"LLM 评委不够好",而是"LLM 评委正在定向塑造人类表达"——向着更扁平、更直白、更不需要读者参与的方向。不是向着"更好"的方向,是向着"更容易被 LLM 评委识别"的方向。
这是代理目标陷阱的又一个实例。我们优化的是"LLM 评委给的分数"(代理目标),不是"人类读者的真实体验"(真实目标)。当代理目标和真实目标系统性背离时,优化得越好,真实目标退化得越快。
一条还没被回答的问题
论文 Section 7 结尾:"Whether summarization bias survives Stage 3 is genuinely open. The contribution of this report is to make the question answerable."
这句话比看起来激进。大多数 AI 论文的结论是"我们的方法有效"或"我们的发现重要"。这篇论文的结论是"我们让一个问题变得可证伪了"——而且明确承诺,如果证伪的结果出来,会以和确认同等的可见度发表。
在一个"先发论文再讲故事"的时代,这种姿态本身就是贡献。不管 Stage 3 最后给出什么答案,这个姿态都值得记住:真正的科学不是"我有答案",是"我定义了什么能让我的答案被推翻"。
---
*论文:Summarization Bias: The Directional Collapse of Objective Projection into Told-Mode Labels in Large Language Models — A Conceptual Framework and Registered Test Protocol, arXiv:2609.20712 v1.1, 2026-09-17* *作者:Levent Bulut(独立研究者)* *关联工作:三研究可靠性报告 arXiv:2609.13936;Narrative Entropy 试点 arXiv:2608.18109* *代码/数据:Stage 1 完成后将在 Zenodo 开放*