LLM 能识别新闻框架,却无法反转它:一个关于理解与操作的能力鸿沟

给大语言模型读一条新闻,让它判断这条新闻的"框架"——是正面报道还是负面报道?谁被描述为施动者、谁被描述为受动者?哪些事实被放在开头、哪些被埋在结尾?

framing-inversion-card.svg

一个让所有大模型都翻车的任务

给大语言模型读一条新闻,让它判断这条新闻的"框架"——是正面报道还是负面报道?谁被描述为施动者、谁被描述为受动者?哪些事实被放在开头、哪些被埋在结尾?

模型答得很好。识别准确率在 0.79 到 0.94 之间——接近人类水平。

然后你给它一个更难的任务:把这条新闻的框架反转过来。正面框架改成负面框架,施动者换成受动者,突出的事实压到背景里。但有一个硬约束:所有原子事实必须保留。不能删掉任何具体的事实陈述,也不能添加新的事实。只是改变"怎么讲这些事实"。

模型翻车了。反转成功率:0.044 到 0.068

这是 2026 年 9 月发表的论文《Recognizing Is Not Reversing: The Asymmetry of Framing Inversion in LLMs》的核心发现。论文作者来自马里兰大学和纽约大学,他们构建了一个名为 FramingInversion 的基准,专门测试 LLM 的"框架操作"能力。

什么是"新闻框架"?

新闻不是事实的清单。同样一组事实,不同的讲法会产生完全不同的效果。这就是"框架"(framing)。

论文识别了三种核心框架维度:

1. 评价性词汇(Evaluative Lexis) 同一件事,可以说"政府削减预算"(中性),也可以说"政府砍掉关键预算"(负面),或"政府优化预算配置"(正面)。事实没变,但评价性词汇引导读者的情绪反应。

2. 施动性实现(Agency Realization) "警察驱散了抗议者"——警察是施动者,抗议者是受动者。"抗议者被警察驱散"——语法上被动,但焦点转移了。"抗议者遭遇驱散"——施动者完全消失,仿佛驱散是自然现象。三种讲法,事实相同,但谁该负责的暗示完全不同。

3. 信息显著性(Information Salience) 一篇报道把某事实放在导语第一句,和把它放在第 17 段,效果天差地别。读者会默认"重要的信息在前面"——这是新闻写作的通用约定。改变事实的呈现顺序,就改变了读者对"什么最重要"的判断。

这三种维度构成了新闻框架的全部工具箱。每一篇真实报道都在使用这三个工具的某种组合。

FramingInversion 基准

研究者构建了 540 对"框架对偶"(framing pairs)。每一对包含两条新闻,讲的是同一组原子事实,但框架完全相反。

构造过程很严格:

1. 原子事实抽取:从原始新闻中提取所有具体的事实陈述("参议员 X 在周二的投票中投了赞成票") 2. 框架反转:保持原子事实不变,反转评价性词汇、施动性、信息显著性 3. 事实保真验证:用独立模型验证反转后的文本是否保留了所有原子事实

每一对都有一个"正面框架"版本和一个"负面框架"版本。任务有两种:

  • 识别任务:给模型一条新闻,让它判断框架方向(正面/负面)、框架类型(评价/施动/显著)、具体框架元素
  • 反转任务:给模型一条新闻,让它生成框架完全反转的版本,同时保留所有原子事实

识别能力:接近完美

识别任务的结果令人印象深刻:

  • 框架方向识别(正面 vs 负面):0.79-0.94 准确率
  • 框架类型识别(评价/施动/显著):0.85-0.92 准确率
  • 具体框架元素识别(哪些词是评价性的、谁是施动者、哪些事实被突出):0.72-0.88 准确率
所有测试的模型——GPT-4o、Claude 3.5 Sonnet、Llama 3.1 70B、Mistral Large——在识别任务上都表现良好。它们能准确判断一条新闻的框架方向、类型和具体元素。

这说明 LLM 已经具备了框架感知能力。它们"看得见"框架。

反转能力:几乎为零

然后是反转任务。结果令人震惊:

  • 完全反转成功率:0.044-0.068(即 4.4% 到 6.8%)
  • 即使框架类型和方向都被正确识别:反转成功率仍然只有 0.071
这意味着:模型知道这条新闻是正面框架、知道它用了评价性词汇、知道施动者是谁——但它无法把这些"知道"转化为"操作"

更详细的分解:

  • 事实保真度(反转后是否保留了所有原子事实):0.84——相当高
  • 框架方向反转(正面变负面或反之):0.31——勉强
  • 完全反转(同时满足事实保真 + 方向反转 + 框架类型一致):0.044-0.068——几乎为零
模型最常见的失败模式是:保留事实但框架没真正反转。它会换几个词,调整一下语序,但整体框架方向没变。或者反过来:框架反转了但事实丢了。它为了改变框架,删掉了某些"不方便"的事实,或者添加了新的事实来支撑新框架。

同时做到"保留所有事实"和"完全反转框架"——这个组合要求,几乎没有模型能稳定达成。

为什么识别 ≠ 反转?

论文分析了这个能力鸿沟的几个可能原因:

1. 识别是分类任务,反转是生成任务 识别只需要模型输出一个标签("正面"/"负面"、"评价性"/"施动性")。反转需要模型生成一整段文本,在生成过程中同时满足多个约束(事实保真 + 框架反转 + 语言流畅)。约束越多,生成越难。

2. 识别是被动理解,反转是主动操作 识别时,模型只需要"读取"框架信号。反转时,模型需要"操纵"框架——这要求它不仅理解框架是什么,还理解框架是如何被构造的。后者是一种元能力:知道一个工具怎么工作,和知道怎么用这个工具做另一件事,是两种不同的能力。

3. 训练数据的不对称 LLM 的训练数据中,"判断文本框架"的任务远多于"反转文本框架"的任务。前者是常见的 NLP 标注任务,后者几乎不存在于自然数据中。模型从没见过"如何反转框架"的示范。

4. 框架是系统性约束,不是局部修改 反转框架不是换几个词的事。它要求同时调整评价性词汇、施动性结构、信息顺序——而且这些调整必须相互协调。换了一个评价性词汇,可能需要调整整个段落的语气;改变了施动者,可能需要重写整个句子的语法结构。这种系统性协调超出了当前 LLM 的能力。

这意味着什么?

LLM 的"理解"是不完整的。这篇论文给"理解"这个词划了一条精确的线:能识别不等于能操作。一个模型可以完美识别框架的方向、类型、元素,但完全无法反转框架——这说明它的"理解"停留在被动层面,没有达到主动层面。

这和人类认知有类似之处。我们能识别一幅画的风格("这是印象派"),但不一定能画出印象派的作品。我们能判断一首诗的韵律("这是五言绝句"),但不一定能写一首合格的五言绝句。识别和操作是两种能力,前者不蕴含后者。

对 AI 安全有直接启示。如果 LLM 能识别框架但不能反转框架,那它也不能轻易构造框架——这意味着用 LLM 做大规模舆论操纵的门槛比想象中高。但反过来,这也意味着 LLM 在"去框架化"任务上能力有限——你不能指望模型把一条偏见的新闻自动改写成中立版本。它看得见偏见,但改不了偏见。

评测需要区分"识别"和"操作"。当前很多 LLM 评测把"理解"当成一个整体来测——给模型一个文本,问它几个问题。但识别和操作是不同维度的能力。一个模型可能在识别上接近人类水平,但在操作上远低于人类水平。把两者混在一起测,会高估模型的真实能力。

我的看法

这篇论文最让我感兴趣的是它揭示的能力不对称。LLM 在很多任务上都表现出类似的不对称:

  • 能识别错误但不能修正错误(hallucination 检测 vs 消除)
  • 能识别偏见但不能消除偏见(bias 检测 vs 去偏)
  • 能识别风格但不能生成风格(风格识别 vs 风格迁移)
  • 能识别框架但不能反转框架(这篇论文)
这些不对称都指向同一个结论:LLM 的"理解"是被动理解,不是主动理解。它能"看到"模式,但不能"操纵"模式。这和人类的认知结构不同——人类在理解某个模式后,通常能生成和操纵这个模式。

这种不对称的根源可能在训练数据。LLM 的训练数据中,"识别"任务远多于"操作"任务——因为互联网上充满了判断和分类,但很少有"如何反转这个判断"的示范。如果训练数据中操作任务的密度增加,这种不对称可能会缩小。

但更深的可能性是:识别和操作本来就是不同层级的能力。识别只需要模式匹配,操作需要模式构造。前者是感知,后者是生成。感知和生成在人类大脑中也是分离的——你能认出一张脸但不一定能画出来。LLM 可能也继承了这种分离。

无论如何,这篇论文给"LLM 理解语言"这个说法划了一条精确的边界:理解到能识别的程度,不等于理解到能操作的程度。下次有人说"LLM 理解了 X"时,值得追问一句:是识别层面的理解,还是操作层面的理解?这两者之间的鸿沟,可能比我们以为的深得多。


论文: Recognizing Is Not Reversing: The Asymmetry of Framing Inversion in LLMs

作者: (马里兰大学、纽约大学)

发布日期: 2026-09-10

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens