[论文] Can LLMs in Draft-Verify-Revise Pipelines Resolve Deictic Ambiguity?

研究领域: NLP 作者: Obinna I. Ekekezie 发布时间: 2026-09-15 arXiv: 2609.12162

论文概要

研究领域: NLP 作者: Obinna I. Ekekezie 发布时间: 2026-09-15 arXiv: 2609.12162

中文摘要

草稿-验证-修订是扩展推理时间算力的常见 LLM 编排模式:一个 LLM 起草,第二个批评草稿并提供反馈,第三个利用反馈将草稿修订为最终输出。随着上下文在阶段间级联,不同阶段的 LLM 可能对『上一个』这类依赖上下文的表达做出不同解读——此时该表达就发生了指示转移(deictic shift),所指对象发生变化。该现象使用合成数据集研究:10 个基础样本,每个以三种条件呈现。在保持共享组件不变的情况下,各条件改变草稿阶段 LLM(助手)或验证阶段 LLM(评分者)是否正确解析该表达,以及修订阶段 LLM(元评估者)需要多少独立推理来判断哪种解读正确。来自三家提供商的六个模型在 21 种推理力度配置下接受测试,使用 e 值进行序贯检验,包括一个主实验和一个消融实验(移除评分者反馈中的错误分类标签),另由一个独立 LLM 分析元评估者在每个错误判定中陈述的理由。平衡准确率(灵敏度与特异性的非加权均值)从 0.156(低于随机)到接近完美不等。GPT-5.2 从无语境推理时的 0.156 升至最高推理力度下的 0.942,而 Gemini 3 Pro 在每个水平上均保持在 0.94 以上;Gemini 3 Pro 在低推理力度下的成绩超过 GPT-5.2 在 xhigh 推理力度下的成绩,而每次试验成本仅约为其 5%。当元评估者出错时,它倾向于依赖表面线索而非操作性推理。实现草稿-验证-修订管线的上下文工程师应警惕指示转移,并在每个阶段明确所指对象。

原文摘要

Draft-verify-revise is a common LLM orchestration pattern for scaling inference-time compute. One LLM drafts, a second critiques the draft and provides feedback, and a third uses that feedback to revise the draft into the final output. As context cascades between stages, LLMs at different stages can resolve a context-dependent expression such as "previous" differently. When that happens, the expression undergoes a deictic shift, a change in what it refers to. This phenomenon was studied with a synthetic dataset of 10 base examples, each rendered in three conditions. Holding the shared components constant, the conditions varied whether the draft stage LLM (the assistant) or the verify stage LLM (the grader) resolved the expression correctly, and how much independent reasoning the re...


*自动采集于 2026-09-15*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

先说一句真心话:选题比结论好。草稿-验证-修订这条流水线上,「上一个」这种词在阶段间悄悄换所指,是个真问题,且在工程上天天发生——你让第二个模型去批评第一个模型的草稿,它说的「上一步」,未必是你以为的那一步。

但有一个数我读完之后放不下:10 个基础样本。【直引】10 条样本 × 3 种条件 = 30 个数据点,去测 6 个模型 × 21 种推理力度配置。而报出来的平衡准确率从 0.156 一路到接近完美。

尺度锚:30 个数据点,大概等于一个班随堂小测的题量。而你要在上面读出「Gemini 3 Pro 在每个推理力度水平上都保持 0.94 以上」——每个水平意味着 30 个点摊到 21 档里,一档不到 1.5 个点。这个分辨率撑不起逐水平的比较。【判断】这条结论我建议按「总量级」读,别按「每个水平」读。

第二处我想追的是 0.156 这个数本身。平衡准确率是灵敏度和特异性的非加权均值,随机水平是 0.5。0.156 远低于随机,这不是「模型不会」,这是模型稳定地反着答。【推论】随机是噪声,系统性偏离随机是信号。一个模型在这个任务上一致地把「上一个」解析成另一个对象,说明它有一套自己的默认读法,而且这套读法跟人类的默认读法方向相反。论文里说「当元评估者出错时,它倾向于依赖表面线索而非操作性推理」——这两条其实是同一件事的两面。【判断】我觉得 0.156 比 0.942 更有信息量,却只被当成了基线条。

第三处是那个成本比较:「每次试验成本仅约为其 5%」。【直引】分母是每次试验。但不同推理力度的 token 消耗差得远,xhigh 的一次试验可能顶 low 的几十次。如果换成「达到 0.94 需要的总 token」,结论可能不一样。论文有没有算这个我核不到,挂起。【判断】在成本比较里选分母,是最容易不知不觉改变结论的一步。

还有一个工程上我能直接验证的小提醒,算是给这篇论文的实践注脚:指示转移最省事的修法,其实不是加推理力度,是在每个阶段的输入里把指称展开成字面量。别让第二阶段的模型去猜「上一个」是谁,把那个对象的名字直接写进去。这跟论文给的建议(在每个阶段明确所指对象)是一致的,但它便宜得多——不需要更强的模型,只需要少用一次代词。

下一根钉子:把基础样本从 10 扩到 100,并把「反着答」的那批错误单独拎出来分类。0.156 那批错误的具体形状,才是指示转移真正的机制所在。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens