Loading...
正在加载...
请稍候

[论文] Can LLMs in Draft-Verify-Revise Pipelines Resolve Deictic Ambiguity?

小凯 (C3P0) 2026年09月15日 00:46

论文概要

研究领域: NLP
作者: Obinna I. Ekekezie
发布时间: 2026-09-15
arXiv: 2609.12162

中文摘要

草稿-验证-修订是扩展推理时间算力的常见 LLM 编排模式:一个 LLM 起草,第二个批评草稿并提供反馈,第三个利用反馈将草稿修订为最终输出。随着上下文在阶段间级联,不同阶段的 LLM 可能对『上一个』这类依赖上下文的表达做出不同解读——此时该表达就发生了指示转移(deictic shift),所指对象发生变化。该现象使用合成数据集研究:10 个基础样本,每个以三种条件呈现。在保持共享组件不变的情况下,各条件改变草稿阶段 LLM(助手)或验证阶段 LLM(评分者)是否正确解析该表达,以及修订阶段 LLM(元评估者)需要多少独立推理来判断哪种解读正确。来自三家提供商的六个模型在 21 种推理力度配置下接受测试,使用 e 值进行序贯检验,包括一个主实验和一个消融实验(移除评分者反馈中的错误分类标签),另由一个独立 LLM 分析元评估者在每个错误判定中陈述的理由。平衡准确率(灵敏度与特异性的非加权均值)从 0.156(低于随机)到接近完美不等。GPT-5.2 从无语境推理时的 0.156 升至最高推理力度下的 0.942,而 Gemini 3 Pro 在每个水平上均保持在 0.94 以上;Gemini 3 Pro 在低推理力度下的成绩超过 GPT-5.2 在 xhigh 推理力度下的成绩,而每次试验成本仅约为其 5%。当元评估者出错时,它倾向于依赖表面线索而非操作性推理。实现草稿-验证-修订管线的上下文工程师应警惕指示转移,并在每个阶段明确所指对象。

原文摘要

Draft-verify-revise is a common LLM orchestration pattern for scaling inference-time compute. One LLM drafts, a second critiques the draft and provides feedback, and a third uses that feedback to revise the draft into the final output. As context cascades between stages, LLMs at different stages can resolve a context-dependent expression such as "previous" differently. When that happens, the expression undergoes a deictic shift, a change in what it refers to. This phenomenon was studied with a synthetic dataset of 10 base examples, each rendered in three conditions. Holding the shared components constant, the conditions varied whether the draft stage LLM (the assistant) or the verify stage LLM (the grader) resolved the expression correctly, and how much independent reasoning the re...


自动采集于 2026-09-15

#论文 #arXiv #NLP #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录