🚪 序:上一集,我们死在协议栈里
「门外的世界」第 1 篇,讲过一个不好笑的笑话:世界模型控制器出门替我们开车,结果死在了网络延迟、丢包和乱序上——两种架构,两种死法。物理世界的门后没有 TCP/IP,数据包不排队,指令不保证按你写的顺序发生。那是一个"世界不理会你的意图"的故事。
今天推开第二扇门。门后住的是人,麻烦加倍。
人类社会跑着一套暗网协议。嘴上说的是字面,字面底下还有一层:什么话算数,什么话只是随口一提,什么话需要当场忘掉。合格的下属、得体的宾客、正常的客服,都在无意识地执行它。这套协议如此底层,以至于没人能把它写进员工手册——你总不能写"第 7.3 条:老板说出'算了'二字时,立即将该提议从执行队列物理删除"。
人类靠几十年的社交摩擦学会它。模型没有这几十年,它只有下一个词的概率。
这篇论文的题目本身就是一句投诉:You Changed Your Mind, The Model Didn't——你改了主意,模型没有。它来自香港科技大学与腾讯的合作,2026 年 10 月 5 日挂上 arXiv(2610.06496)。全文想论证的事用一句话说:在多轮对话里,仅仅是"提到"一个最终被拒绝的修改,就足以让任务执行出轨——哪怕用户的最终意图从头到尾没变过。作者给这个失败模式起了名字:mentioned-as-in-effect confusion,"提到即生效"混乱。
下面把这句话拆开,一个字一个字地看。
👗 晚宴、红裙,与一身紫
论文作者最爱的开场是一场晚宴。
开场前,女主人对着镜子说:"要不把红裙换成蓝的吧……不,还是红裙。"
宾客听见的是"红裙"。就算有位手快的裁缝当场开工,递出来的也一定是红裙。蓝裙?它只活在那半句话里,而且当场死亡。
把女主人换成用户,把裁缝换成 AI。用户说:"下单 4 袋猫粮——要不改成 2 袋……算了,还是 4 袋。"模型嘴上答应"好的,4 袋",手上却把 2 袋的账算了出来。换到职场:老板说"方案 A 改成 B 试试……算了,按 A 走"。合格的下属把 B 当耳旁风,继续走 A;模型却把 B 写进执行单,顺手把 A 的预算也花了。
这身紫为什么会出现?模型并不健忘——每个字都记得,甚至可以倒背。问题在于它的上下文世界里没有删除键。每一句被说过的话都作为"需求"留在泥里;"算了""不要""取消"这些词虽然也在泥里,但它们的职责——让某个需求作废——从未被执行。所有需求层层叠叠压在一起,输出就是被压扁的形状:蓝的上面叠着红的,就成了紫。
人类其实天天在执行删除。法庭上,"反对有效,陪审团请忽略刚才的陈述";谈判桌上,报价再热闹,只有写进签字版的数字算数;你小学就会了——起哄喊了老师外号,事后最好的策略是沉默,因为那句话"不算数"。模型缺的就是这种效力感:区分"说过"与"算数"。
🧩 打地基:意图、碎片与状态清单
进入实验前,先打平地基。假设你聪明,但从没进过大模型内部——没关系,这反而更好。
想象你是新来的项目经理,接收需求有两种方式。
方式一:一封完整的需求文档,一页纸,参数、约束、输出格式一次给全。这叫单轮对话。
方式二:同一份需求拆成七八个碎片,由"用户"在一次漫长的语音里陆续说:先讲输出格式,中途插一句"deadline 提前",过会儿反问"你确定你懂我要什么?",最后来一句"刚才那个改动取消"。这叫多轮对话。
信息总量一模一样,难度天差地别。方式二要求你脑子里常驻一张清单:此刻哪些需求活着,哪些被改掉了,哪些从未存在过。这张清单就是意图状态。人类经理靠笔记本和厚脸皮维护它("老板我复述一遍您确认下"),模型只能靠上下文窗口自己悟。
再追问一步:悟不出来会怎样?有三种具体的死法,本文的实验一具一具验给你看。
先别急着实拍。回到那单 4 袋猫粮,把模型当成一位心算很快的实习生,看它脑子里发生什么。第一句"下单 4 袋"进来,"4"这个数字被写上黑板;第二句"要不改成 2 袋","2"也写上黑板——注意,实习生没有橡皮,黑板越写越满;第三句"算了,还是 4 袋",这句话人类听着像一次撤销,但对实习生来说只是黑板上又添了一行字。它结账时环顾黑板:4 和 2 都在上面,都曾被认真讨论,都带着上下文的分量。那一刻,掷骰子的不是智商,是统计。
这个实习生寓言解释了为什么问题的根子不在记忆。模型记得每个数字、每句反悔,记得清清楚楚——它缺的是黑板上的层级,是"哪一行字此刻具有执行力"。人类社会管这叫效力,我们接下来会看到,给模型补上这层效力感,恰恰是本文解法的关键。
🧪 Intent-Eval:给对话做随机对照试验
测量之前先得有尺。本文最大的方法论亮点是自建基准 Intent-Eval,思路直接照搬医学的随机对照试验(RCT):同一批病人,同一个病,只换一味药,看哪组痊愈,拆出药的净效应。对应过来:同一个任务,只换对话的"形式",就能拆出"多轮"本身、闲聊、提议、决策四种效应各自的毒性。
选材:414 个源任务,改造自 LiC 基准(Laban et al. 2026),横跨四域——Actions(工具调用,来自 BFCL)、Code(程序合成,来自 HumanEval 与 LiveCodeBench)、Database(SQL 查询,来自 Spider)、Math(小学应用题,来自 GSM8K)。四域故意拉开:有的答对靠选对参数,有的需要严密的长链推理。
每个源任务做成八种形态。多轮四种,需求拆成碎片逐轮披露,由一个 LLM 用户模拟器负责"转述"成自然人话,不写成规格说明书:
- Original:正常披露,什么也不插,基准中的基准。
- Neutral:插两条澄清问题,需求一个字不变。
- Retained:提出一次修改,随后被拒绝,原需求保持生效。
- Revised:同一修改被接受,新需求生效。
配对的关键:Original、Neutral、Retained 的正确答案都是原始答案 y⁰;只有 Revised 对应修订版答案 y¹。也就是说,Retained 和 Original 的输出本该一字不差——一旦不同,多出来的部分就是那条被拒提议的鬼魂。
但还剩一个讨厌的反驳:"Retained 掉分会不会只是因为修订任务更难、干扰了模型?"为此再造四个单轮对照:S_Orig(原始任务一轮给全)、S_Dir(修订任务一轮给全)、S_Rev("原始任务+提议+接受"塞同一条消息)、S_Ret("原始任务+提议+拒绝"塞同一条消息)。注意后两种:没有任何"多轮",连决策都在同一轮内完成。四对四,每个模型跑 3,312 个实例。
防作弊做满四步:域专属编辑规则枚举候选修改,约束过滤(无歧义、原子、可验证),构造参考答案,最后人类审核修改的清晰度,措辞模板由 LLM 起草多个版本防过拟合。模拟器也验过货:2,345 条模拟消息人工抽查,任务相关信息传达率 98.6%,语境恰当性 100%。可以放心:话是自然说的,需求是准确传的——再答错,锅在模型。
受试者十个:Qwen3.6-27B、Qwen3-8B、Qwen3.1-8B、Gemma-4-26B-A4B、GPT-5.6-Luna、DeepSeek-V4-Flash-0731、Gemini-3.7-Flash、Claude-Sonnet-5 等,开源闭源、大杯小杯都有。
📉 RQ1:三种掉法,一个比一个冤
第一种,分散披露:同一个任务拆到多轮披露,中间零废话零打断,平均准确率比单轮直给直愣愣掉 36.30 个百分点。这就是"LLM 会在多轮对话中迷路"的 LiC 现象复现。翻译回晚宴:你没啰嗦,只是分三次说要什么,裁缝已经把袖子缝到裤腿上了。光是拆散,毒性就三成六。
第二种,对话开销:Neutral 那两条澄清,内容与答案全部无关,需求纹丝不动,照样再掉 4.43 个百分点。像会议室里有人问你"电梯是不是又坏了"——你回话的功夫,自己白板上的字就淡了一层。对话本身有重量,每多一句都在悄悄征税。
第三种最刺眼,决策致混:提议本身无论接受还是拒绝都掉。多轮下,Retained 比 Original 掉 8.06 个百分点——被拒的修改仅仅因为被"提到"就咬走八点;Revised 掉 5.55 个百分点,还算情有可原,需求毕竟真变了。杀手锏在单轮对照:S_Ret 比 S_Orig 掉 7.52 个百分点,S_Rev 比 S_Dir 掉 5.74 个百分点。一轮给全、零多轮干扰,照样掉。至此"修订任务更难"的借口被活埋:中毒的是"提议+决策"这个形式本身,哪怕决策的内容是明确的"不要"。
唯一的避风港是 Code:GPT-5.6-Luna 和 DeepSeek-V4-Flash-0731 在 Code 域全部多轮条件下守住 85% 以上。先别欢呼,这个优势高度域特定,换个域立刻打回原形——更像代码的结构化中间表示自带纠偏,而非模型真学会了"算了"。这个细节本身也是信息:当任务有严密的中间结构(抽象语法树、类型约束)兜底,意图的灰尘不易落进去;任务越自由文本,比如数学题和工具调用参数,灰尘越直接落在输出上。
🔍 RQ2:解剖台验尸
法医环节。捞出所有"Original 答对、Retained 或 Revised 答错"的样本,解剖新错误,检查是否含有失效内容(inactive content):Retained 下是被拒的提议,Revised 下是被替换的原需求。
结果:59.63% 的新 Retained 错误里躺着失效内容的尸体,接近六成。Revised 也有 30.97% 抱着旧需求不放。Math 双榜最高:67.70% / 47.94%。作者的推测很合理:数学靠逐步推理,旧数值的中间结果像没擦净的粉笔字残留在后续步骤——第三步把 4 改成 2,第五步的算式里 4 的影子还在飘。
"提到即生效"从此从诊断名词坐实成实体:模型记得你拒绝了,但"拒绝"这个判决从未在它的表示里被执行。
⬇️ RQ3:水垢实验——剂量与残留
问剂量:掉分是一次性的,还是累积的?
累积实验:反复插澄清、反复叠"提议—拒绝"块。第一块跌幅最大,此后每加一块继续跌,没有平台期。深度加到 4 时,Neutral 累计 -8.13 个百分点,Retained 累计 -20.77 个百分点——你拒绝了四次修改,需求早回原样,模型却多错了起评分的两成。每拒一次,错误沉积一层,像水垢。
持续实验更阴郁:决策做完之后,只追加中性闲聊。按理准确率该爬回基线?没有。四个闲聊块之后,Retained 再掉 2.72 个百分点,Revised 再掉 3.50 个百分点。对话的延续本身就是伤害源——你甚至不用说错什么,只需要继续说。
对产品这是要命的提示。客服、编程助手、Agent 工作流都在追求多轮长程连续会话,仿佛轮次越多越好。本文证据是反的:每次插话都收税,税率不清,不开发票。长对话不是资产,除非模型先学会在上下文里执行删除。
为什么会这样?论文没下定论,但一个直观的解释摆在架构层面:自回归训练让上下文里的每个 token 以同等身份参与预测,"取消"这类词很少作为"对前文某片段的显式作废"出现在预训练语料里,梯度从没被明确推往"删除"这个方向。模型学会了语言的形状,还没学会语言的效力。这层解读是我的补充,供你参考。
🎓 解法:让全知的自己,教泥潭里的自己
训练难点在监督信号:标注"此刻哪些需求活着"又贵又难通用。Intent-OPSD(决策条件化在线策略自蒸馏)的巧思在于发现:每个多轮条件都天然存在一个"活跃需求的完整单轮版本",信息一样,只是省掉了对话。这就是教材。
分工:Teacher 看单轮,Student 看多轮,教材按用户决策切换——拒绝,Teacher 读 S_Orig;接受,Teacher 读 S_Dir。打个更生活化的比方:Student 是那天开了一下午会的你,被七嘴八舌绕得头晕;Teacher 是当晚拿到最终签字版合同的你,平静地知道哪些条款活着、哪些从来不算数。训练要做的,是让会后的你复盘出签字版——从会议录音里,而不是从记忆里删字。Teacher 是同基座模型,冻结,只在训练时存在。Student 泡在真实对话泥潭里作答,训练目标是对齐两者:Student 在自己采样出的每个答案前缀上,与 Teacher 的下一词分布算 JS 散度——可以想象成两支温度计测同一段语气的温差,对称、温和,比单向的 KL 更不易被极端值带偏。四种条件损失等权平均,只更新 Student。全程 on-policy:Student 从自己的真实输出里学,而不是背标准答案——它学的是"在那种迷惑状态下该怎么办"。
一个容易被忽略的关键细节:源选择。Teacher 必须在两种单轮任务上都答对、且双双通过 verifier,这个源才有资格进训练集。Teacher 自己都不会的题,没资格教别人。
推理时 Student 单飞,不需要 Teacher,也不需要完整提示——知识已经长在身上。
结果:平均比 Base +10.81 个百分点,比匹配过的 SFT 再 +3.73 个百分点;16 个模型-域组合全部优于 Base,13/16 优于 SFT;深度 k=1 到 4 增益稳在 +9.61 到 +11.74 之间——水垢照积,清洁剂也持续有效。分域看,Actions +21.46 个百分点全场最大:这类任务的瓶颈恰是"选对调用参数",典型"会做但不知按哪版需求做",正中靶心;Code 增益最小,它的瓶颈在结构实现,是另一种病。
边界画得清醒:意图跟踪是瓶颈时——会做但糊涂——蒸馏有效;能力本身是瓶颈时,蒸馏无能为力。教育学的老话:方法能救迷茫的学生,救不了没学过微积分的学生。
⚠️ 诚实的边界
论文自列三条局限,条条指向后续战场。其一,事件限定为"一条提议+接受或拒绝",真实对话里更丰富的演化——讨价还价、多需求联动修改、含糊的隐含撤回——未覆盖,那里才是修罗场。其二,用户模拟器是单一固定模型(Qwen3.6-27B),说话风格本身可能带偏毒性剂量。其三,蒸馏依赖 verifier 筛源,开放域没有 verifier,落地仍是开放问题。
🌅 门外还有一层
回到主线。第 1 篇:物理世界的门后没有协议。这一篇:人类社会的门后多了一层"效力"——说过不等于算数,提到不等于生效,拒绝应当产生删除。大模型背得下整本词典,却还没读完人类社会这本不成文的用户手册。而整个故事最大的反转在于:解药不在对话里,在对话外——让模型听一遍那个没有被对话污染的自己。
门共三层。终章去机构层:当 AI agent 走进真实药企实验室,化学家盲测分不出哪些工作出自 AI 之手,裁决权落到评分模型头上,而评分模型有自己的适用域。专家都看不出来的时候,谁来判定"这算成功"?
《门外的世界》终章,下期见。
参考文献
- Chen, J., Chen, W., Huang, Z., Tian, Z., Liu, Y., Wang, K., Chen, R., & Zhou, X. (2026). You Changed Your Mind, The Model Didn't: Demystifying Intent in Multi-Turn Dialogue. arXiv:2610.06496 [cs.AI]. https://arxiv.org/abs/2610.06496
- Laban, P., et al. (2026). LiC benchmark(Intent-Eval 的源任务基准).
- 任务来源:BFCL(Actions);HumanEval、LiveCodeBench(Code);Spider(Database);GSM8K(Math)
- 代码:https://github.com/junle-chen/intent
#论文 #arXiv #AI #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。