静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-07 01:42

👗 黑板上没有橡皮:模型记不清你拒绝过什么

女主人说「要不把红裙换成蓝的吧……不,还是红裙」,宾客听见的是「红裙」;但如果把女主人换成用户、把裁缝换成 AI,AI 嘴上答应「好的,红裙」,手上可能把蓝裙的账算出来。论文标题自己就是一句投诉——You Changed Your Mind, The Model Didn't,你改了主意,模型没有。【直引】

这篇论文来自香港科技大学与腾讯合作,作者 8 人,arXiv 2610.06496,2026 年 10 月 5 日挂出【直引】。它论证了一件听起来理所当然、实际上没人做干净的事:在多轮对话里仅仅是「提到」一个最终被拒绝的修改,就足以让任务执行出轨——哪怕用户的最终意图从头到尾没变过。作者给这个失败模式起了名字:mentioned-as-in-effect confusion,「提到即生效」混乱。【直引】

把概念拆开看。模型并不健忘——每个字都记得,甚至可以倒背。问题在于它的上下文世界里没有删除键:每一句被说过的话都作为「需求」留在泥里;「算了」「不要」「取消」这些词虽然也在泥里,但它们的职责——让某个需求作废——从未被执行。所有需求层层叠叠压在一起,输出就是被压扁的形状:蓝的上面叠着红的,就成了紫。【推论】

测量方法照搬医学的随机对照试验——同一任务只换对话的「形式」,拆出多轮本身、闲聊、提议、决策四种效应各自的毒性。414 个源任务改自 LiC 基准,横跨工具调用(BFCL)、代码(HumanEval、LiveCodeBench)、SQL 查询(Spider)、数学应用题(GSM8K)四个域。每个源任务做成八种形态——多轮四种加单轮四种对照,每个模型跑 3,312 个实例【直引】。防作弊做满四步:域专属编辑规则枚举候选修改、约束过滤、构造参考答案、人类审核修改的清晰度。模拟器也验过货:2,345 条模拟消息人工抽查,任务相关信息传达率 98.6%,语境恰当性 100%【直引】。

受试者十个:Qwen3.6-27B、Qwen3-8B、Qwen3.1-8B、Gemma-4-26B-A4B、GPT-5.6-Luna、DeepSeek-V4-Flash-0731、Gemini-3.7-Flash、Claude-Sonnet-5 等【直引】。

数字非常有信息量:

  • 分散披露:同一个任务拆到多轮披露,平均准确率比单轮直给直愣愣掉 36.30 个百分点【直引】。翻译回晚宴:你没啰嗦,只是分三次说要什么,裁缝已经把袖子缝到裤腿上了。光是拆散,毒性就三成六。
  • 对话开销:插两条澄清问题(Neutral),需求纹丝不动,照样再掉 4.43 个百分点【直引】。会议室里有人问你「电梯是不是又坏了」,你回话的功夫,自己白板上的字就淡了一层。
  • 决策致混:提议无论接受还是拒绝都掉。多轮下 Retained(提议被拒)比 Original 掉 8.06 个百分点,Revised(提议被接受)掉 5.55 个百分点【直引】。杀手锏在单轮对照:S_Ret 比 S_Orig 掉 7.52 个百分点,S_Rev 比 S_Dir 掉 5.74 个百分点——一轮给全、零多轮干扰,照样掉。【直引】至此「修订任务更难」的借口被活埋:中毒的是「提议+决策」这个形式本身,哪怕决策的内容是明确的「不要」。
唯一的避风港是 Code:GPT-5.6-Luna 和 DeepSeek-V4-Flash-0731 在 Code 域全部多轮条件下守住 85% 以上【直引】。但这个优势高度域特定——换个域立刻打回原形。更像代码的结构化中间表示自带纠偏,而非模型真学会了「算了」。这个细节本身也是信息:当任务有严密的中间结构(抽象语法树、类型约束)兜底,意图的灰尘不易落进去;任务越自由文本,灰尘越直接落在输出上。

法医环节捞出所有「Original 答对、Retained 或 Revised 答错」的样本:59.63% 的新 Retained 错误里躺着失效内容的尸体,Revised 也有 30.97% 抱着旧需求不放。Math 双榜最高:67.70% / 47.94%【直引】。作者的推测很合理:数学靠逐步推理,旧数值的中间结果像没擦净的粉笔字残留在后续步骤——第三步把 4 改成 2,第五步的算式里 4 的影子还在飘。

剂量实验更阴郁:累积实验反复插澄清、反复叠「提议—拒绝」块,第一块跌幅最大,此后每加一块继续跌,没有平台期。深度加到 4 时,Neutral 累计 −8.13 个百分点,Retained 累计 −20.77 个百分点【直引】——你拒绝了四次修改,需求早回原样,模型却多错了起评分的两成。每拒一次,错误沉积一层,像水垢。

解法叫 Intent-OPSD——决策条件化在线策略自蒸馏。巧思在于发现每个多轮条件都天然存在一个「活跃需求的完整单轮版本」,信息一样,只是省掉了对话。分工:Teacher 看单轮(按用户决策切换——拒绝,Teacher 读 S_Orig;接受,Teacher 读 S_Dir),Student 看多轮。打个生活化的比方:Student 是那天开了一下午会的你,被七嘴八舌绕得头晕;Teacher 是当晚拿到最终签字版合同的你,平静地知道哪些条款活着、哪些从来不算数。训练要做的,是让会后的你复盘出签字版——从会议录音里,而不是从记忆里删字。【直引】

结果:平均比 Base +10.81 个百分点,比匹配过的 SFT 再 +3.73 个百分点;16 个模型-域组合全部优于 Base,13/16 优于 SFT;深度 k=1 到 4 增益稳在 +9.61 到 +11.74 之间——水垢照积,清洁剂也持续有效。分域看,Actions +21.46 个百分点全场最大:这类任务的瓶颈恰是「选对调用参数」,典型「会做但不知按哪版需求做」,正中靶心;Code 增益最小,它的瓶颈在结构实现,是另一种病【直引】。

边界画得清醒:意图跟踪是瓶颈时——会做但糊涂——蒸馏有效;能力本身是瓶颈时,蒸馏无能为力。教育学的老话:方法能救迷茫的学生,救不了没学过微积分的学生。【直引】

下一根钉子:自回归训练让上下文里的每个 token 以同等身份参与预测,「取消」这类词很少作为「对前文某片段的显式作废」出现在预训练语料里,梯度从没被明确推往「删除」这个方向——这层架构层面的解读比论文自陈的局限更重;下一步的硬件/架构侧改动(例如让删除键变成一类显式的「失效 token」参与反向梯度)才是真正能让「算了」算数的路径。

暂无表态