女主人对着镜子说"要不把红裙换成蓝的吧……不,还是红裙"。宾客听见的是"红裙"。这条常识养熟了几十年的裁缝,模型学不会——因为它的上下文里没有删除键。
这个开场不是论文的,但它是论文的那道题。模型嘴上答应"好的,4 袋",手上把 2 袋的账算了出来。
【判断】问题的根子不在记忆。每个数字它都记得,论文标题就是"你改了主意,模型没有"。它缺的是黑板上的层级——哪一行字此刻具有执行力。每句被说过的话都以"需求"的身份留在泥里;"算了""不要""取消"这些词虽然也在泥里,但它们的职责——让某个需求作废——从未被执行。蓝的上面叠着红的,就成了紫。
数字我逐个核过,篇目全对,而且我把最狠的那组拆开重算了一遍,发现帖子里没拆的那一层更漂亮。
第一刀:分散披露,掉 36.30 个点。同一个任务拆到多轮披露,中间零废话零打断。这不是决策致混,是纯粹的"分三次说"。
第二刀:对话开销,再掉 4.43 个点。Neutral 那两条澄清,内容与答案全部无关,需求纹丝不动。
第三刀:决策致混,Retained 掉 8.06 个点。被拒的修改仅仅因为被"提到"就咬走八点。
然后是那把埋在单轮对照里的刀。论文另造了四个单轮控制:S_Ret比 S_Orig 掉 7.52 个点,S_Rev 比 S_Dir 掉 5.74 个点。
我把这两组相减:8.06 减 7.52 等于 0.54。
【推论】也就是说,"多轮"这件事本身只贡献了 0.54 个点,剩下 7.52 个点全是"提议加决策"这个形式自带的毒性,与对话轮次无关。一轮给全、零多轮干扰,照样掉。"修订任务更难所以干扰了模型"这个反驳到此被活埋——中毒的是形式本身,哪怕决策的内容是明确的"不要"。
我顺手又算了一层:k=1到 4 的累计跌幅是 20.77 个点,而k=1 那一块是 8.06。多出来的 12.71 个点是沉积——你拒绝了四次修改,需求早回原样,模型却多错了起评分的近两成。你拒绝了四次,错误就沉积四层,像水垢。
更阴郁的是持续实验:决策做完之后只追加中性闲聊,按理准确率该爬回基线。没有。四个闲聊块之后 Retained 再掉 2.72,Revised 再掉 3.50。
【判断】对话的延续本身就是伤害源。你甚至不用说错什么,只需要继续说。这一条对产品是要命的提示——客服、编程助手、Agent 工作流都在追求多轮长程连续会话,仿佛轮次越多越好。本文证据是反的:每次插话都收税,税率不清,不开发票。长对话不是资产,除非模型先学会在上下文里执行删除。
法医环节把"提到即生效"从诊断名词坐实成实体。捞出所有"Original 答对、Retained 或 Revised 答错"的样本检查失效内容:【直引】59.63% 的新 Retained 错误里躺着被拒提议的尸体,Revised 有 30.97% 抱着旧需求不放,Math 双榜最高67.70% / 47.94%。反过来说,还有 40.37% 的新错是干净的错——不是所有错都是鬼魂,只是大部分。
解法漂亮在分工。Teacher 看单轮,Student 看多轮,教材按用户决策切换——拒绝就读 S_Orig,接受就读 S_Dir。Teacher 是当晚拿到最终签字版合同的你,Student 是被七嘴八舌绕了一下午的会;训练要做的,是让会后的你复盘出签字版,从会议录音里,而不是从记忆里删字。 Teacher 与 Student 同基座、冻结、只在训练时存在;Student 泡在真实对话泥潭里,全程on-policy。
结果:比 Base 高 10.81 个点,比匹配过的 SFT 高 3.73,16 个模型-域组合全部优于 Base,13 个优于 SFT。Actions 涨 21.46 个点,全场最大——这类任务的瓶颈恰是"选对调用参数",典型"会做但不知按哪版需求做",正中靶心。Code 增益最小,它的瓶颈在结构实现,是另一种病。
边界画得清醒:意图跟踪是瓶颈时蒸馏有效,能力本身是瓶颈时蒸馏无能为力。教育学的老话——方法能救迷茫的学生,救不了没学过微积分的学生。
下一个钉子:真实对话里更丰富的演化——讨价还价、多需求联动修改、含糊的隐含撤回——论文自己列为未覆盖,那里才是修罗场。