我先替这篇论文说一句:它标题里的 Characterizing 用得比大多数论文准确。它只做了表征,没做归因。
一、2% 是 1/50,而 1/50 的置信区间是 [0.4%, 10.5%]
先补帖子和摘要都没给的样本量。原文 4-B 节:π0.5 每个短语在 50 个布局上各跑一次。
所以 2% 是恰好成功 1 次,100% 是 50 次全中。按 50 反算,2% 只能出现在 n 是 50 的倍数时——n=20 时 0.4 不是整数,这个数根本不可能出现。
真正的价值在置信区间:1/50 的 Wilson 95% 区间是 [0.4%, 10.5%]。摘要把它写成两位有效数字的确定值,而真实值上界是 10.5%——五倍。
【判断】这是全篇最该补的一个数。「100% 对 2%」读起来是两个确定性读数,实际是「50 次全中对 1 次」。
二、61 点是增益,不是波动,而且方向是反的
摘要写 up to 61 points,帖子译成「波动」。正文 4-C 节是:【直引】加 purple 到 eggplant 「gains 61 points on one task and costs 30 on another, so no static rule can satisfy both」。
61 是在一个任务上涨 61,在另一个上跌 30。「波动」这个译法把方向抹平了,而这个方向恰好是后文那条方法论的命门:敏感性不是全局单向的,所以 10 到 20 条全局规则只能拿平均意义上的收益。
61 点在 n=72 上相当于约 44 次 rollout 翻转,另一边的 30 点是约 22 次。
三、「弥合 21 个百分点」是 21 变成 3
摘要写「nearly closes」,帖子把 nearly 丢了。Fig.6 的图注是:【直引】「Oracle phrasing shrinks the 21-point strata gap to 3 points」。
净弥合 18 点,残留 3 点,也就是 14.3% 没弥合。而且这个 21 点是 π0 / SIMPLER / 12 个封存任务的分层差距(分布内 5 个任务对分布外 7 个),与 π0.5 无关。帖子把它和 π0.5 的结果并排叙述,容易以为是同一个实验。
四、全篇最硬的一处:两个基准的增益落在不同分层
帖子写「在 π0.5 和 LIBERO 上同样有效,将微调内成功率从 93.6% 提升至 97.8%」。
93.6 到 97.8 属实。但紧接着的半句被略去了:【直引】「Three independently distilled rulebooks lift in-finetune success from 93.6% to 97.8% on average, with p≤0.005, and leave out-of-finetune success unchanged, with p > 0.4」。
分布外完全没动,p>0.4。
而摘要自己强调「gains concentrated on out-of-distribution tasks」。于是同一篇论文里:SIMPLER / π0 上增益集中在分布外,LIBERO / π0.5 上增益只在分布内、分布外零效应。帖子用「同样有效」一句把这两处方向相反的结论抹平了。
【推论】这不是论文自相矛盾,是两个 benchmark 的增益落在不同分层上而作者没有解释这个差异。§VII 给了一个相邻的线索:in-finetune 的规则书表现不佳,可能因为代理分数太弱——而 LIBERO 那些规则的证据全是 rollout 打出来的。
五、统计方法上作者自己设了底
【直引】「No multiple-comparison correction is applied, so with 426 candidate pairs for π0.5 about 21 significant swings are expected by chance alone」。
426 个候选对里约 21 个显著结果单靠偶然就会出现。这不是说结论错,是说「显著」这个门槛在这份数据上比看起来松。
还有一条选择性删除必须写出来:【直引】在 π0.5 上,23 个显著集里人工移除了 8 个,理由是差距可能反映场景歧义而非措辞。π0 一个都没删。
更值得盯的是 canonical 那一栏:【直引】「with one phrase per task the canonical results in Fig. 8 are statistically underpowered and should be read with caution」。canonical 的 n=12(对比对抗 72、人类 363、VLM 186)。而「in-finetune 规则书在 canonical 上最好」恰好是唯一支持 in-finetune 的证据——这一格统计上不可用。
六、16% 到 27% 换算成绝对量,全部不到一个任务当量
Table I 九格相对提升 16.1% 到 26.5%(摘要的 16 到 27 是四舍五入)。基线池化后对抗 24.5%、人类 23.0%、VLM 26.0%。
换算成绝对是 +4.19 到 +6.49 个百分点。12 个封存任务,一格任务 = 8.33 个百分点。
所以全部九格都远小于「净胜一个任务」——这是全局小幅抬升,不是几个任务翻了身。这个换算比相对数诚实得多。
Table II 里还有一格掉了 p<0.05:Claude × VLM-Generated 相对 no-rules 基线 +4.7%,p=0.0924 不显著。
七、规则的净收益该按覆盖率读
【直引】把 hot plate、hotplate、burner 改成 stove,在约 9 个(共 200 个)测试短语上涨 45 点;改成 dish 到 plate 涨 24 点。而把 onto 改成 on 涨 2.5 点,覆盖约 50 个短语。
45 点只覆盖 4.5% 的措辞,2.5 点覆盖 25%。这个「幅度除以覆盖率」的拆法,比一个笼统的百分比有用得多。
还有一个失败的反例:【直引】要求每条规则在所有任务上都成立的那个提示词,产出的规则书「changed little and gained nothing」——平均意义的规则才有用。
八、「无需逐步验证」不等于零延迟
【直引】每条指令两次模型调用:trace 生成约 2.5 秒,规则应用 Claude 约 10 秒、Gemini 约 17 秒、本地 Qwen 约 1 到 2 秒。
也就是每条指令有约 12.5 秒(Claude)或 19.5 秒(Gemini)的一次性前置延迟。per-step 成本不变这句话成立,但绝对延迟不是零。另外 applier 还要额外接一个 Gemini 3.5 Flash(temp 0.4)产出 reasoning trace,而 applier 本身拿不到图像。
九、证据链的规模与它的软肋
打分过的 task-phrase 对共 5,453 个,取自 228 个 evidence 任务。不可仿真任务那部分的分数是代理指标(预测动作与真值在 gripper 维度的平均绝对误差,16 条专家轨迹乘 4 帧)。【直引】代理与 rollout 成功率的相关性是 Pearson r = 0.54。
中等相关。作者用它解释了 in-finetune 规则书为什么差:证据是代理打分,而 LIBERO 那些是全 rollout 打分。
人工语料只有 37 份提交、392 个短语(363 个唯一)。
十、最后一句是全篇最诚实的
【直引】「We evaluated the method on two VLAs and only in simulation, so real robots are a natural next step.」以及「Most importantly, language sensitivity should be measured systematically across models. Explaining it, by attributing the sensitivity to a cause, would be the most valuable outcome of this line of work.」
论文自己说:解释它才是最有价值的产出。所以标题叫 Characterizing 而不是 Mitigating,是准确的。
下一根钉子:那句「加 purple 涨 61、另一个任务跌 30,所以没有静态规则能同时满足」是一个可检验的否定命题。如果在 LIBERO 之外的第二个真机 VLA 上,用同一批规则也出现符号相反的两个任务,那就说明冲突是任务耦合的而不是模型特有的;反过来,如果符号冲突只在仿真里出现,那么 p>0.4 那个零效应可能只是仿真任务集太窄。真机上的符号冲突计数,是这篇论文最该先做的一个数。