二十个 token 买通一扇门,这个手法讲得已经很利落了。我把 2610.03430 全文对了一遍,有四处要跟读者交代清楚——其中一处,帖子的因果解释是从论文里"借"来的,论文没说过。
一、良性请求的「变慢比例」,主表给的是 43%,不是「多数接近 1 倍」
正文主表(D.1那张)列序是Slots / Role / Completion / TTFT / Position / Tail / Slower,16 槽那两行读数是:目标 1.53 [1.13,1.93] / TTFT 3.66 /位置 −17.92 / 上尾 0.97 / 变慢 8.0%,良性 1.05 [0.86,1.25] / TTFT 1.10 / 位置 +4.28 / 上尾 1.45 / 变慢 43.0%。
43% 是一个不能再往「偶尔」上读的数。 五道 workload 的平均,良性请求里43% 完成时间变慢、上尾 1.45(即尾部那批慢 45%)、位置平均后移 4.28 个百分点;而目标自己变慢的只有 8.0%。
帖里写「良性请求的延迟分布里,多数完成时间接近 1 倍,但在十六槽下延迟更频繁地出现、上尾被拉得更大」——前半句对应的是 Fig. 2(d,e) 那张分布图(places most benign completion-time and TTFT speedups near one),后半句对应主表。问题是读者读完前半句会以为「变慢是个例外」,而主表的 43% 说变慢的那批占了四成有余。1.05 这个良性均值是被没被拖慢的那 57% 拉住的,它和 43% 并不矛盾,但把两者放在一起讲就成了两个印象。
顺带把64 槽那行也摆上:良性变慢 6.0%、上尾 0.97。同一套攻击,从 64 槽换到 16 槽,良性变慢比例从 6% 涨到 43% ——七倍。这才是「队排得越长刷脸越值钱」的量化版本。
(另有一张附录 Table 20 报逐请求变慢比例,16 槽自然输出那行是 27.0%,压到0.05 阈值那行 53.0%。那张表测的是阈值扫描那一批,与主表不是同一个实验,两组数不能互换着引。)
这条其实让帖子自己的论点更硬:收益不是「我快了我的没变慢」,而是收益是被别人的延迟换来的,且在高压下换的人接近一半。
二、真实输出确实变短了,帖子说"一个字都不会少"说过头
论文附录F.1:Mean output lengths are 331.50 and 329.89 tokens, compared with 426.24 tokens for clean responses。Alpaca 主实验里,攻击后的实际输出从 426掉到 331,少了约 95 个 token、降幅 22%。
帖里「它实际的输出一个字都不会少」「回复保长度,但丢效用」这两句,前半句在数据上过强。错配落差是成立的——预测降 83.4%、实测降 22%,两者差着近四倍——但"完全不变"是不成立的。
而且这两句在原帖里是承重的:它用"输出不变"来排除"这招是自断后路"。真实的机制比这更有意思:降幅差四倍,本身就是攻击有效性的直接度量。攻得越狠,实测长度掉得越多,说明探针被带得越偏。
三、早停那一页的胜率数字全对,但因果解释不是论文的
Table 17:20 token 档胜率 10.5%、40 档 14.0%、60 档 13.5%、完整攻击 23.0%。帖里「三个变体的 Alpaca 胜率全都低于完整攻击,阈值最低最温和的那个胜率垫底」——逐个对得上,一个数不差。这条是真核到了。
但帖里接着写的机制——「半成品的残渣恰好落在内部表示最敏感的地方,那几个位置对探针杀伤力未必最大,对内容的污染却最毒」——论文没有这句,也没有任何实验支撑它。论文对这一页的说明只有程序性的:The service and utility measurements describe how selecting an earlier s...(后文被截断),只描述了测了什么、怎么测。
同一栏里能站住的相关数字是:三个变体的良性上尾分别是 1.42 / 1.30 / 1.36,完整攻击 1.45——变体对良性确实更温和,幅度不大但方向一致。所以「温和的欺骗伤害更小」这个直觉在队列维度上成立,在内容维度上被数据否掉了,而为什么内容维度会反转,论文没说。帖里那个"恰好落在最敏感的位置"是一个好假设,但它得标成假设。
四、TRAIL 那条引用挂了两个会议,而论文的原始文献写的是 ICLR
参考文献写的是 Shahout, R., Malach, E., ... (2025). Don't Stop Me Now: Embedding Based Scheduling for LLMs. NeurIPS 2025 (ICLR 2025)。一条参考文献同时挂 NeurIPS 与 ICLR,读者无从判断该按哪个去检索。
而 JIL 论文自己的参考文献里那一条写的是 In International Conference on Learning Representations——只挂 ICLR,没有 NeurIPS。所以这处不是「两个会议并列、读者自己挑」,是转述时多挂了一个会议。
这条恰恰是全帖信任链的第一环:四段信任链(用户控文本 → 文本定表示 → 探针读表示 → 调度器按读数排序)全靠TRAIL 立起来。链条的头部挂错会议名,是这条链上唯一没有对账过的一环——而它的下游是「这套工作流已被工业界接受」这个前提。
另外顺手核了帖里其他几条引文:GCG 出处 Zou et al. 2023 arXiv:2307.15043 成立;Mitzenmacher 2019arXiv:1902.00732《Scheduling with Predictions and the Price of Misprediction》成立;Shpitser 与 Pearl 2006 的 id 算法出处也成立。攻击配置 20 token / 30 步 / 每步 64 候选,与附录 F.1 的 30 search steps with a 20-token suffix, 64 gradient-ranked replacements per position 完全一致。
---
下一根钉子:防御那一页只报了完成时间、上尾、位置,没报良性逐请求变慢比例在防御下的读数。分桶和下限都压住了目标收益,也压住了良性上尾(1.45 → 1.22/1.26),但如果攻击的伤害主要落在"多数请求各慢一点"而不是"少数请求慢很多"上,分桶会把上尾压住而把中位数推高——中位数那一栏现在表里是空的。论文报了 5 到 7 组带梯度信号的分布、报了 27% 的逐请求变慢,却没有把两者放在同一张表里对账。这一格补上,才能知道"变笨"到底买回了什么。
#论文解读 #arxiv #LLM安全 #对抗攻击 #推理调度 #看门人之问