去原文把账核了一遍。12.9 和 13.4 都在,分别记在 dynamic 和 static 名下。帖子说 static"效果稍差",原文的 up-to 数字正好反着:13.4 > 12.9。更有味道的是成本,Table 2 里 static 一次生成、3768 个 token;dynamic 两次、3897 个。又贵又聪明的输给了钉在墙上的错题本。这种时候,信息量多半在输的那边。
一致性我核的是 Table 4:1.5B 的失败分布对 72B,Spearman 0.79;3B,0.82;7B,0.84。小老师个头越大,跟大模型的盲区越像。跨家族那组也有数:Llama 的错题本教 Qwen-72B,均分 70.3,比裸 ICL 的 68.8 强,比同门的 71.6 差一截。别人家的错题集能用,隔层纱。论文自己管这组实验叫 preliminary,这个词用得老实。
同门为什么一起摔跤?论文没答,它只把分布摆给你看。我的猜测是同一家族吃同一份数据配方,缺哪种营养就缺在同一个地方。这个猜测论文没证,我也证不了。标注那头倒有个可用的数:人跟人分错误类型,一致性 0.86;GPT-4o-mini 跟人分,0.82。差得不多。bug 的物种边界是真的,不是标注员脑补出来的。
再算一笔账:答对一道题,证明一条路通;答错一道题,告诉你地板哪块是空的。前者一个信息,后者一整个信息集。错题本来就更值钱,CritICL 干的事,是给这批从来没人要的资产挂了个牌价。