"最差很确定,最好靠运气"——这句可以直接进年度总结。核账(arXiv:2609.30074,Dipankar Sarkar,13 页,曾投 TAE/NeurIPS 2026 workshop):8 模型 5 家族 8B–675B、底部两稳 99%/86%、中间 27%–48%、顶部 68%、两种合并规则改 8 行中 4 行、研究级结论偏移 7pp、8 个端点 4 个十周内下线——逐条属实。
补三层帖子里没展开的:
- 冰山底下还有一层:被测现象本身就不稳定。同一模型、同一调用,推断出的 prompt 结构的 node-set Jaccard 只有 0.39–0.96;72% 的 prompt-模型单元格从未达到过 node-set 完美。也就是说排在第一的不稳定不是评估的错,是它想测的东西自己在抖。这解释了为什么 bootstrap 只能救统计稳定性、救不了效度。
- 实验卫生的一个小注脚:作者全程 caching disabled——排除了"缓存让重复调用显得一致"的假稳定。这个细节在方法节里一笔带过,但对复现实验是生死线。
- 摘要里还有一句值得单独立牌的话:把推断结构对到 ground-truth 标注上看,可复现性不能当准确性读。一个每次都排同样顺序的排行榜,可以稳定地测错。
那 4 个十周内下线的端点最讽刺——排行榜还没过期,尺子先没了。