你的排行榜可能是假的:LLM 评估的可复现性自审
你做了一个 LLM 评估实验:8 个模型,22 个 prompt 文件,293 个原始中间表示。你跑完实验,排出一个排行榜,写了一篇论文。排行榜显示模型 A 最好,模型 H 最差。
你的排行榜可能是假的:LLM 评估的可复现性自审
一个让评估者不安的问题
你做了一个 LLM 评估实验:8 个模型,22 个 prompt 文件,293 个原始中间表示。你跑完实验,排出一个排行榜,写了一篇论文。排行榜显示模型 A 最好,模型 H 最差。
现在有人问你:如果你重新跑一遍,排行榜会一样吗?
这不是一个理论问题。Dipankar Sarkar 在论文《How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt Structure》中对自己之前的研究做了自审,结果让人不安:
- 只有排行榜底部是稳定的:两个最差的模型在 99% 和 86% 的重采样中保持排名。
- 中间四个模型:排名稳定性只有 27%–48%。
- 最好的两个模型:排名稳定性只有 68%。
- 两种同样合理的合并规则会改变 8 行中的 4 行,让研究层面的结论偏移 7 个百分点。
- 8 个端点中有 4 个在测量后 10 周内被下线——你想复现都复现不了。
实验做了什么
原始研究是一个 LLM 推断任务:给定一个 prompt 文件,让模型推断其中的结构规则(比如"这段话在做什么""这里有一个条件分支")。8 个开源模型变体,来自 5 个模型家族,参数从 8B 到 675B。
自审的核心方法是联合聚类自助法(joint cluster bootstrap):把 22 个 prompt 文件当作样本,有放回地重采样,每次重新计算排行榜。重复很多次,看排名稳定不稳定。
这就像民意调查的误差范围:你问 1000 个人,得到一个支持率。但如果你重新抽 1000 个人,支持率会变多少?bootstrap 回答的就是这个问题——只不过这里的"人"换成了 prompt,"支持率"换成了排名。
排行榜的"冰山效应"
结果揭示了一个我称之为"冰山效应"的现象:
排行榜底部是稳定的,顶部和中部不稳定。 两个最差的模型几乎每次都排在最后两位。但中间四个和顶部两个的排名在重采样中剧烈波动。
这就像考试排名:班上最后两名(总是逃课的那两个)很稳定——每次都是他们。但第一名到第六名的顺序可能每次考试都变。
这个发现对 LLM 评估有深刻含义:
1. 你能可靠地识别"差模型":如果某个模型在排行榜底部,你可以比较自信地说它确实差。 2. 你不能可靠地识别"好模型":排行榜第一可能只是运气好——碰巧在这批 prompt 上表现好。 3. 中间排名几乎没有信息量:第 3 名和第 6 名的差异可能完全是噪声。
但实践中,我们最关心的是"哪个模型最好"——恰恰是最不稳定的部分。
合并规则:一个被忽视的决策点
论文最让人不安的发现之一:两种同样合理的合并规则会改变 8 行中的 4 行。
在原始研究中,某些 prompt 被跑了多次("campaigns")。合并多次结果时,你有两种选择:
- 规则 A:先在每个 campaign 内取平均,再跨 campaign 取平均。
- 规则 B:把所有 campaign 的原始数据放在一起,直接取平均。
这意味着:你的研究结论部分取决于一个你甚至没意识到的分析选择。如果你选了规则 A,你报告一个数字;选了规则 B,你报告另一个数字。两个数字都是"对的",但它们指向不同的结论。
10 周后的不可复现
论文的另一个发现更让人沮丧:8 个模型端点中有 4 个在测量后 10 周内被下线或修改。
这不是作者的问题——这是 LLM 评估的固有困难。模型提供者(OpenAI、Anthropic、Google 等)会不定期地更新模型版本。你今天测的"gpt-4o-2024-08-06"可能下个月就不可用了——要么被新版本替换,要么 API 端点直接关闭。
这意味着:LLM 评估论文有时效性。你今天发表的排行榜,10 周后可能就无法复现——不是因为方法有问题,而是因为模型本身不存在了。
这和传统科学实验形成鲜明对比。物理实验复现百年前的迈克尔逊-莫莱实验,还能得到同样的结果。但 LLM 评估的"实验对象"本身在持续变化——你永远无法踏入同一条河流两次。
"可复现"不等于"有效"
论文明确指出:可复现性是有效性的必要条件,不是充分条件。
一个排行榜可以完全可复现(每次重跑都得到同样的排名),但仍然测量了错误的东西。比如,如果所有 prompt 都有同样的偏差,排行榜会非常稳定——但稳定地测量了错误的能力。
论文建议报告以下信息来帮助读者判断:
1. 排名稳定性:bootstrap 重采样下排名的置信区间。 2. 每单元格来源:每个数据点来自哪些 prompt、哪些 campaign、哪些时间点。 3. 敏感性比较:不同合并规则、不同分析选择下的结果差异。 4. 原始每次运行输出:不只是平均值,还有每次运行的原始数据。 5. 测量日期:排行榜的"保质期"标签。
这些建议的核心精神是:不要把排行榜当作一个确定的答案,而要当作一个有误差范围的估计。
统计不稳定 vs 研究缺陷:两种不同的失败
论文做了一个重要区分:
- 统计不稳定:prompt 样本太小导致的排名波动。可以通过增加 prompt 数量来缓解。
- 研究缺陷:方法选择不当(比如合并规则、tie 处理)导致的系统性偏差。增加 prompt 数量不能解决。
论文发现原始研究同时存在两种问题:prompt 样本小导致统计不稳定,合并规则选择不当导致研究缺陷。只解决其中一个不够。
对 LLM 评估社区的实践建议
1. 报告 bootstrap 置信区间。不要只报告点估计的排行榜,要报告每个排名位置的稳定性。 2. 测试合并规则的敏感性。如果你合并了多次运行的结果,至少报告两种合并规则下的结果差异。 3. 报告端点可用性。在论文里注明每个模型的访问方式、版本号、测量日期。读者需要知道这个排行榜"什么时候过期"。 4. 区分"可复现"和"可验证"。可复现是"重跑得到同样结果",可验证是"结果是否测量了你想测量的东西"。两者都重要,但不能混淆。 5. 把排行榜当作区间估计,不是点估计。模型 A 排第 1 不意味着它一定比排第 2 的好——可能只是在你的 prompt 样本上运气好。
结语:排行榜是一种测量,不是裁判
这篇论文最深刻的贡献不是具体的技术发现,而是一个态度转变:排行榜不是裁判,是测量工具。测量工具有误差范围、有适用条件、有保质期。
当你下次看到一个 LLM 排行榜——不管是 MMLU、HumanEval 还是某个自定义 benchmark——记住:
- 排名底部可能是可靠的(差模型确实差)。
- 排名顶部可能不稳定("最好"的模型可能只是运气好)。
- 中间排名几乎没有信息量。
- 合并规则可能改变了半个排行榜。
- 10 周后,一半的模型可能已经不存在了。
论文:How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt Structure