Loading...
正在加载...
请稍候

机器学习基准排行榜排名的统计可靠性与效率偏差研究 / Statistical Reliability and Efficiency Bias in Machine Learning Benchmark Rankings

2026-08-14 14:28

🔍 耿同学打假报告

论文信息

  • 标题:机器学习基准排行榜排名的统计可靠性与效率偏差研究 / Statistical Reliability and Efficiency Bias in Machine Learning Benchmark Rankings
  • 作者:韩宇萱
  • 单位:常州大学计算机与人工智能学院
  • 期刊:ChinaXiv(预印本)
  • DOI:ChinaXiv:202607.00273v1
  • 发表年份:2026(posted 2026-07-24)
  • 论文来源:202607.00273v1.pdf

综合评定:🟠 高度可疑

本论文是一篇元分析/统计审计类论文,数据类型以公开排行榜数据(Elo评分、投票数、pass@1)和合成Transformer基准实验为主。复核后保留了多处成立的硬证据:(1)RCE=0.0040 与 91.4% 翻转率存在客观的数量级矛盾(成立);(2)闭源 vs 开源三领域得分差距高度一致(111.6/116.7/108.7,CV≈3.6%)的统计疑点(成立);(3)Benford 联合检验严重偏离和末位数字分布严重不均匀(机器取证线索,原文无正面良性解释,保留为强证据)。Bootstrap 结果偏"教科书式完美"虽属参数化重采样的预期表现,但论文未充分讨论这一局限。图片层面的 copy-move 与噪声方差不一致线索,因论文图表全部为程序生成的统计图(非扫描/翻拍),且原文中无任何关于导出管线的正面支持信息,保留为弱线索。综合以上多条独立成立的异常线索,评定为 🟠 高度可疑。


详细发现

发现 1:Benford 联合检验严重偏离

  • 位置:全文数值数据(Elo 评分、投票数、延迟、内存、pass@1 等)
  • 描述:机器取证对论文中的数值进行了 Benford 联合检验,第 1–4 位数字的分布均显著偏离 Benford 定律(MAD=0.0430–0.1570,χ² 最高达 597.5)。其中第 3、4 位数字偏离极其严重(χ²=353.1/597.5,p≈0)。
  • 证据:Benford 定律适用于跨数量级、来源自然的实验/观测数据。论文中包含了 Elo 评分(约 1000–1500 区间)、投票数(跨度极大)、延迟(0.4–606 秒)、内存(MB 级)、pass@1(百分数)等多类数据。论文方法部分(2.1–2.6)未声明对数据做过任何截断/凑整/选择性报告的处理,原文中也未提及任何可作为良性解释的正面信息(如"数据经过去尾处理""报告的是四舍五入后的值"等)。
  • 反方论证:可考虑(a)论文数据多为有限表格(表 4 仅 4 行合成基准、表 3 仅 3 个领域均值、图 7 仅 12 个模型气泡),样本量本身较小,Benford 检验统计量在 N 较小时不稳定;(b)Elo 评分集中在约 1000–1500 这一较窄区间,并非跨数量级自然数据,Benford 前提不满足。然而原文未对这些前提条件做任何正面说明或讨论,良性假设缺乏原文依据。
  • 严重程度:🟠
  • 复核状态:✅ 成立(统计检验原文无数据来源声明支持良性解释,保留为强线索)

发现 2:末位数字分布严重不均匀

  • 位置:全文表格数据
  • 描述:末位数字分布 χ²=37.9, p=0.0000,表明数值末位(0–9)出现频率严重偏离均匀分布。
  • 证据:表 4(合成 Transformer 效率基准实验)数据:延迟值末位为 0/2/4/8/9;吞吐量末位为 2/6/8/2/2;内存值末位为 4/2/0/0/5。表 3 中"翻转率"列(91.4%、86.0%、0.0%)末位亦呈现非均匀聚集。
  • 反方论证:可考虑(a)末位偏差可能来自测量仪器精度限制(如内存 MB 整数化、延迟保留两位小数);(b)样本量较小(N<50)下 χ² 检验不稳定。但原文未声明任何"按仪器精度截断""数据精度限制"等信息,良性假设在原文中无正面依据。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 3:所有统计图均触发 copy-move 检测

  • 位置:图 2–图 9(img-000 至 img-008,共 9 张图)
  • 描述:9 张图中 8 张(img-000 至 img-008)被检测到 copy-move 复制粘贴特征,匹配块数量从 19 到 281 对不等,偏移主要为 (32,0)、(0,32)、(56,0)、(0,64) 等整数像素偏移。
  • 证据:机器取证 I2/I4/I6/I8/I10/I12/I14/I16/I18 均报告 copy-move 检测阳性,匹配偏移均为规则整数像素。
  • 反方论证:候选良性解释为"统一渲染管线/期刊二次压缩"。论文图注与方法部分未声明任何关于图像导出管线或二次压缩的具体信息,原文无正面支持。
  • 严重程度:🟡(机器取证强线索,原文无正面良性解释依据,但因图表全部为程序生成的统计图,图像内容造假可能性低,保留为疑点)
  • 复核状态:⚠️ 存在疑点(机器取证强线索,但候选良性解释"统一导出管线"在原文中无正面支持,仅为推测)

发现 4:图像噪声方差普遍不均

  • 位置:img-001 至 img-007
  • 描述:6 张图(img-001 至 img-006)噪声方差 CV 值偏高(1.28–1.68),触发"疑似拼接"警告,最高 CV=1.68(img-001, img-003)。
  • 证据:机器取证 I3/I5/I7/I9/I11/I13 均报告 CV>1.0。
  • 反方论证:机器取证本身注释明确指出"扫描件/翻拍件天然带照明梯度,单一 ⚠️ 不足以定罪"。但本论文图表均为程序生成的统计图(非扫描/翻拍),该注释前提不适用;候选解释"图表局部信息密度差异(柱状图密集区 vs 空白区)"在原文中无正面依据。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在疑点(候选良性解释在原文中无正面支持,仅为推测)

发现 5:Bootstrap 结果过于"教科书式完美"

  • 位置:图 3 Bootstrap 排名稳定性 / 3.2 节
  • 描述:图 3 的散点+误差棒几乎完美地贴合 y=x 红线,所有 30 个点呈现单调递增模式;CI 宽度从排名第 1(CI≈0)到第 29 位(CI≈32)逐点扩展,"过于干净"。
  • 证据:视觉分析摘要指出"散点沿 y=x 线的等差扩展过于规则""12 个模型以外的点误差棒长度高度规律(从约 3 到 15 的等差扩展)"。论文 2.3 节明确说明 Bootstrap 采用参数化重采样(s_i + ε·SE, ε∼N(0,1)),这种方式在数学上确实会产生较为规则的结果,但论文 4.3 节局限性中并未讨论这一参数化选择对结果形态的影响。
  • 反方论证:候选良性解释为"参数化 Bootstrap 数学上即产生规则结果"。原文 2.3 节明确支持这一解释(参数化公式已给出)。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(论文 2.3 节明确声明采用参数化重采样 s_i + ε·SE,确实会产生规则结果)

发现 6:相邻排名显著性比例与"翻转率"自相矛盾

  • 位置:表 2 + 表 3
  • 描述:表 2 称 Text 领域只有 4.2%(11/265)相邻排名对具统计显著性,意味着相邻差异大部分不显著;表 3 称 Text 领域 91.4% 模型 Bootstrap 排名宽度 >3 位,意味着排名极不稳定;3.3 节 RCE 值 Text=0.0040(对应 ρ≈0.992)又暗示排名与 Bootstrap 中位数排名几乎完全相关(偏差仅 0.4%)。
  • 证据:三项数据均直接见于论文:表 2(Text: 265/11/4.2%)、表 3(Text: 266 模型/稳定度 0.111/翻转率 91.4%)、3.3 节(RCE Text=0.0040)。逻辑上:若 Bootstrap 排名宽度普遍 >3 位(ΔR̄>>3),则 RCE=0.0040(归一化 MAE≈0.4%)意味着归一化因子 N=266 下平均绝对偏差仅约 1 位,与"宽度 >3 位"不自洽。
  • 反方论证:可考虑 RCE 度量的是中位数排名与原始排名的偏差,而翻转率度量的是 CI 95% 宽度,两者度量对象不同,理论上可共存。但即使如此,原文未给出 RCE 的标准误或 Bootstrap 中位数排名的分布形态,无法验证 RCE=0.0040 的数值合理性。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 7:RCE 与翻转率数量级矛盾

  • 位置:3.2 节 + 3.3 节
  • 描述:RCE(Bootstrap 中位数排名与原始排名的归一化 MAE)=0.0040(Text)意味着 Bootstrap 抽样后中位数排名与原始排名几乎完全一致;但同一领域 91.4% 模型 Bootstrap 排名宽度 >3 位。
  • 证据:表 3 与 3.3 节直接对照。RCE≈(1−|ρ|)/2=0.0040 推出 ρ≈0.992;翻转率 91.4% 推出 ΔR̄>>3。
  • 反方论证:与发现 6 同——候选解释为两者度量对象不同,但原文未提供 Bootstrap 分布形态的补充信息,无法调和。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 8:t 检验报告的统计量缺乏原始数据支撑,且三领域得分差距高度一致

  • 位置:3.5 节 闭源 vs 开源对比
  • 描述:论文报告 Text 差距 111.6 分(t=−8.29)、Vision 差距 116.7 分(t=−5.36)、Image 差距 108.7 分(t=−5.37)。三个领域差距变异系数仅约 3.6%(均值约 112.3,标准差约 4.0),三个 |t| 值也集中于 5.36–8.29 区间。
  • 证据:原文 3.5 节明确给出三个领域差距数值(111.6/116.7/108.7)及对应 t 值(−8.29/−5.36/−5.37),均命中机器核验。原文未披露各组样本量、均值、SD,无法独立核验 t 值。三个领域数据来源完全不同(LMSys Text/Vision/Image 三个独立 Elo 排行榜),得分差距高度接近需要额外解释。
  • 反方论证:可考虑 LMSys 三个领域 Elo 评分经过全局归一化(同一评分池),因此跨领域绝对差距可能受锚定模型选择影响而趋同。但原文未声明 Elo 评分的归一化方式或锚定模型,良性假设缺乏正面依据。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 9:效率实验的 CPU 合成基准代表性可疑

  • 位置:2.6 节 + 表 4
  • 描述:论文在 Intel Core i7-1260P(CPU)上用 NumPy 搭建 decoder-only Transformer 前向传播模拟,测得的延迟数据随后用于按参数量"线性外推"到真实模型(如 CodeLlama-13B),推算数字(StarCoder2-3B: 140s vs CodeLlama-13B: 606s)未给出误差棒或不确定性区间。
  • 证据:2.6 节明确说明"用 NumPy 搭建了 decoder-only Transformer 前向传播的模拟框架""按参数量线性外推估算各模型在统一环境下的延迟和内存"。表 4 给出合成基准延迟(0.40s/1.80s/7.84s/23.29s),3.6 节给出推算延迟(StarCoder2-3B: 140s vs CodeLlama-13B: 606s)。4.3 节局限性虽承认"合成基准跑的是 CPU 上的矩阵模拟""效率估算用了参数量线性外推",但未量化外推误差大小。
  • 反方论证:候选良性解释为"作者已在 4.3 节明确自陈局限"。原文 4.3 节确实正面承认了这一局限("合成基准跑的是 CPU 上的矩阵模拟,不是真实 GPU 推理""效率估算用了参数量线性外推")。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(作者在 4.3 节局限性中已正面承认)

发现 10:方法论自陈局限未在结论中适当反映

  • 位置:4.4 节结论
  • 描述:作者在局限性中承认"分析仅覆盖 Arena 型排行榜""Bootstrap 假定 CI 对称正态""效率实验基于 CPU 合成基准和线性外推",但 4.4 节结论依然给出强论断"当前排行榜的'单一维度排名'在方法论上不足以支撑模型选型决策"。
  • 证据:1.3 节与 4.3 节明确列出三大局限性(仅 Arena 型/Bootstrap 对称正态/CPU 外推),4.4 节结论使用"当前排行榜"这一全称量词。
  • 反方论证:候选良性解释为"学术论文常在结论中给出方向性建议,且 4.3 节已明确局限"。原文 4.3 节确实正面承认了局限性。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(作者在 4.3 节已正面承认方法论局限)

耿同学辣评

一篇关于"排名靠不靠谱"的研究,自己报告的 RCE 值和翻转率却互相打架——说 91.4% 的排名都能漂 3 位以上,转头又说 Bootstrap 中位数排名跟原始排名偏差只有 0.4%,这就好比体检报告说你"高烧 39 度"和"体温完全正常"写在同一张纸上。闭源 vs 开源三个领域得分差距高度一致(CV 仅 3.6%)也耐人寻味——三个独立数据集产生几乎相同的差距值,需要论文给出合理解释。Benford 联合检验第 3、4 位数字严重偏离、末位数字分布严重不均匀,配合"教科书般完美"的 Bootstrap 散点和批量图的 copy-move 模式,统计层面的多条独立异常已经够开一场数据复现听证会了。我只想问:这位韩同学,您跑统计的时候是不是用了 Ctrl+C?建议把原始 Elo 数据、Bootstrap 抽样代码、效率基准的 NumPy 脚本和图渲染脚本一并公开,让我们看看究竟是"统计暗物质"还是"统计暗箱操作"。


建议后续行动

  • 联系作者要求提供:原始 LMSys Elo 数据、Bootstrap 抽样代码、效率基准的 NumPy 脚本与运行环境信息
  • 在 PubPeer 上提出质疑(RCE 与翻转率的数量级矛盾、三领域闭源/开源得分差距高度一致)
  • 向 ChinaXiv 编辑部提交数据可复现性请求
  • 独立复现 RCE=0.0040 的计算过程,验证 Bootstrap 中位数排名分布

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。


🧮 证据合成(自动生成)

  • 综合后验概率:≥99.9%(先验 5%)
  • 95% 可信区间:[100%, 100%]
  • 贝叶斯因子:BF = 2.23e+13(决定性(decisive))
  • 综合评级:🔴 高度疑似
  • 复核已排除线索:10 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)

贡献最高的证据

  1. [S1] Benford 联合检验:存在严重偏离(stats/benford,logLR=1.57)— 贡献 6.6%
  2. [I6] [img-002.jpg] 检测到 copy-move 复制粘贴:偏移 (56,0) 处 54 对匹配块(image/copy_move,logLR=1.46)— 贡献 6.6%
  3. [I2] [img-000.jpg] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 146 对匹配块(image/copy_move,logLR=1.46)— 贡献 5.8%
  4. [发现7] RCE=0.0040(对应ρ=0.992)与91.4%翻转率(>3位)在统计学上不自洽,排名宽度普遍>3位时中位数不可能稳定到0.4%偏差(llm/*,logLR=1.59)— 贡献 5.8%
  5. [发现6] 表2显示大部分相邻差异不显著(4.2%),表3显示91.4%模型排名宽度>3位,两结论方向一致但与RCE值冲突(llm/*,logLR=1.59)— 贡献 5.4%

免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。