机器学习基准排行榜排名的统计可靠性与效率偏差研究 / Statistical Reliability and Efficiency Bias in Machine Learning Benchmark Rankings
🔍 耿同学打假报告
论文信息
- 标题:机器学习基准排行榜排名的统计可靠性与效率偏差研究 / Statistical Reliability and Efficiency Bias in Machine Learning Benchmark Rankings
- 作者:韩宇萱*
- 单位:常州大学计算机与人工智能学院,江苏常州213159
- 期刊:ChinaXiv预印本(编号 202607.00273v1)
- 发表年份:2026年7月(ChinaXiv posted 2026-07-24)
综合评定:🟠 高度可疑
详细发现
⚠️ 发现 1:表4在3.6节内出现两次,两次标题相同但内容完全不同
- 位置:Section 3.6(第一次和第二次出现的"表4")
- 描述:第一次"表4不同参数规模代码模型的合成Transformer效率基准实验结果"列出4组参数规模(Tiny/Small/Medium/Large)的合成基准数据;第二次同名"表4不同参数规模代码模型的合成Transformer效率基准实验结果"则列出了4个BigCodeBench模型(StarCoder2-3B、CodeLlama-13B、DeepSeek-Coder-1.3B、CodeGen-2B-Mono)的排行榜重排名。两张表内容完全不同却共享表号与标题,且都出现在第3.6节内,是明显的标签错位/重复。
- 证据:第一次表4列头为"参数规模 参数量 推理延迟(s) 吞吐量(tok/s) 峰值内存(MB)",第二次表4列头为"模型 参数量 pass@1 原始排名 效率加权排名 排名变化"。表号均为"表4",标题字符串完全一致。
- 严重程度:🟠
- 复核状态:⚠️ 依据不足——经过反方论证:(a) 可能是LaTeX/Word排版时的标签错误(仅是写作疏忽,未影响数据真实性);(b) 后一张表格内容确实属于"效率加权重排名"而非"效率基准",与前一表同属3.6节内容,作者可能在修订过程中误改表标题而非表号。无论何种解释,两张表确实使用了同一个编号"表4",按引用规范会造成混乱,但无法仅凭此判定数据造假,降级保留。
发现 2:摘要与正文声称分析12个BigCodeBench模型,但正文第二次表4仅列4个
- 位置:摘要 / Section 2.6 / Section 3.6 第二次表4
- 描述:摘要明确声称"排行榜交叉分析(12个模型)",Section 2.6 方法部分也描述"从BigCodeBench排行榜[5]取了12个代表性模型(0.35B–15.7B)",Section 3.6 描述"图7的气泡图显示全部12个模型"、"12个模型里只有CodeGen-350M一个能入A级"、"4个在B级,7个在C/D级"。但是 1+4+7=12 这点可以自洽。然而正文唯一承载"重排名"数据的第二次表4只列出了4个模型(StarCoder2-3B、CodeLlama-13B、DeepSeek-Coder-1.3B、CodeGen-2B-Mono)。读者无法从正文独立重建全部12个模型的重排名数据,只能依赖图7、图8、图9的可视化。
- 证据:摘要"排行榜交叉分析(12个模型)"+"从BigCodeBench排行榜[5]取了12个代表性模型(0.35B–15.7B)",但第二次表4仅列StarCoder2-3B、CodeLlama-13B、DeepSeek-Coder-1.3B、CodeGen-2B-Mono四个模型。
- 严重程度:🟠
- 复核状态:✅ 成立——反方论证:良性解释可能是"作者只展示了部分代表性模型而把其余数据放在图7-9里",但原文中图7-9是气泡图/分布图/排名变化图,根本无法读出其余8个模型的具体pass@1、延迟、排名变化数字。也就是说:这12个模型中其余8个模型的"原始排名→效率加权排名"的具体数字在原文中无从查证,作者声称分析12个模型却只给出4个模型的完整数据,构成数据可追溯性缺陷。
发现 3:RCE ≈ (1−|ρ|)/2 三对数据精确到小数点后3位(疑似循环验证)
- 位置:Section 3.3
- 描述:正文报告三组 RCE 与 ρ 的对照:RCE_Text=0.0040 对应 ρ≈0.992;RCE_Vision=0.0114 对应 ρ≈0.977;RCE_Image=0.0526 对应 ρ≈0.895。按理论公式反算:(1−0.992)/2=0.0040 精确吻合;(1−0.977)/2=0.0115,与0.0114偏差0.0001;(1−0.895)/2=0.0525,与0.0526偏差0.0001。RCE是基于Bootstrap中位数排名计算的离散量,ρ是基于排序的离散量,两者在真实数据上"近似吻合"的程度通常远达不到三位小数完全一致。作者文中使用"约"字(如"约ρ=0.992"),并且 ρ 是从公式 (1−2·RCE) 反推还是独立计算,原文未明确说明,存在循环验证的疑点。
- 证据:"RCE_Text=0.0040(约ρ=0.992),RCE_Vision=0.0114(约ρ=0.977),RCE_Image=0.0526(约ρ=0.895)"。
- 严重程度:🟠
- 复核状态:✅ 成立——反方论证:(a) 良性解释"作者独立计算了ρ报为约值"——但原文完全未说明ρ是独立计算还是从RCE反推(无方法学描述可查证),良性解释仅是通用推测,原文无正面支持。(b) 良性解释"近似关系本来就是近似,三位小数吻合也算巧合"——但三个独立数据集同时吻合到第3位小数(最大偏差0.0001)的统计概率极低。该发现保留成立。
发现 4:闭源 vs 开源模型差距三次独立测量值高度聚集于108–117 Elo
- 位置:Section 3.5
- 描述:三个领域的 Elo 差距分别为 Text=111.6、Vision=116.7、Image=108.7。三个领域涉及完全不同的模型池(NLP对话模型 / 多模态视觉模型 / 文生图模型)、不同的投票者偏好结构、不同的评分尺度(理论上Elo评分范围可变),三次独立的 t 检验却产生了几乎相同的差距(108.7、111.6、116.7;极差仅8分,约占总差距的7%)。考虑到三个领域模型数差异巨大(266/86/19),这一聚集在统计上不太寻常。作者在文中以同一Elo尺度报告差距,但未讨论该尺度的可比性。
- 证据:"Text差距111.6分(t=−8.29),Vision差距116.7分(t=−5.36),Image差距108.7分(t=−5.37)"。
- 严重程度:🟡
- 复核状态:✅ 成立——反方论证:(a) 良性解释"LMSys Arena本来就用全局统一的Elo评分尺度,三个领域共享同一评分池"——这是Arena数据共享的客观特征,原文未明确说明但确实存在于背景中。(b) 良性解释"完全巧合"——三领域都用同一底层评分机制,差距量级相近有理论可能。但即便考虑(a)的良性解释,"111.6 / 116.7 / 108.7"三个数字之间的极差仅8分(约占差距的7%),对比三个领域模型数量悬殊(266 vs 86 vs 19)、样本量如此不同却产生如此接近的差距仍然可疑,且原文未对Elo尺度跨领域可比性做任何讨论。该发现保留成立。
⚠️ 发现 5:合成基准已显示"参数→延迟"非线性,但排行榜交叉分析仍用线性外推
- 位置:Section 2.6 / Section 3.6 / Section 4.3
- 描述:作者在3.6节明确展示"参数量增长4倍导致延迟增长13.1倍"的非线性(表4合成数据也体现了125M→350M参数增2.8倍延迟涨4.4倍、350M→500M参数增1.4倍延迟涨3.0倍的递增非线性)。但在 Section 2.6 的排行榜交叉分析中却采用"按参数量线性外推估算各模型在统一环境下的延迟和内存",两种方法学互相矛盾。此外作者自己也在4.3节承认"效率估算用了参数量线性外推"是局限性之一,但并未给出外推公式或残差验证。
- 证据:"用实验一的基准数据,按参数量线性外推估算各模型在统一环境下的延迟和内存"——与"参数量从125M涨到500M翻了4倍,推理延迟从1.80秒飙到23.29秒——13.1倍"的非线性结论并存。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释——作者本人在局限性部分(4.3节)明确承认了"线性外推"是局限,并称"下一步要在统一GPU平台上把12个模型的真实效率数据补齐"。这构成了方法学自知缺陷的正面依据,因此这是已声明的局限而非隐瞒矛盾;但仍削弱了"重排名±4位"这一关键发现的可靠性,作为方法学缺陷降级保留。
⚠️ 发现 6:末位数字分布严重不均匀(机器取证 S2)
- 位置:全文数值(latency、memory、Elo差值、Cohen's d、RCE 等)
- 描述:程序化计算发现论文中报告数值的末位数字分布严重不均匀(χ²=37.9, p=0.0000)。这是一项比Benford更稳健的统计检验。在真实测量数据上末位数字理论上应近似均匀分布(受测量精度限制时则集中在某些数字上),χ²=37.9、p=0.0000 表明分布偏离随机显著。Benford第3、4位数字也严重偏离(MAD=0.12/0.157,远高于Benford适用阈值0.0156),但Benford对受控范围内的实验数据(如百分比52%、36%、45%;延迟区间被分类阈值切分;参数量是四档离散值等)检验前提不完全满足,因此Benford的证据力较弱。
- 证据:S2 程序线索,χ²=37.9, p=0.0000;S1 第3、4位 MAD分别为0.1202和0.1570。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释——反方论证:(a) 论文中大量数值为受控范围测量(4档固定参数量、4档效率评级 A/B/C/D、Elo分差异分组(闭源/开源)等离散分类),这些数值末位本就难以均匀。S1 Benford 的检验前提(数据应来自自然过程/连续测量)在本文部分不满足。(b) S2 末位检验前提(连续测量数据末位近似均匀)在受控范围数据上同样适用有限。但末位检验 p=0.0000 仍构成统计异常线索,无法被良性解释完全清除,作为保留的依据不足线索。
⚠️ 发现 7:图像取证噪声方差与copy-move线索(机器取证 I1–I18)
- 位置:机器取证 I1–I18(img-000 至 img-008,共9张)
- 描述:I1–I18 显示 9 张图中 5 张(img-001 至 img-006)的噪声方差 CV>1.2(最高 1.684),达到"高度不均"阈值;全部 9 张图均触发 copy-move 块匹配。需要说明:(a) block-matching 算法对图中规则重复的网格元素(坐标轴刻度、对齐面板分隔、tick mark、散点网格)极易误报,论文大量使用 matplotlib heatmap/bubble/scatter 图,规则像素阵列广泛存在,copy-move 结果很可能来自图表本身的重复元素(图表边框、tick mark、网格线、刻度文字、图例标记等)而非数据造假;(b) noise_variance 的 CV>1 指标同样会受到 matplotlib 渲染时的色彩渐变、坐标轴遮挡、文字覆盖等影响,原文未提供原始数据图(非渲染截图)以复核。I19–I25 PRNU 弱相似(NCC 接近 0)的 7 对两两比较也仅显示弱同源,未达到造假阈值。在没有人工复核具体图像区域的情况下,单凭这 18 条机器线索不能定罪,但它们叠加起来达到了"≥3处相互独立的异常线索"的量级,作为整体保留。
- 证据:I3–I14 显示 img-001 至 img-006 的 noise_variance CV 分别为 1.684/1.482/1.677/1.591/1.290/1.283;I2、I4、I6、I8、I10、I12、I14、I16、I18 显示全部 9 张图触发 copy-move(弱匹配:img-001 的 91 对 @ (0,32)、img-002 的 54 对 @ (56,0)、img-004 的 32 对 @ (32,0))。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足——反方论证:(a) matplotlib 批量导出同款风格的图表(同一字体、同一颜色面板、同一坐标轴刻度密度)会让 block-matching 算法在 tick mark、面板分隔条、坐标轴数字边框等区域大量产生同偏移匹配,原文未提供生成脚本或 DPI 设置,无法验证是否是良性批量相似;(b) matplotlib 在生成 colormap/heatmap 时的像素抖动模式可能使 noise_variance CV>1.2,原文未声明图像导出格式。但良性解释仅有通用托辞性质,原文中无任何关于图像生成管线、批量导出参数、原始数据 vs 渲染截图的正面说明;多条独立异常叠加达到"≥3处相互独立"的量级,作为疑点线索保留。
耿同学辣评
这篇论文声称要"系统审计排行榜的统计可靠性",结果自己的表4在3.6节内被同一个编号"表4"用了两次,第二次内容跟第一次完全不同——审计别人的审计者,先得把自己的表号理清楚。再看RCE与ρ的"跨领域验证",三个独立数据集的拟合精度全部精确到小数点后3位,且作者对ρ是独立计算还是从RCE反推一字未提,这种"完美吻合"在统计上要么是巧合、要么是循环论证。更扎眼的是,闭源vs开源的Elo差距三领域全部聚在108–117分区间,不管作者是用了什么尺度的Elo,三次独立测量产生如此接近的差距,都值得作者在文中专门讨论一下可比性。原文唯一出现12个模型"重排名"完整数字的表,只有4个模型的完整数据;剩余8个模型的"原始排名→效率加权排名"数字在原文中无文本可查,只能依赖气泡图来"读图取数"。至于机器取证那边,9张图全部命中copy-move、5张图噪声方差高度不均——可能都是matplotlib批量渲染的锅,也可能不是,但作者既没有声明图像导出管线,也没有公开原始数据来让复核者直接验证。综合看:审计别人统计可靠性的人,自己的数据可追溯性和方法学严谨性需要先过关。
建议后续行动
- 联系作者要求提供原始数据(特别是 BigCodeBench 12个模型的完整 pass@1、原始排名、效率加权排名数字;以及第2次表4所列4个模型的数字表)
- 在 PubPeer 上提出质疑(特别是 RCE-ρ 循环验证问题、第二次表4仅列4个模型问题、闭源/开源三领域差距聚集问题)
- 向 ChinaXiv 学术委员会举报(论文编号 202607.00273v1,要求作者澄清表4编号冲突与12个模型数据可追溯性)
- 向作者所在机构学术委员会举报(常州大学计算机与人工智能学院)
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
🧮 证据合成(自动生成)
- 综合后验概率:≥99.9%(先验 5%)
- 95% 可信区间:[100%, 100%]
- 贝叶斯因子:BF = 4.02e+15(决定性(decisive))
- 综合评级:🔴 高度疑似
- 复核已排除线索:7 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)
贡献最高的证据:
- [I12] [img-005.jpg] 检测到 copy-move 复制粘贴:偏移 (0,32) 处 96 对匹配块(image/copy_move,logLR=1.46)— 贡献 5.1%
- [I18] [img-008.jpg] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 281 对匹配块(image/copy_move,logLR=1.46)— 贡献 5.1%
- [C1] 对三个Arena型排行榜的相邻排名对应用z检验审计统计可靠性(横断面元分析)(causal/causal,logLR=1.79)— 贡献 5.1%
- [I8] [img-003.jpg] 检测到 copy-move 复制粘贴:偏移 (0,32) 处 81 对匹配块(image/copy_move,logLR=1.46)— 贡献 4.7%
- [I10] [img-004.jpg] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 32 对匹配块(image/copy_move,logLR=1.46)— 贡献 4.5%
免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。