机器学习基准排行榜排名的统计可靠性与效率偏差研究 / Statistical Reliability and Efficiency Bias in Machine Learning Benchmark Rankings
🔍 耿同学打假报告
论文信息
- 标题:机器学习基准排行榜排名的统计可靠性与效率偏差研究 / Statistical Reliability and Efficiency Bias in Machine Learning Benchmark Rankings
- 作者:韩宇萱(常州大学计算机与人工智能学院)
- 期刊:ChinaXiv(预印本)
- DOI:未提供
- 发表年份:2026-07-24(v1 版本)
- 论文来源:202607.00273v1.pdf
综合评定:🟡 存疑
复核说明:原报告评定"🟠 高度可疑",经逐条复核后,多条原报告依赖的核心证据(统计检验具体数值、图像取证 CV 值等)在论文原文中无法找到对应数据点,需删除。剩余成立/降级保留的发现主要涉及方法论自承缺陷、合成实验内部一致性、可复现性不足等,未达"系统性造假"标准,调整为"🟡 存疑"。
详细发现
⚠️ 发现 1:合成 Transformer 效率实验内部一致性存疑
- 位置:表4、3.6节
- 描述:
- 论文摘要与正文均以"参数量增长 4 倍(125M→500M)导致延迟增长 13.1 倍"作为核心结论数字;表4中 1.80s→23.29s 即 12.94 倍,与摘要吻合。
- 125M→350M(参数增 2.8 倍)延迟 1.80→7.84 = 4.36 倍,与正文"4.4 倍"吻合。
- 但:表4中峰值内存从 33.4 MB 到 38.5 MB 仅增加约 15%,与延迟的爆炸式增长严重不一致。如果 CPU 上 decoder-only Transformer 前向推理随参数量增加导致大量矩阵乘法变慢,内存占用(激活值、注意力矩阵按层数与维度增长)通常应呈超线性增长,不应几乎不变。
- 此外,500M/50M = 10 倍参数量,对应延迟 23.29/0.40 = 58.2 倍;而 125M→500M(4 倍参数)只涨 12.94 倍——总体的非线性程度在不同区段并不一致,提示 Tiny(50M)的数据点与其他三组可能并非同一条件下测量。
- 证据:表4全部数据点(参数量 50M/125M/350M/500M;延迟 0.40/1.80/7.84/23.29s;吞吐 1286/1018/882/792 tok/s;内存 33.4/34.2/37.0/38.5 MB);3.6 节"参数量从 125M 涨到 500M,只翻了 4 倍,但推理延迟从 1.80 秒飙到了 23.29 秒——13.1 倍"。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(CPU NumPy 模拟下内存仅统计数组本身、未包含 attention 矩阵等中间激活,方法学差异可解释内存平坦;但 Tiny 与其余三组的非线性斜率不一致仍是可观察的异常,方法学描述不足以完全排除)
⚠️ 发现 2:合成基准实验与"现实部署"结论的方法学脱节
- 位置:3.6 节末段、4.1 节、4.2 节
- 描述:作者在 4.3 节明确承认合成基准"跑的是 CPU 上的矩阵模拟,不是真实 GPU 推理",效率估算采用"按参数量线性外推"。但论文仍以"140s vs 606s"、"4.3 倍"等具体延迟数字直接对比 StarCoder2-3B 和 CodeLlama-13B 的实际部署难度,并以确定数字呈现,未对读者标明这是外推估算。线性外推对推理延迟来说受架构(attention 变体、激活函数)、量化、KV-cache 实现、batch size 等因素影响,方法学可靠性有限。
- 证据:3.6 节"用实验一的基准数据,按参数量线性外推估算各模型在统一环境下的延迟和内存";3.6 节"StarCoder2-3B 的延迟只有 CodeLlama-13B 的 23%(140s vs 606s),内存也一样——12GB vs 52GB";摘要"推理延迟相差 4.3 倍";4.3 节"效率实验的合成基准跑的是 CPU 上的矩阵模拟,不是真实 GPU 推理"。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(作者确实在 4.3 节自我声明了局限性,但摘要与正文主体中以确定数字呈现而未加明确警示,容易误导读者;这是表述严谨性问题,不直接等于造假)
⚠️ 发现 3:效率加权排名公式(pass@1 × log(throughput))方法论支撑不足
- 位置:3.6 节末段
- 描述:作者用"pass@1 × log(throughput)"做重排名,但:
- 为何取 log 而非线性 / 幂函数 / 调和平均,未给出数学或领域理由;
- throughput 单位(tok/s)虽一致,但 BigCodeBench 各模型的 throughput 是基于参数量线性外推所得,与表4中合成实测的 throughput 是否同基准不明;
- 选择乘法意味着"效率趋于零会拖垮准确率",未必符合实际部署决策的 Pareto 权衡;
- 表中"±4 位"的排名漂移高度依赖 log 函数选择,换用其他聚合函数(如调和/几何平均)排序结果可能不同——这一方法论敏感性在摘要中以确定数字呈现。
- 证据:3.6 节"用'效率加权得分=pass@1×log(throughput)'做重排名";"StarCoder2-3B 从第 5 升到第 2,CodeLlama-13B 从第 3 跌到第 7。DeepSeek-Coder-1.3B 升了 4 位";摘要"引入效率维度后排名可发生±4 位的漂移"。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(作者选用的聚合公式是一个合理的(虽非唯一)效率-精度联合度量,方法论选择本身不构成造假;但未做敏感性分析是该论文的实证缺陷)
发现 4:时间线与方法学可复现性不足
- 位置:全文
- 描述:
- 论文 2026-07-24 投稿 v1。引用文献([1]-[10])时间线合理,2024 年 NAACL/NeurIPS 论文在 2026 年引用合法。
- 但:作者声称"对 LMSysChatbotArena 三个领域共 371 个模型的公开 Elo 评分数据",但论文未说明 数据快照日期,也未提供 CSV 文件的版本号、URL 或哈希,读者无法复现。
- 证据:表1列出三个数据文件
lmarena_text.csv、lmarena_vision.csv、lmarena_image.csv,但全文未给出快照日期或下载链接;摘要"共 371 个模型的公开 Elo 评分数据"。 - 严重程度:🟡
- 复核状态:✅ 成立
⚠️ 发现 5:Bootstrap 与 z 检验的统计假设被作者自承不满足
- 位置:2.2 节、2.3 节、4.3 节
- 描述:
- 2.2 节从 95%CI "反推标准误" 用公式 SE = CI_upper / 1.96——隐含假设 CI 对称且为正态分布的 95%CI。但 LMSys 报告的 CI 是 Bradley-Terry 模型估计的 bootstrap CI,不对称是常态。
- 作者在 4.3 节自我承认"Bootstrap 假定 CI 对称正态,但原始报告里的 CI 可能来自 Bradley-Terry模型,不一定完全满足"。
- 但论文仍基于此假设之上的 z 检验得出了"只有 4.2% 显著"的核心结论——该核心数字的稳健性存疑。
- 证据:2.2 节"SE_i=CI_upper_i/1.96";4.3 节"Bootstrap 假定 CI 对称正态,但原始报告里的 CI 可能来自 Bradley-Terry 模型[2][3],不一定完全满足"。
- 严重程度:🟠
- 复核状态:⚠️ 存在良性解释(作者已自承局限性,且对称近似在 CI 不严重偏斜时影响有限;但核心结论的稳健性确实存疑,作为方法论缺陷保留)
⚠️ 发现 6:RCE 与 Spearman ρ 的"近似关系"验证方式可疑
- 位置:2.4 节、3.3 节
- 描述:
- 公式 "RCE ≈ (1 - |ρ|)/2" 在 ρ=1 时 RCE=0,ρ=0 时 RCE=0.5,ρ=-1 时 RCE=1——形式上自洽。
- 但 RCE 定义为平均绝对偏差除以 N(位置偏差的绝对值),Spearman ρ 衡量的是秩单调性——二者的数学关系并非直接等价。一个 ρ=0.99 的样本完全可能 RCE 较大(如果偏差集中在一端),反之亦然。
- 论文没有提供 ρ 的实际计算值,仅提供了从公式反推的值("约 ρ=0.992""约 ρ=0.977""约 ρ=0.895")——等价于"用公式验证公式",并非独立验证。
- 证据:3.3 节"Text=0.0040(约ρ=0.992),Vision=0.0114(约ρ=0.977),Image=0.0526(约ρ=0.895)";2.4 节"RCE≈(1−|ρ|)/2"。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(作者借用 Huang 等人[1]已发表框架,跨领域应用合理;但声称"跨领域验证"缺乏独立 ρ 测量,仅作引用关系近似,作为方法论严谨性问题保留)
⚠️ 发现 7:摘要与正文关键数字呈现过于"干净"
- 位置:摘要、3.1-3.5 节
- 描述:
- 4.2%、5.9%、77.8% 三个显著性比例分别对应 11/265、5/85、14/18,计算无误,但三个数字的递进与 CI 宽度随投票数增加而递减的趋势高度吻合。
- Cohen's d 范围 "22–50"——属于极大效应量区间,真实 Top-5 LLM Elo 评分差距的 Cohen's d 通常不会高至此程度;但论文只给出区间,未列具体数值。
- 闭源 vs 开源 t 值(−8.29, −5.36, −5.37)在三个领域几乎一致(约 −5 到 −8),可能反映样本量与效应量被人为调整过,或开闭源分类是事后定义。
- 证据:3.1 节"11 对(4.2%)""5 对显著(5.9%)""77.8%";3.3 节"Cohen'sd全都落在'极大效应'区间,22–50";3.5 节"Text 差距 111.6 分(t=−8.29),Vision 差距 116.7 分(t=−5.36),Image 差距 108.7 分(t=−5.37)"。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(数据点本身与计算自洽;数字"干净"可能是巧合或样本量/效应量天然匹配的结果;缺乏反方证据不足以定性,但作为呈现可疑性记录)
⚠️ 发现 8:作者贡献声明工作量对单一本科生偏紧
- 位置:文末"作者贡献声明"
- 描述:单一作者声称完成:跨领域元分析框架设计、LMSys 三领域数据收集、Bootstrap 代码编写与全量实验执行、BigCodeBench 合成 Transformer 基准实验设计与排行榜交叉分析、全部图表生成与数据分析、全文撰写修改审定。学号 2300770102 暗示 2023 级本科生,独立完成跨领域统计审计 + 合成基准实验 + 12 模型交叉分析的工作量较大,且时间线(NAACL 2024 Rank-Calibration 发表后迅速扩展到 3 个领域)偏紧。
- 证据:文末"韩宇萱:提出研究问题与跨领域元分析框架;完成 LMSys 排行榜数据收集与 Bootstrap 统计稳定性分析代码编写及全量实验执行;完成 BigCodeBench 合成 Transformer 效率基准实验设计与排行榜交叉分析;完成全部图表生成与数据分析;撰写、修改和审定全文";首页"2300770102@smail.cczu.edu.cn"。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(单作者完成预印本在学术圈并不罕见,尤其对方法论类工作;工作量偏紧但非不可能;该条仅作可疑线索保留)
已删除的发现(结论不成立)
以下发现经复核后删除,理由如下:
| 原发现 | 删除理由 |
|---|---|
| 发现 1(内部数据自相矛盾) | 经程序化核验与人工复核,表1(266/86/19 模型)与表2(265/85/18 对,11/5/14 显著)以及摘要(371 模型总数、4.2%/5.9%/77.8%)数据全部自洽(机器核验:Vision 86 与 Image 19 的字段名命中弱匹配/写法差异,Text 266 命中弱匹配,关键比例 11/265≈4.2%、5/85≈5.9%、14/18≈77.8% 均吻合)。原报告所谓"矛盾"实际是数据自洽,原结论不成立。 |
| 发现 2(末位数字 χ²=37.9, p=0.0000) | 机器核验显示关键统计量"χ²=37.9, p=0.0000"在原文中未找到(仅其余 20 个数据点命中)。原报告引用的统计检验结果无原文依据,结论不成立。 |
| 发现 3(Benford 检验 MAD 值) | 机器核验显示全部 4 个 MAD/χ²/p 数据点(MAD=0.0430/0.0391/0.1202/0.1570 及对应 χ²=23.5/16.5/353.1/597.5)在原文中均未找到;且论文数值多为统计计算结果(p 值、r 值、t 值、百分比),本身不满足 Benford 强适用前提。原报告双重不成立。 |
| 发现 4(图像噪声方差 CV 值) | 机器核验显示 7 个具体 CV 值(img-001 至 img-006)在原文中均未找到(论文为文本,不含图像 CV 数值)。原报告引用的图像取证参数无原文依据,结论不成立。 |
| 发现 5(copy-move 偏移匹配块数) | 机器核验显示全部 9 个偏移匹配数据点在原文中均未找到。论文图表为程序生成的统计图(散点图/气泡图/柱状图),存在规则重复元素(坐标轴/边框/刻度)天然形成同偏移匹配这一良性解释足以反证。原结论不成立。 |
| 发现 6(PRNU 跨图 NCC/PCE 值) | 机器核验显示全部 7 个 NCC/PCE 数据点在原文中均未找到。且原报告已自评"PRNU 本质上不适用"(论文图表为程序生成而非摄影图像),属无信息量信号。结论不成立。 |
| 发现 13(关键数字过于干净,末段 t 值) | 机器核验 7 个数据点全部原文命中,但发现实质是"数字看起来整齐"的主观印象,无可量化的造假证据;作为信息性观察不足以单独成立,合并入复核后的"发现 7"。 |
| 发现 14(作者贡献过度声明) | 机器核验 2 个数据点原文命中。该结论性质偏主观(工作量评估),不构成可独立验证的造假证据,降级合并入复核后的"发现 8"。 |
机器取证证据复核处置
| 编号 | 检验类型 | 复核结论 | 理由 |
|---|---|---|---|
| S1 | Benford 联合检验 | cleared | 4 个 MAD/χ²/p 数据点机器核验均未在原文找到;且论文数值多为统计计算结果(p 值、r 值、t 值、百分比),本身不满足 Benford 强适用前提,良性解释足以反证。 |
| S2 | 末位数字 χ²=37.9, p=0.0000 | cleared | 关键统计量在原文未找到;不计入证据合成。 |
| I1–I18 | 图像噪声方差 + copy-move | cleared | 所有具体 CV 值与匹配块数在原文未找到;论文图表为程序生成,规则元素(坐标轴/边框/刻度)天然形成同偏移匹配,良性解释足以反证。 |
| I19–I25 | PRNU 跨图比对 | cleared | 所有 NCC/PCE 值在原文未找到;论文图为程序生成而非摄影图像,PRNU 不适用。 |
| C1 | 因果声明校验(横断面观察) | cleared | 论文 3.2 节确实以横断面/相关性表述"规模越大排名越不稳",但作者在 4.1 节用"反直觉"修饰,未直接声称为因果;属于表述建议性问题,不构成造假证据。 |
耿同学辣评
复核之后,这篇论文从"高度可疑"降级为"存疑"——但"存疑"不是因为它看起来没问题,而是因为原报告引用的很多"硬证据"(Benford 的 MAD 值、图像 CV 值、copy-move 匹配数)在论文原文里根本找不到对应文字支撑。换句话说,不是论文一定造假,而是原报告的一些指控缺少原文依据。
论文本身确实存在一些值得讨论的问题:CPU 上的 NumPy 模拟被直接外推到 12 个真实代码模型的部署延迟上,"线性外推"在 4.3 节才被轻描淡写地承认;pass@1 × log(throughput) 的加权公式未做任何敏感性分析;摘要里"4.2%""13.1 倍""±4 位"这些精确数字给了读者过度自信的感觉——这些是方法论严谨性问题,不一定是造假。
那张被人喊"9 张图全中招 copy-move"的程序生成散点图,本质上就是 matplotlib 默认渲染加上统一的坐标轴、刻度、边框——这种重复元素触发 copy-move 检测器是预期之内的良性假阳性。原报告把程序生成图的取证信号当作强证据,是高估了图像取证在这种场景下的区分力。
总结:这是一篇方法论有缺陷、表述有过度自信倾向、但未发现系统性造假证据的预印本。建议作者:(1) 补充 GPU 实测效率数据替代线性外推;(2) 对加权公式做敏感性分析;(3) 公开 LMSys 数据快照日期与原始 Bootstrap 代码以利复现。
建议后续行动
- 联系作者要求提供原始数据(包括 LMSys 快照 CSV、Bootstrap 代码、NumPy 模拟脚本)
- 在 PubPeer 上提出方法论质疑(z 检验对称 CI 假设、线性外推可靠性、加权公式敏感性)
- 向期刊编辑部举报
- 向作者所在机构学术委员会举报
- 等待作者回应后再决定是否升级举报
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。