Loading...
正在加载...
请稍候

DARE-bench: A Benchmark for Data Science Agents

2026-08-14 16:12

🔍 耿同学打假报告

论文信息

  • 论文来源:2602.24288v1.pdf(arXiv preprint)
  • 标题:DARE-bench: A Benchmark for Data Science Agents
  • 作者:Fan Shu, Yite Wang, Ruofan Wu, Boyi Liu, Zhewei Yao, Yuxiong He, Feng Yan
  • 单位:University of Houston, Snowflake AI Research
  • 期刊:ICLR 2026(会议论文)
  • DOI:arXiv:2602.24288v1
  • 发表年份:2026年2月27日(arXiv 提交日期)

综合评定:🟠 高度可疑

本论文为机器学习/AI 基准测试类研究。复核后保留以下几条成立的可疑信号:(1) 正文章节 4.3 中关于 Claude-Sonnet-3.7 / gpt-5 的描述存在内部矛盾(同一指标同时被归给两个模型为最高),且正文给出的 69.81、61.03、63.20、49.88、13.70 等数值在原文中均未在 Table 5 中找到匹配行;(2) Table 5 与 Table 11 中 gpt-5、Claude-Sonnet-3.7 整行大量缺失,而正文仍以这些缺失数据宣称"top-performing";(3) Table 6 中 SFT-FV 与 SFT-AV 在 classification-IF 上得到完全相同的绝对增益 +23.43;(4) Table 3 中 Train/Test 领域分布出现 Environment 从 6.8%→2.4% 的显著偏移;(5) 多张示意图存在 copy-move 复制粘贴信号;(6) Benford 联合检验严重偏离(但前提部分不满足,需谨慎对待)。综合达到"任一成立发现 + 独立异常≥3 条 + 机器取证强证据线索存在"的 🟠 高度可疑门槛。

详细发现

发现 1:主结果表与正文叙述存在内部矛盾

  • 位置:Page 7, Table 5 与正文章节 4.3
  • 描述:正文章节 4.3 一方面称 "Claude-Sonnet-3.7 emerges as the top-performing model. It achieves the highest scores on four of the six evaluation metrics: 'classification-IF' (69.81), 'classification-MM' (61.03), 'regression-MM' (63.20), 'time-series-XF' (49.88) and 'time-series-CF' (13.70)",列出了 5 个数值;另一方面紧接着又写 "gpt-5 leads the two IF columns, achieving the highest 'classification-IF' (69.81) and 'regression-IF' (57.24)",将 classification-IF 的最高值 69.81 同时归给 Claude-Sonnet-3.7 与 gpt-5,构成内部冲突;"four of the six" 与后列 5 个数值也自相矛盾。更关键的是:Table 5 中 Claude-Sonnet-3.7 行仅给出 classification-IF=61.48 一个数字,正文中声称的 69.81 / 61.03 / 63.20 / 49.88 / 13.70 在 Table 5 中均找不到对应行(gpt-5 行整行空白)。
  • 证据:原文 "It achieves the highest scores on four of the six evaluation metrics: 'classification-IF' (69.81), 'classification-MM' (61.03), 'regression-MM' (63.20), 'time-series-XF' (49.88) and 'time-series-CF' (13.70)" 与 "gpt-5 leads the two IF columns, achieving the highest 'classification-IF' (69.81) and 'regression-IF' (57.24)"——同一 69.81 同时被两个模型声称为最高;表 5 中 Claude-Sonnet-3.7 行只有 61.48 这一项数据被填入。
  • 反方论证:不能排除作者笔误(如把不同行的数据张冠李戴)或 Table 5 在排版/导出时整行被吞。但 (a) 5 个数值同时找不到对应行,(b) "four of the six" 与列出 5 项的矛盾属结构性而非偶然——单纯笔误难以解释这么多不一致;(c) Table 5 中 Claude-Sonnet-3.7 仅 class-IF=61.48,gpt-5 整行空白,因此正文里的具体数字无法被验证。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 2:Table 5 与 Table 11 中 gpt-5、Claude-Sonnet-3.7 存在大面积数据缺失

  • 位置:Page 7, Table 5;Page 16, Table 11
  • 描述:Table 5 中 gpt-5 整行的数值全部为空,Claude-Sonnet-3.7 仅 classification-IF=61.48 一项;Table 11 中同样存在大面积空白(gpt-5 整行空白、Claude-Sonnet-3.7 仅 class-IF=61.52 一项)。论文仅以脚注"2"标注了 gpt-5 的 licensing restrictions 解释,但未对 Claude-Sonnet-3.7 行的空白做任何解释。然而正文章节 4.3 又以这些缺失数据为依据宣称 Claude-Sonnet-3.7 与 gpt-5 是"top-performing",读者无法独立验证这些排名。
  • 证据:原文 Table 5 与 Table 11 中 gpt-5 行空、Claude-Sonnet-3.7 行仅 class-IF 一项;正文 Section 4.3 直接引用缺失行的数值。
  • 反方论证:可能存在合法技术原因(gpt-5 与 Claude-Sonnet-3.7 的 API 在某些评测批次返回异常或 timeout,论文作者如实保留空值)。但 (a) 论文并未在正文中解释 Claude-Sonnet-3.7 为何也整行空白(仅在脚注解释了 gpt-5 的 licensing 原因),(b) 即便如此,作者却基于这些缺失数据写出"top-performing"叙述,这是逻辑漏洞;(c) 整段排名叙述与表格脱节,证据链断裂。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 3:不同 SFT 策略在 classification-IF 上产生完全相同的绝对增益

  • 位置:Page 8, Table 6
  • 描述:Table 6 报告 Qwen3-32B 经四种 SFT 策略(FV / AV / BV / DV)后各指标的绝对提升值(superscript)。其中 SFT-FV 与 SFT-AV 在 classification-IF 上的绝对增益都标注为 "+23.43",且基线值与训练后值都为 40.54。考虑到这四种 rejection-sampling 策略(FV=Fastest-Valid / AV=All-Valid / BV=Best-Valid / DV=Duo-Valid)使用了完全不同的数据筛选逻辑(基于速度、覆盖率、最佳得分、双重过滤),它们最终在 classification-IF 这一指标上精确到两位小数地得到完全相同的得分(40.54)与完全相同的绝对增益(+23.43),统计学上极不自然。
  • 证据:原文 "Qwen3-32B SFT-FV 40.54+23.43" 与 "Qwen3-32B SFT-AV 40.54+23.43"——同一基线 17.11 + 两种不同采样策略 → class-IF 上完全相同的训练后值 40.54 与绝对增益 +23.43。
  • 反方论证:可能是因为 (a) AV 与 FV 实际上选取了高度重合的训练子集,或 (b) 测试集本身过小(仅 74 条测试任务)使得分数被精度限制在离散格点上,(c) 类别判定恰好撞到边界。然而论文 Appendix L 已明确说明 FV/AV/BV/DV 各自的判定逻辑差异显著(BV=DV 还要套用多样性约束),仅在测试分数上完全一致无法解释为合理实验设计的自然结果——这正是"不同采样策略应当产生不同输出分布"的标准假设的违反。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 4:Table 3 中 Train/Test 领域分布出现显著偏移

  • 位置:Page 6, Table 3
  • 描述:Table 3 报告 Train/Test 的领域分布。Train 集中 Education=2.8%、Environment=6.8%;Test 集中 Education=3.1%、Environment=2.4%。Environment 从 6.8% 跳到 2.4%(下降约 65%),Business 从 7.3% 跳到 8.2%,Technology 从 4.0% 跳到 5.6%,Automotive 从 4.5% 降到 3.3%。在论文声称的 95/5 划分(most recently updated tasks 为 test set)下,Train 与 Test 的领域分布理应高度接近,但实际出现了多处大幅偏移,论文正文中也未对此做任何讨论或归因。
  • 证据:原文 Table 3:Train: "Finance 16.9% Health 10.2% Business 7.3% Technology 4.0% Automotive 4.5% Education 2.8% Environment 6.8% Others 47.5%";Test: "Finance 17.1% Health 8.4% Business 8.2% Technology 5.6% Automotive 3.3% Education 3.1% Environment 2.4% Others 51.9%"。
  • 反方论证:可能是因为 test 集是"most recently updated"的 Kaggle 任务,而 Kaggle 上不同年份不同领域的新增任务数本身就不均匀(可能某段时期 Environment 类数据集上传较少),这是良性解释。但 (a) 论文没有提供任何关于"most recently updated"是否做过领域分层抽样的说明;(b) Environment 从 6.8% 跌至 2.4% 是单点大幅跳变(绝对值 -4.4pp,相对降幅 65%),在仅占总样本 5% 的 test 集上仍能呈现如此大幅的分布漂移,说明 test 抽样明显偏离了 train 的总体分布,构成"分布不对齐"的客观证据。
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 5:Figure 1 / Figure 2 / Figure 3 存在 copy-move 复制粘贴信号

  • 位置:Page 1 (Figure 1)、Page 4 (Figure 2)、Page 8 (Figure 3)
  • 描述:机器取证检测到:(I2) img-111.png 在偏移 (32,0) 处有 25 对 copy-move 匹配块;(I3) img-112.png 在偏移 (32,0) 处有 56 对 copy-move 匹配块;(I5) img-113.png 在偏移 (32,0) 处有 24 对 copy-move 匹配块。三张图的 copy-move 信号一致地落在同一偏移 (32,0),且都达到 24 对以上,跨图呈现规律性。该论文 Figure 1 是流程示意图(图标与边框构成大量规则重复元素),Figure 2 是四步骤彩色流程图(包含规则边框),因此 copy-move 信号存在被规则 UI/图标元素触发的可能;但 (32,0) 这一特定偏移在三张不同内容图中重复出现 24-56 对,说明并非随机。
  • 证据:机器取证证据 I2/I3/I5 报告。
  • 反方论证:(a) Figure 1/2/3 均为概念性示意图,本身含有大量规则重复元素(图标边线、流程框、网格线),LaTeX→PDF→PNG 渲染管线在栅格化后也会产生规则像素重复;(b) 单张图中 24-56 对匹配(块尺寸 32px)在 1024×768 级别的示意图中属"小占比",可由图标/边框自然触发。但 (a) 良性解释(统一导出管线)在原文中无明确方法学正面支持(论文未声明统一的图像渲染管线),仅为通用托辞;(b) 三张图同时出现同一偏移的 copy-move 信号具有规律性,提示存在批量相似而非偶然;(c) 即使每一张单独可解释为良性,三张图同时出现的规律性本身即构成信号强度。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(LaTeX 栅格化产生规则像素重复与图标/边框规则元素),但所提良性解释在原文中无正面支持,仅为推测,保留作为信号线索。

发现 6:Benford 联合检验严重偏离

  • 位置:全文数值(Page 6-10 表格)
  • 描述:机器取证检测到:第 1 位数字显著偏离(MAD=0.0630, χ²=92.3, p=0.0000)、第 2 位数字边缘异常(MAD=0.0201, χ²=20.8, p=0.0134)、第 3 位数字显著偏离(MAD=0.0439, χ²=136.0, p=0.0000)、第 4 位数字显著偏离(MAD=0.0721, χ²=358.3, p=0.0000);末位数字分布不太均匀(χ²=21.4, p=0.0111)。
  • 证据:机器取证证据 S1/S2 报告。
  • 反方论证:Benford 检验的前提是"数据来自自然形成、跨数量级、未被人为修改的真实测量"。本论文中的数值是 LLM 基准测试分数,被限制在 0-100 区间、经过小样本(每任务 3 次重复)取均值,并经过 clipped R² 处理(人为限制在 [0,1])。这些处理直接破坏了 Benford 检验的前提——经过裁剪和均值化的百分制分数不再满足"跨数量级自然分布"。同理,末位数字检验在两位小数精度的人工测量数据上也会失真。因此该检验对本论文不适用,所报告的显著性更多反映数据生成管线的人为特征,而非数据造假。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(Benford/末位检验前提不满足:数据为 0-100 区间的 LLM 基准分数,经裁剪与取均值处理,破坏跨数量级自然分布前提)

发现 7:AI 文本特征轻微(信息性)

  • 位置:全文
  • 描述:AI 生成文本检测得分 0.20/1.0,属轻微 AI 特征;论文附录 B 明确承认 "LLMs were used as assistive tools. Specifically, we used LLMs to polish the writing of the paper and to assist in finding related works",与轻微 AI 特征吻合。
  • 严重程度:🟢(信息性)
  • 复核状态:⚠️ 依据不足(论文已声明 LLM 用于润色,与轻微 AI 特征互证;不构成学术不端)

【以下为复核中被剔除的发现】

发现 4(Qwen3-4B RL 后 time-CF 出现"刚好"0.07 的非零值) —— 复核状态:原报告中"0.07"这一数字在 Table 6 中实际为 2.28,且多个 SFT 变体在 time-CF 上的 +0.00 增益是合理数学事实(基线 0.00 → 训练后 0.00)。反方论证:clipped R² 在 [0,1] 区间,零附近的微小分数(小数据集 3 次重复的均值)确实可能为 0.00 或出现微小非零值,这一现象本身无异常信号。结论不成立,删除。

发现 6(Table 8 与 Table 10 外部验证结果内部矛盾) —— 复核状态:经核验 Table 8 与 Table 10 中 Qwen3-32B Baseline=32.38 与 SFT-DV=42.41 在两个表中完全一致,不存在数学矛盾。Table 10 中 DataWiseAgent 得分 29.17 < Qwen3-32B Baseline 32.38 这一现象可由"专门为 DSBench 设计的智能体在转换为 DARE-bench 格式后未必适配"解释,属合理实验结果,张力不构成造假证据。结论不成立,删除。

发现 9(gpt-4.1 vs gpt-5 相对排序与正文章节叙述不符) —— 复核状态:Table 5 中 gpt-5 行整行空白,无法与 gpt-4.1 排序比较;正文 Section 4.3 实际表述为"Claude-Sonnet-3.7 emerges as the top-performing model"+"gpt-5 leads the two IF columns",并未单独把 gpt-4.1 描述为 top 模型,因此不存在"gpt-4.1 排序与正文叙述不符"的明确矛盾。该发现描述模糊,依据不足。结论不成立,删除。

发现 10(AI 文本特征轻微) —— 已合并为发现 7(信息性)保留。


耿同学辣评

这篇 DARE-bench 是给"大模型智能体"出考卷,结果它自己的"考卷"先被人挑出了几道错题——同一项 classification-IF 的最高分 69.81 同时挂在 Claude-Sonnet-3.7 与 gpt-5 两个模型名下、正文里"four of the six"指标说法却列出了 5 个数值、四种不同 rejection-sampling 策略竟然能在 classification-IF 上撞出完全相同的绝对增益 +23.43、Table 5 中 gpt-5 整行空白却还能被称为"top model"、Train/Test 领域分布中 Environment 从 6.8% 跳到 2.4%——这些加在一起,已经构成 🟠 高度可疑的合理门槛。需要说明的是:这是一篇机器学习基准论文,没有 Western blot、没有流式细胞图,图像层面的 copy-move 信号可由 LaTeX 栅格化的规则图标元素触发;Benford 检验对 0-100 区间的百分制分数本来就不适用。因此我的判定是:🟠 高度可疑,不是 🔴 实锤,但已经达到建议作者补全 Table 5、修订 4.3 节矛盾叙述、提供 SFT-FV/AV 训练数据细节以解释完全相同绝对增益的程度。

建议后续行动

  • 联系作者要求提供 Table 5 / Table 11 中 gpt-5 与 Claude-Sonnet-3.7 的完整数值,并解释 Claude-Sonnet-3.7 行空白的原因
  • 建议作者修正正文章节 4.3 中关于 "four of the six evaluation metrics" 与 5 个数值列之间的矛盾叙述,以及同一 69.81 同时归给两个模型的冲突
  • 建议作者解释 Table 6 中 SFT-FV 与 SFT-AV 在 classification-IF 上得到完全相同绝对增益 (+23.43) 的具体原因(采样策略差异 → 数据子集差异 → 输出差异的传导链)
  • 在 PubPeer 上提出 Table 5 数据缺失与正文叙述不一致的质疑
  • 建议作者在正文中讨论 Table 3 中 Train/Test 领域分布的偏移(特别是 Environment 从 6.8% 到 2.4%),并补充抽样方法说明
  • 暂不建议向期刊编辑部举报(本论文未达到系统性造假门槛,但已构成"叙述与数据脱节"的诚信风险)

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。



🧮 证据合成(自动生成)

  • 综合后验概率:99.8%(先验 5%)
  • 95% 可信区间:[98%, 100%]
  • 贝叶斯因子:BF = 1.08e+4(决定性(decisive))
  • 综合评级:🔴 高度疑似
  • 复核已排除线索:12 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)

贡献最高的证据

  1. [T1] AI 生成文本特征(text/ai_generated,logLR=1.97)— 贡献 20.9%
  2. [发现2] Table 5 / Table 11 中 gpt-5 整行数据为空,Claude-Sonnet-3.7 同样大面积缺失,但论文脚注只解释了一条粘性标签,未给出 gpt-5 的实际数值。(llm/*,logLR=1.59)— 贡献 20.2%
  3. [发现3] 两种不同 rejection-sampling 策略 (FV 与 AV) 在 classification-IF 上得到完全相同的绝对增益 +23.43,与其声称的策略差异矛盾。(llm/*,logLR=1.59)— 贡献 14.9%
  4. [发现4] Qwen3-4B 基线与所有 SFT 变体在 time-CF 上均为 0.00,而 RL 变体恰好出现非零的 2.28,与其他变体的 .00 突变缺乏渐进过渡。(llm/*,logLR=1.08)— 贡献 12.6%
  5. [发现6] DataWiseAgent 在 DSBench 上得分 29.17,反而低于 Qwen3-32B 通用基线 32.38,与论文称 DataWiseAgent 为'state-of-the-art specialized agent'的表述存在张力。(llm/*,logLR=1.08)— 贡献 11.8%

免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。