Loading...
正在加载...
请稍候

DARE-bench: A Benchmark for Data Science Agent

2026-08-14 16:12

🔍 耿同学打假报告

论文信息

  • 标题:DARE-bench: A Benchmark for Data Science Agent
  • 作者:Fan Shu, Yite Wang, Ruofan Wu, Boyi Liu, Zhewei Yao, Yuxiong He, Feng Yan
  • 期刊:Published as a conference paper at ICLR 2026
  • DOI:arXiv:2602.24288v1
  • 发表年份:2026 (arXiv 提交日期 27 Feb 2026)
  • 论文来源:2602.24288v1.pdf

综合评定:🟠 高度可疑

详细发现

发现 1:Table 5 内部数学不自洽(gpt-5 整行缺失且 Claude-Sonnet-3.7 行数值与正文叙述冲突)

  • 位置:Table 5 / Page 7 / §4.3
  • 描述:Table 5 中 gpt-5 整行仅显示行名而无任何数值;Claude-Sonnet-3.7 行仅在 class-IF 列出现 61.48(该行其余列一并缺失)。然而论文 §4.3 明确声称 "Claude-Sonnet-3.7 emerges as the top-performing model. It achieves the highest scores on four of the six evaluation metrics: 'classification-IF' (69.81), 'classification-MM' (61.03), 'regression-MM' (63.20), 'time-series-XF' (49.88) and 'time-series-CF' (13.70)"。同时声称 "gpt-5 leads the two IF columns, achieving the highest 'classification-IF' (69.81) and 'regression-IF' (57.24)"。两段叙述在 class-IF 上同时声称 69.81 为各自最高分,数学上不能同时成立;而 Table 5 中 Claude-Sonnet-3.7 class-IF 实为 61.48,与正文 69.81 直接矛盾。
  • 证据:原文 "Claude-Sonnet-3.7 emerges as the top-performing model. It achieves the highest scores on four of the six evaluation metrics: 'classification-IF' (69.81), 'classification-MM' (61.03), 'regression-MM' (63.20), 'time-series-XF' (49.88) and 'time-series-CF' (13.70)" 与 "gpt-5 leads the two IF columns, achieving the highest 'classification-IF' (69.81) and 'regression-IF' (57.24)";Table 5 实际显示 "Claude-Sonnet-3.7 61.48"(仅此一格),"gpt-5" 整行数据缺失。
  • 反方论证:良性解释包括:(a) 排版错误导致部分数据漏印;(b) 数值计算错误;(c) 复审时手稿更新未同步。但原文未提供任何方法学解释支持此类"漏印"假设,且 class-IF 69.81 同时被两个模型各自宣称最高分这一数学矛盾无法用单次排版错误解释——属于核心数据报告不完整且叙述自相矛盾,保留作为强证据。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 2:Table 4 超参数-分数非单调性与混淆变量

  • 位置:Table 4 / Page 6 / §4.2
  • 描述:Table 4 报告 o4-mini 在六种 (turns, time) 配置下的分数,turns 从 3→15,time 从 300→100 同时变化;class-IF 从 37.16 单调递增到 76.80,但 reg-IF 在 (10,100) 处出现 62.31(低于 (8,120) 的 65.21),class-MM 在 (5,200)→(6,180) 也跳到 61.07。两个变量同时变化导致无法分离各自驱动因素,属于混淆变量未受控的报告。
  • 证据:Table 4 原文数据:"3 300 37.16 55.44 29.71 51.69 37.99 6.67 / 5 200 67.56 57.89 53.62 57.60 42.29 9.67 / 6 180 73.42 61.07 63.76 60.92 41.59 9.79 / 8 120 73.87 61.42 65.21 61.05 42.11 8.82 / 10 100 75.22 63.36 62.31 62.07 42.03 10.97 / 15 100 76.80 65.88 66.66 62.41 40.03 9.92";原文 §4.2 "performance generally improves with a higher number of interactive turns",将总体趋势归因于 turns 但变量并非单独变化。
  • 反方论证:良性解释包括:(a) 作者已明确将该趋势归因于 turns,并选择 (5, 200s) 作为折中配置;(b) 超参数扫描常见的"步进式提升"形态可能反映真实模型行为。原文确实说明在 (5, 200s) 寻找平衡点,并非声称做了受控消融;但混淆变量的实验设计本身构成方法学缺陷,且非单调点未在正文中得到解释。降级为存在疑点。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在疑点(turns 与 time 同时变化构成混淆,原文未做受控消融,但作者确实明确以"折中配置"为目的进行扫描)

发现 3:Benford 联合检验严重偏离 [S1]

  • 位置:Tables 3–11 全文数值
  • 描述:机器取证对全文数值做 Benford 检验,4 个位次(前 4 位数字)中 3 个位次显著偏离(第 1 位 χ²=92.3、第 3 位 χ²=136.0、第 4 位 χ²=358.3,p 均为 0.0000),MAD 最大达 0.0721。Benford 检验适用于自然产生、跨数量级的实验/测量数据;本论文绝大多数分数落在 [0, 100] 受控区间(macro-F1/accuracy/R² clipped),不满足 Benford 检验前提条件(数据应跨多个数量级且非受控范围)。检验前提不满足时,统计显著不能解读为"人为操纵"信号。
  • 证据:机器取证原文:"第1位数字 显著偏离(MAD=0.0630, χ²=92.3, p=0.0000);第2位数字 边缘异常(MAD=0.0201, χ²=20.8, p=0.0134);第3位数字 显著偏离(MAD=0.0439, χ²=136.0, p=0.0000);第4位数字 显著偏离(MAD=0.0721, χ²=358.3, p=0.0000)"。
  • 反方论证:良性解释为 Benford 检验前提不满足——本论文分数均落在 [0, 100] 区间(如 accuracy、macro-F1、clipped R²),属于受控范围数据,Benford 对受控范围数据不适用;检验前提明确不满足。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(Benford 检验前提不满足:分数均落在 [0,100] 受控区间,不符合 Benford 对自然跨数量级数据的要求)

发现 4:嵌入图像检测到 copy-move 复制粘贴 [I2, I3, I5]

  • 位置:img-111.png(图1 系统流程概念图)/ img-112.png(图2 pipeline 流程图)/ img-113.png(图3 任务示例截图合成)
  • 描述:机器取证在 3 张图上均检测到偏移 (32,0) 处的 copy-move 匹配块,分别 25 / 56 / 24 对;偏移量在像素上完全一致(32 像素水平偏移、0 垂直偏移),且图 2 匹配最多(56 对)。
  • 证据:机器取证原文:"img-111.png copy_move 🚨 检测到 copy-move 复制粘贴:偏移 (32,0) 处 25 对匹配块"、"img-112.png copy_move 🚨 检测到 copy-move 复制粘贴:偏移 (32,0) 处 56 对匹配块"、"img-113.png copy_move 🚨 检测到 copy-move 复制粘贴:偏移 (32,0) 处 24 对匹配块"。
  • 反方论证:良性解释为:3 张图均为概念示意图/流程图/示例截图,规则重复的元素(多面板边框、刻度线、模块色块、文本框边缘、示例表格行)容易在 Fridrich 块匹配中产生同偏移误报;水平 32 像素恰好对应示意图中重复排列的模块间距。原文 caption 描述 Figure 1 为 "DARE-bench defines each task by providing a natural-language question and structured files (metadata and train/test splits). An LLM agent executes code within a sandbox to generate predictions, which are compared against ground truth for automatic and reproducible evaluation",Figure 2 为四阶段数据 pipeline,Figure 3 为任务示例截图——均为典型规则重复排版的设计示意图,符合良性解释前提。"同偏移批量出现"虽构成信号强度,但原文中确实存在支持良性解释的正面信息(图注明确为概念示意图/示例截图)。降级保留。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(3 张图均为概念示意图/流程图/任务示例,原文 caption 明确,规则重复元素易产生同偏移误报)

发现 5:图 1–图 3 噪声方差不一致 [I1, I4]

  • 位置:img-111.png / img-113.png
  • 描述:噪声方差 CV 分别为 0.45(251 个有效块)和 0.84(104 个有效块),提示图像内不同区域可能经过不同后处理或不同来源拼接。
  • 证据:机器取证原文:"img-111.png noise_variance ⚠️ 噪声方差不一致(异常块 2,CV=0.45)" 与 "img-113.png noise_variance ⚠️ 噪声方差不一致(异常块 0,CV=0.84)"。
  • 反方论证:良性解释为:扫描件/翻拍件天然带照明梯度;图 3 是任务示例截图合成(包含训练/验证表+Python 代码+评估结果三种异质内容),不同区域自然具有不同噪声特性。原文 Figure 3 caption 描述为 "Example of an instruction-following task where the agent fails to respect explicit constraints",包含异质内容拼接,与良性解释相符。降级保留。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(Figure 3 为异质内容示例截图合成,原文 caption 明确,不同区域自然噪声特性不同)

发现 6:方法部分指标描述与附录参考实现不完全匹配

  • 位置:§3.2 Evaluation metrics / Appendix J Reference Code
  • 描述:正文 §3.2 称对 classification-MM 使用 macro-F1,但 Appendix J 的参考代码 train_predict_model 实际输出 accuracy_scoreclassification_report,未在参考实现里显式计算 macro-F1。
  • 证据:原文 §3.2 "Specifically, we adopt the macro-F1 score for classification-MM tasks to account for class imbalance";Appendix J 参考代码 accuracy = accuracy_score(y_eval_clean, y_pred_clean)print(classification_report(y_eval_clean, y_pred_clean)),未显式计算 macro-F1。
  • 反方论证:良性解释为:Appendix J 展示的是参考实现片段截取,分类报告打印中已隐含 per-class F1 计算(macro-F1 可由 classification_report 输出或 f1_score(..., average='macro') 派生),属于"参考实现展示指标与最终评分指标不完全一一对应"的常见情况,原文未声称参考实现是最终评分代码。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(参考实现片段与最终评分代码可能不一致,原文未声明二者等价)

发现 7:AI 生成文本特征 [T1]

  • 位置:全文
  • 描述:机器取证检测到轻微 AI 生成特征(得分 0.20/1.0),属"润色工具辅助"水平,且作者在 Appendix B 明确声明使用 LLM 抛光文本。该项分数较低,不构成独立红旗。
  • 证据:机器取证原文:"⚠️ 轻微 AI 特征(得分 0.20/1.0),可能为润色工具辅助";论文 Appendix B 原文:"In this project, LLMs were used as assistive tools. Specifically, we used LLMs to polish the writing of the paper and to assist in finding related works."
  • 严重程度:✅
  • 复核状态:⚠️ 依据不足(得分 0.20 较低,作者已在 Appendix B 声明 LLM 用于文本抛光)

耿同学辣评

一篇号称 ICLR 2026 的 benchmark 论文,主表 Table 5 里 gpt-5 整行数据蒸发了,Claude-Sonnet-3.7 在表里 class-IF 写 61.48,正文里却把它和 gpt-5 同时吹成 69.81——同一篇论文里同一个指标能有两个"最高分",还能各自声称拿了全 benchmark 第一?这是 benchmark 还是 bench-mark-etting-paper?连自家主表都对不齐的数字游戏,后续 SFT/RL 增益的可信度直接打个问号。叠加超参数扫描 turns 与 time 同时变化、未做受控消融的方法学硬伤,这篇 paper 的实验严谨性已经破了一个大洞;Benford 与图像取证线索虽因检验前提/示意图性质各有良性解释降级保留,但当全文唯一的核心主表出现数据蒸发+叙述自相矛盾这种"硬伤"时,统计/图像线索已经不那么重要了——先把表补齐、把数字对上了再来谈吧。

建议后续行动

  • 联系作者要求提供 Table 5 完整原始数据(特别是 gpt-5 整行与 Claude-Sonnet-3.7 全行)
  • 要求作者澄清 §4.3 正文叙述与 Table 5 之间的 class-IF 最高分冲突(Claude-Sonnet-3.7 69.81 vs gpt-5 69.81)
  • 在 OpenReview 上提出关于 Table 5 数据缺失与叙述不一致的质疑
  • 向 ICLR 2026 程序主席/领域主席举报该论文的核心数据完整性问题
  • 要求作者补充 Table 4 的受控消融(固定 time 扫 turns 与固定 turns 扫 time),分离两变量各自贡献

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。