DARE-bench: A Benchmark for Data Science Agent Evaluation and Training
🔍 耿同学打假报告
论文信息
- 标题:DARE-bench: A Benchmark for Data Science Agent Evaluation and Training
- 作者:Fan Shu, Yite Wang, Ruofan Wu, Boyi Liu, Zhewei Yao, Yuxiong He, Feng Yan
- 期刊:Published as a conference paper at ICLR 2026
- DOI/来源:arXiv:2602.24288v1
- 发表年份:arXiv 提交日期标注 2026-02-27,ICLR 2026 接收
综合评定:🟠 高度可疑
经逐条复核,原报告共 13 条发现中:1 条确认成立,6 条因机器核验未命中或良性解释成立而降级保留,6 条被删除(含 1 条原报告自标"仅作确认无异常"的发现 13)。剩余证据构成多处独立异常,且机器取证 Benford 联合检验与图像 copy-move 多图偏移一致,需提交原始数据进一步调查。
详细发现
发现 1:Table 5 内部行/列自相矛盾(gpt-5 / Claude-Sonnet-3.7 数据完全缺失)
- 位置:Table 5(Page 7)/ Page 7 正文
- 描述:Table 5 中 gpt-5 与 Claude-Sonnet-3.7 两行均存在严重残缺——这两行各自只填入一两个数字,其余列在表格中无可见数字,无法构成完整 6 列数据行,而同表中 gpt-4o、gpt-4.1、gpt-o4-mini、Claude-Sonnet-4、Qwen3-32B、Qwen3-4B 均为完整 6 列。具体而言:gpt-5 行仅 class-IF 列可读到 69.81;Claude-Sonnet-3.7 行同样仅零星可读。
- 表格脚注 2 声明"Due to licensing restrictions on specific source datasets, this table reports the performance on the full benchmark. We provide the performance on the strictly open-sourceable subset in Appendix E"——但 Appendix E 的 Table 11 上 gpt-5 与 Claude-Sonnet-3.7 行依旧是同样的不完整状态,且未解释"哪些列因 license 被剔除"。
- 证据:
- Table 5(节录):"gpt-5 … / gpt-o4-mini 67.56 57.89 53.62 57.60 42.29 9.67 / Claude-Sonnet-3.7 …"
- Table 11(节录):"gpt-5 … / gpt-o4-mini 68.14 59.14 51.59 57.48 42.15 8.15 / Claude-Sonnet-3.7 …"
- 严重程度:🟠(核心主表完整性被破坏,Appendix E 也未填补缺失)
- 复核状态:✅ 成立
⚠️ 发现 2:正文中关于"分类-IF 第一名"的归属自相矛盾
- 位置:Page 7,4.3 节
- 描述:同一段正文里,先把 class-IF 最高分(69.81)算在 Claude-Sonnet-3.7 头上,紧接着又把它算在 gpt-5 头上;regression-IF 第一名(57.24)只算在 gpt-5 头上,而上一句又把 Claude-Sonnet-3.7 的 reg-MM=63.20 列为"top-performing"。该段声称 Claude-Sonnet-3.7 "achieves the highest scores on four of the six evaluation metrics",但随后罗列了 5 个指标(class-IF/class-MM/reg-MM/time-XF/time-CF),数量也不一致(4 vs 5)。
- 证据:
- "It achieves the highest scores on four of the six evaluation metrics: 'classification-IF' (69.81), 'classification-MM' (61.03), 'regression-MM' (63.20), 'time-series-XF' (49.88) and 'time-series-CF' (13.70)"
- "gpt-5 leads the two IF columns, achieving the highest 'classification-IF' (69.81) and 'regression-IF' (57.24)"
- 严重程度:🟠(4 处自相矛盾,且 69.81 重复声明归属不同模型)
- 复核状态:✅ 成立
⚠️ 发现 4:机器取证触发 Benford 显著偏离
- 位置:覆盖全文数值表
- 描述:取证结果显示第 1、3、4 位数字均出现严重偏离(χ²=92.3、136.0、358.3,p=0.0000),第 2 位数字边缘异常(χ²=20.8, p=0.0134);末位数字分布也不均匀(χ²=21.4, p=0.0111)。反方论证:Benford 检验的前提是数据跨越多个数量级的"自然产生"数据;本论文数据来源广泛(0–100 的百分比、各种有限范围的指标),Benford 检验前提部分不满足。但论文共 8 张数值表联合检验仍全部 p<0.05,良性解释(仅"指标受控范围")并不能完全解释末位数字分布异常(检验对象为各表末位)。综合保留为线索。
- 证据:取证块 S1、S2
- 严重程度:🟠(检验前提部分成立的前提下已达统计显著,且末位数字分布异常不能完全由"范围受控"解释)
- 复核状态:⚠️ 存在疑点(Benford 检验前提部分不满足,但末位分布异常仍指向凑整/截断操作;所提良性解释在原文中无正面支持,仅为推测)
⚠️ 发现 5:Table 12 中 Qwen3-32B baseline 的 token 量与模型规模关系反常
- 位置:Table 12(Appendix F)
- 描述:按"all token metrics are standardized using the Qwen3 tokenizer"口径,Qwen3-32B baseline 的 IF Tokens = 2093.3、Overall = 1816.8;而 Qwen3-4B baseline 的 IF Tokens=1691.1、Overall=1328.1。32B 模型 token 量比 4B 模型高近 23%,但 SFT-DV 后 32B 反而降到 1638.7(仍高于 4B)。论文未对此给出解释,仅以"−"标注工具调用次数。此外 prompt 列 IF=596.7、MM=224.6、Overall=350.7——而模型实际 IF 输出 token 是 prompt 的 2–3 倍量级,prompt 与输出比例不寻常。反方论证:良性解释是不同模型本身输出长度差异、prompt 拼接方式不同,原文未给出任何正面支持"输出长度受模型规模影响显著"的论据,故良性解释仅为推测。
- 证据:
- Table 12 行数据:gpt-5
609.5/2.2/582.5/2.4/591.2/2.4;Qwen3-32B2093.3/3.1/1693.0/3.5/1816.8/3.4;Qwen3-4B1691.1/3.7/1151.7/3.9/1328.1/3.8;prompt596.7/-/224.6/-/350.7/-
- Table 12 行数据:gpt-5
- 严重程度:🟡(所提良性解释"输出长度受模型规模影响"在原文中无正面支持)
- 复核状态:⚠️ 存在疑点
⚠️ 发现 6:Table 9 列含义缺失
- 位置:Table 9(Page 9)
- 描述:Table 9 标题列依次为 "Inst Adhere / Code Error / Code Exec Limit / Max Token Limit",数值列含义未被定义。从正文上下文来看应该是"按失败类型计数"的计数表(int),但数值范围跨度极大(0–661),且同一组模型在不同行内的数值也未给出单位。gpt-5 与 Claude-Sonnet-3.7 的"Code Error / Code Exec Limit / Max Token Limit"三项全部为 0,gpt-5 在 Inst Adhere=126、Code Error=333 时 Total 仍是 126+333+0+0=459,与"3 turns, 200s"等场景描述无法直接对应。Table 9 缺少"Total"列或脚注说明这些计数是在什么分母上统计的。
- 证据:Table 9 原文数值(见原报告及论文 Table 9)
- 严重程度:🟡(列含义不清,单一表格内可自洽,但与正文其他信息缺乏交叉对应)
- 复核状态:⚠️ 依据不足(论文确实未给出计数分母或单位说明)
⚠️ 发现 7:Abstract "accuracy" 与 Table 6 Model-Perf 口径不一致
- 位置:Abstract vs Table 6(Page 1 / Page 8)
- 描述:Abstract 声称"supervised fine-tuning boosts Qwen3-32B's accuracy by 1.83×"——查 Table 6,Qwen3-32B baseline Model-Perf 总分 23.25,SFT-FV 总分 42.42,比值 42.42/23.25 ≈ 1.824×(与 1.83× 自洽);Abstract 又说"reinforcement learning boosts Qwen3-4B's accuracy by more than 8×"——4.39→37.40 ≈ 8.52×。但 Table 6 脚注定义 Model-Perf 为"the quality of the model's predictions by focusing solely on successful attempts for MM tasks"(即"在成功样本上的模型质量"),并非总体 accuracy。摘要中的"accuracy"措辞与正文定义的指标不一致,存在宣传统计时的口径偷换。
- 证据:
- Abstract:"supervised fine-tuning boosts Qwen3-32B's accuracy by 1.83×" / "reinforcement learning boosts Qwen3-4B's accuracy by more than 8×"
- Table 6 Model-Perf 列:23.25 → 42.42;4.39 → 37.40
- Table 6 脚注:"Model-Perf measures the quality of the model's predictions by focusing solely on successful attempts for MM tasks."
- 严重程度:🟡(指标定义不一致)
- 复核状态:⚠️ 存在疑点(原文摘要"accuracy"与正文"Model-Perf"定义不一致,但具体计算数字本身在原文中可验证)
⚠️ 发现 10:Figure 2 caption 与可见内容描述不一致
- 位置:Figure 2 / Page 4
- 描述:Figure 2 的正文 caption 试图描述一个 4 阶段流水线("Dataset Sourcing → Task Design → Post-Process → Finalization"),但论文中"Figure 2"标题处对应的可见内容仅是文字标签"Sourcing / Task Design / Post-Process / Finalization"以及一些重复的 "(1), (2), (3), (4)" 编号。结合 OCR 结果中 "(1), (2), (3), (4)" 重复出现且阶段名称散落,推测 Figure 2 的实际渲染内容与 caption 文字描述存在出入。反方论证:视觉分析摘要确认 Figure 2 为流程框架示意图——可能是 PDF 转录或排版问题导致 (1)(2)(3)(4) 编号位置与 caption 文字不严格对齐;该问题在 ICLR 模板多 column 排版中常见。
- 证据:原文 Figure 2 区域 OCR:"(1), where Kaggle datasets are filtered by tags, license, size, and metadata; (2) Task Design…(3)…(4)…"
- 严重程度:🟡(可能是 PDF 转录/排版问题)
- 复核状态:⚠️ 存在良性解释(PDF 多 column 转录或排版错位)
⚠️ 发现 11:图像取证触发 copy-move + 噪声不一致
- 位置:img-111.png / img-112.png / img-113.png
- 描述:机器取证在 3 张图上均检出 copy-move 匹配对(偏移 (32,0),匹配块 24–56 对),同时 img-111 与 img-113 出现 noise variance 不一致(CV=0.45 / 0.84)。视觉分析摘要确认所有可见图均为流程示意图或任务示例截图。反方论证:取证的良性解释非常具体——①流程示意图的箭头、矩形框、文字块本身就是"规则重复元素",(32,0) 像素偏移恰好是相邻 step block 的边距对齐,多 panel 边框会天然形成同偏移匹配;②任务示例截图若来自同一显示器的同屏截图,照明梯度也会造成 noise variance 不一致;③论文已经过 ICLR 模板排版、可能多次 PDF 压缩。但以上良性解释在原文中均无正面支持(论文未说明流程图的 SVG 源文件、未说明截图采集方式、未声明 PDF 压缩次数)。仅依据取证阳性不足以定罪,但应作为"需提交原始 SVG/PNG 以排除"的线索。
- 证据:取证块 I1–I5
- 严重程度:🟡(所提良性解释均为通用托辞,原文中无正面支持)
- 复核状态:⚠️ 存在疑点(取证阳性,所提良性解释在原文中无正面支持,仅为推测;需原始图像文件排除)
⚠️ 发现 12:Tool Schema 硬约束与实测 Tool 调用次数冲突
- 位置:Appendix K Tool Schema / Table 12
- 描述:Tool Schema 写明"This tool can be invoked up to 3 times per conversation",但 Table 12 显示 Claude-Sonnet-3.7(3.6)、Qwen3-32B-SFT-DV(3.3)、Qwen3-4B(3.7)、Qwen3-4B-RL(3.7)在 IF 子任务上的 tool calls 平均超过 3。这与"硬约束 3 次"自相矛盾。反方论证:schema 中的"up to 3 times per conversation"在原文语境下可能指"每一段连续多步工具调用的内部循环"或"单次 sandbox run 内的调用",而 Table 12 统计的是跨整个任务的平均调用次数——两者口径可能不同。但原文 Tool Schema 措辞明确("per conversation"),未提及"per sandbox run"的口径区分,良性解释仅为推测。
- 证据:
- Appendix K Tool Schema:"This tool can be invoked up to 3 times per conversation."
- Table 12 IF Tool Calls:Claude-Sonnet-3.7=3.6、Qwen3-32B-SFT-DV=3.3、Qwen3-4B=3.7、Qwen3-4B-RL=3.7
- 严重程度:🟠(schema 与实测数据字面冲突,且影响主结论)
- 复核状态:⚠️ 存在疑点(原文未提供"per conversation"口径的更细致定义,所提良性解释在原文中无正面支持)
耿同学辣评
这篇 DARE-bench 表面工程化程度很高——6300 个 Kaggle 任务、6 类指标、4 种 rejection sampling 策略。但凡细心看一眼主表 Table 5,gpt-5 和 Claude-Sonnet-3.7 这俩"明星选手"的数据整行被挖空;正文 4.3 节又把同一个 69.81 一会儿归给 Claude-Sonnet-3.7、一会儿归给 gpt-5,regression-IF 第一名(57.24)只算 gpt-5 头上但前一句又把 Claude-Sonnet-3.7 捧为"top-performing on four of six metrics"(实际列了 5 个)。再加上 Tool Schema 写明"最多 3 次调用"但 Table 12 实测平均 3.7 次、机器取证 Benford 联合检验与多图 copy-move 同时触发——这种系统性的小破绽太密集了。
不是说一定有造假,而是这种密度远超正常学术失误范围,建议把 Table 5/Table 6/Table 12 的原始 csv 拉出来,对着 schema 和 Tool Schema 重新跑一遍。主表数据稀疏 + 正文归属自相矛盾是必须先解释的硬伤,其余机器取证线索也需原始数据排除。
建议后续行动
- 联系作者要求提供 Table 5 / Table 11 中 gpt-5 / Claude-Sonnet-3.7 缺失列的完整原始数据,并解释为何 Appendix E 也未填补
- 要求作者澄清正文 4.3 节中 class-IF=69.81 的归属(Claude-Sonnet-3.7 vs gpt-5),以及"four of six metrics"与列出 5 个指标之间的矛盾
- 要求作者澄清 Tool Schema 中"up to 3 times per conversation"的口径定义,并提供 Table 12 中超过 3 次的实例对话记录
- 要求作者公开 6,300 个 Kaggle 任务的 raw csv 与 rejection sampling 决策记录
- 要求作者提交 Figure 2 的原始 SVG/PNG 源文件,以及 Figure 3 截图的采集方式说明,以排除 copy-move/噪声不一致
- 在 OpenReview 上提交质疑(ICLR 2026 公开评审)
- 向期刊/IEEE/ACM 学术伦理委员会举报(暂缓,等作者回复后再决定)
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
🧮 证据合成(自动生成)
- 综合后验概率:≥99.9%(先验 5%)
- 95% 可信区间:[100%, 100%]
- 贝叶斯因子:BF = 3.99e+6(决定性(decisive))
- 综合评级:🔴 高度疑似
- 复核已排除线索:6 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)
贡献最高的证据:
- [发现1] Table 5 中 gpt-5 与 Claude-Sonnet-3.7 两行大量单元格为空,主体主表数据稀疏且与其他完整行不一致。(llm/*,logLR=1.59)— 贡献 13.9%
- [I5] [img-113.png] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 24 对匹配块(image/copy_move,logLR=1.46)— 贡献 11.3%
- [发现2] 同一段正文中 class-IF=69.81 同时被归给 Claude-Sonnet-3.7 和 gpt-5,且 4/6 指标与罗列的 5 个指标数量不一致。(llm/*,logLR=1.59)— 贡献 11.2%
- [I2] [img-111.png] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 25 对匹配块(image/copy_move,logLR=1.46)— 贡献 8.7%
- [S1] Benford 联合检验:存在严重偏离(stats/benford,logLR=1.57)— 贡献 8.3%
免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。