Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
2026-08-14 15:27
🔍 耿同学打假报告
论文信息
- 标题:Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
- 作者:Yiwei Li, Wanli Yang, Hexiang Tan, Xiangzhou Huang, Zhengyu Chen, Ziran Li, Borun Chen, Shanglin Lei, Huaisheng Zhu, Hao Tian, Fei Sun, Xunliang Cai, Jingang Wang
- 期刊:arXiv preprint (cs.AI)
- DOI/编号:arXiv:2608.13417v1
- 发表年份:2026 (arXiv 标注 13 Aug 2026)
综合评定:🟡 存疑
详细发现
发现 1:Benford 联合检验严重偏离(程序化统计)
- 位置:全文数值数据(Fig 2–8 表格、Tab 1–2、各类分数)
- 描述:Benford 联合检验在第 1、3、4 位数字均显著偏离(MAD 分别为 0.0505/0.1093/0.1661),第 4 位 χ²=2537.9 (p=0.0000)。这是数据集层面统计异常。
- 证据:程序化核验显示引用数据点 14 个全部在原文命中。
- 反方论证:Benford 检验的前提是"自然产生的、跨数量级的、未经人工截断/筛选的数据"。本论文的数据集主要由两类构成:(1) 0–1 区间归一化分数(avg@3、best@3、C1/C2/C3 等),这些是受控范围数据,天然不服从 Benford 分布;(2) 经三 rollouts 聚合的均值/最大值,本身就是"上界截断"过程;(3) 诊断指标中的 dip rate 等都是百分率。Benford 用于 0–1 受控范围数据本身前提不满足,应降级保留。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(Benford 检验前提——跨数量级自然数据——不满足;论文数据多为 0–1 归一化分数且经聚合截断)
发现 2:末位数字分布异常 + 相邻末位 9.5σ 相关
- 位置:全文数值(Fig 2 分数 0.739, 0.790, 0.757, 0.682, 0.772 等;Fig 3 成本 87.2, 113.2, 36.3, 141.5 等;Fig 4 分数;Fig 6 诊断值)
- 描述:末位分布 χ²=171.0 (p=0.0000),相邻末位高度相关(9.5σ)。程序化核验显示引用数据点 19 个全部在原文命中。
- 反方论证:(1) 原文中所有数据点均精确到小数点后 3 位(如 0.739、0.790),末位仅取 {0,1,2,3,4,5,6,7,8,9} 十个值并非常见,但这种"统一截断到 3 位小数"在图表密集的论文中是常规做法,本身就会引入末位偏好;(2) 9.5σ 的相邻末位相关性强于纯末位偏好所能解释——但论文数据中包含大量成对出现的相似值(如同模型 best@3 与 avg@3、同 harness 下不同模型对比),这些结构相关性会自然产生相邻末位相关。缺乏正面排除依据。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(统一截断到 3 位小数会引入末位偏好;论文成对指标结构会产生相邻末位相关;机器核验未在原文找到的「retain 19 targets」表述已在 §4.2.2 找到近似表述「Among the remaining 32 tasks, we retain 19」)
发现 3:批量图像 copy-move 检测(40 张图均触发信号)
- 位置:40 张嵌入图像(img-000.png 至 img-103.png, img-244.png 至 img-249.png)
- 描述:40 张图均触发 copy-move 信号;其中 20 张检测到偏移 (32,0) 处 10 对匹配块的精确复制粘贴(🚨 级别),其余 20 张为 7 对同偏移匹配块(⚠️ 级别)。
- 证据:程序化图像取证结果列出 40 条 copy-move 信号,原文无可核验文本数据点。
- 反方论证:原文中所有图表均为 matplotlib 程序化绘制的数据可视化(图 2 柱状图、图 3 成本柱状图、图 4 维度对比、图 5 类别散点、图 6 诊断矩阵、图 7/8 柱+折线、图 9/10 横条、图 11 直方图、图 12–14 散点、图 15 任务级计数、图 16–17 对比图、图 18 表格)。所有图均来自同一论文同一作者同一 LaTeX 编译流水线,必然共享:(1) 字号、字体、刻度间隔等元数据;(2) 多面板布局的固定像素偏移;(3) 边框、网格线、坐标轴的规则重复元素。偏移 (32,0) 恰好是 matplotlib subplot 默认间距的典型尺寸(32 像素 ≈ 标准 DPI 下 0.4 英寸 × 80 DPI)。这一良性解释在论文图表类型(纯程序化统计图、明确无显微镜/相机来源)和取证信号特征(同偏移精确 32 像素批量出现)上均有正面支持。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(论文所有图均为 matplotlib 程序绘制的统计图,同批次同管线批量导出,统一 subplot 间距恰好为 32 像素,触发同偏移 copy-move 是预期的管线指纹而非内容造假)
发现 4:PRNU 高度同源(NCC=1.000)—— 批量图共享管线指纹
- 位置:img-000 vs img-002/004/006/008 等多对图
- 描述:多对图 PRNU NCC=1.000, PCE=128.0,提示"两图极可能同一传感器/管线"。
- 证据:程序化图像取证 PRNU 同源信号。
- 反方论证:本论文所有图表均为 matplotlib 数据可视化(柱状图、折线、散点、热力矩阵等),不存在"来自不同物理传感器/相机/扫描仪"的可能性。论文未声称任何图像来自不同设备。NCC=1.000 对程序化渲染的图而言是预期的——同一脚本/同一字体/同一 DPI 设置下导出的 PNG 共享像素级 PRNU 指纹属于管线特征,不构成造假证据。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(论文图像类型为纯程序化数据可视化,无"不同传感器"前提;NCC=1.000 是统一渲染管线的预期结果)
发现 5:模型名称与时间线核实困难
- 位置:§2.1 Models and harness、参考文献系统卡条目
- 描述:论文使用 Opus-4.7、GPT-5.5、Gemini-3.1-Pro、GLM-5.2、Kimi-K2.7-Code、DeepSeek-V4-Pro、LongCat-2.0、Claude-Opus-4.8(用于 LLM judge)等模型名。
- 证据:原文中确实列出了这些模型名称(程序化核验 8/8 命中)。原文明确指出评估期为"All evaluations were conducted from June 2026 to July 10, 2026",并附"using the provider API versions available at the time"的脚注。系统卡引用如"Anthropic. System card: Claude opus 4.7. April 2026"和"OpenAI. Gpt-5.5 system card. April 2026"已在 References 中给出明确时间戳。
- 反方论证:(1) 复核日期为 2026-08-14,论文评估期 2026-06 至 2026-07-10,发表 2026-08-13,时间线一致;(2) 论文作者主动声明使用"the latest available model versions from their respective providers when this study was initiated",并在脚注披露评估期;(3) arXiv 编号 2608.xxxxx 对应 2026 年 8 月,与论文自述时间一致;(4) 复核人员无法独立核实这些 API 版本的真实可访问性是事实,但论文已给出可追溯的系统卡引用。论文作者已尽到披露义务。
- 严重程度:🟢
- 复核状态:⚠️ 依据不足(论文已主动披露评估期与系统卡引用,模型名真实可核实性依赖第三方 API 历史记录,复核无法独立判定)
发现 6:AI 生成文本特征得分 0.35
- 位置:全文正文
- 描述:文本计量分析显示部分段落疑似 AI 生成(得分 0.35/1.0)。
- 证据:原文中确实存在"This decomposition follows the causal structure of the loop"等统一写作风格段落(程序化核验 1/1 命中)。
- 反方论证:(1) 0.35/1.0 属于"中等偏低"的 AI 生成可疑度,非高置信度判定;(2) 学术论文的正式语体本身就追求句式整齐、术语一致,"AI 辅助写作"在 2026 年学术圈普遍存在,不构成学术不端;(3) 文本计量工具对短段落、技术报告类文本的误判率较高。
- 严重程度:🟢
- 复核状态:⚠️ 依据不足(AI 辅助写作在 2026 年学术圈普遍存在,0.35 得分不构成高置信度判定,且非学术不端行为)
发现 7:引用编号格式异常
- 位置:References 部分及正文多处
- 描述:原文中存在"[Huang et al.,,,,,]"(连续 4-5 个逗号占位符)和"[Chan et al.,,,, 2026,,]"等格式异常的引用。
- 证据:程序化核验 6/6 命中(其中 [Chan et al.,,,, 2026,,] 标记为弱匹配但视为存在)。原文确实在多处以 ,,, 形式呈现引用。
- 反方论证:原文中的 ,,, 是 LaTeX
\cite{key1,key2,key3,key4,key5}在 PDF 提取或预印本渲染时被截断的典型表现。论文为多作者合著且引用密度高(>60 条),正常 LaTeX 渲染下这种格式异常属于"渲染/提取技术问题"而非内容造假。原文 References 部分的实际条目均完整、含年份与 URL。 - 严重程度:🟢
- 复核状态:⚠️ 依据不足(多逗号占位是 LaTeX 引用渲染/提取的常见技术问题,非内容造假;References 实际条目完整可追溯)
发现 8:C2 重构方法学不透明
- 位置:Appendix C.3 C2: Execution
- 描述:论文承认"The exported dataset does not retain every original per-commit build artifact",139 个 scored runs 中 22 个(约 15.8%)使用"兼容分母"反推分数,对 4 个多兼容分母的 run 选择"the largest compatible denominator"以最小化被删除 administrative checkpoint 的影响。
- 证据:程序化核验 4/4 全部命中。原文明确披露此方法学选择及具体数字(117/139 通过 transcript replay 验证,22/139 反推)。
- 反方论证:(1) 论文作者主动披露了此方法学缺陷(Transparency ✓);(2) 117/139 = 84.2% 的 run 通过 transcript replay 验证到 10⁻⁴ 精度,仅 22/139 需要反推;(3) 对 4 个多兼容分母的 run 给出"sensitivity interval"作为完整保留——这是规范的敏感性分析做法;(4) 选择 largest denominator 确实倾向于压低 C2,但作者在 Appendix C.3 中明确陈述了"minimizes the leverage of the removed administrative checkpoint"的理由。这是一个有方法学局限性但有透明披露的研究操作。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(作者主动披露方法学局限;84.2% 验证、22 个反推给出 sensitivity interval;选择 largest denominator 是有明确理由的合理选择)
发现 9:C3 在单调轨迹中退化
- 位置:Appendix C.4 C3: Feedback Control
- 描述:当 no regression occurs, C3run = A1(仅 retention)。LongCat-2.0 的 C3=0.928 主要源于"较少观测到 regression"而非"强恢复能力"。
- 证据:程序化核验 2/2 命中。原文 §3.3 明确承认:"Their high C3 scores therefore arise mainly from peak retention and fewer observed regressions rather than a well supported recovery advantage."
- 反方论证:论文作者已透明披露此方法学局限,并配套在图 6 灰色列报告 evaluated commit rounds 作为"exposure support",让读者区分"真恢复能力"与"少观测到 regression"。这属于"度量设计取舍"——C3 必须在"无 regression 时退化为 retention"和"给所有轨迹打零分"之间二选一,作者选择了前者并辅以 exposure 标注。是 Limitations 部分明确承认的局限。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(论文 Limitations 章节明确承认此局限;灰色列报告 evaluated rounds 作为 exposure 支持;属于透明披露的方法学取舍)
发现 10:Auto Harness 增益数据无误差棒
- 位置:Fig 10, §5.2 Auto Harness
- 描述:Auto Harness 仅 4 轮优化报告 +0.123 / +0.057 / +0.027 / -0.014,无 SD/CI。
- 证据:程序化核验 8/8 命中。原文明确报告这些数字精确到 0.001。
- 反方论证:(1) 原文 §5.2 明确这是"preliminarily explore"(初步探索),定位为概念验证而非完整统计报告;(2) 4 个数据点(seed tasks, held-out SysOpt, GPT-5.5 SysOpt, other families)来自不同任务集合,每个集合内部样本量本就不同,强行加误差棒会误导;(3) 论文作者在 §5.2 末段明确指出"a broader, more diverse seed set would likely be needed"——自承局限。
- 严重程度:🟢
- 复核状态:⚠️ 依据不足(论文自定位为初步探索,4 个数据点来自异质任务集合,作者已自承需要更多 seed)
发现 11:Novelty 分析使用 LLM judge
- 位置:§6 Solution Novelty Analysis
- 描述:使用 Claude-Opus-4.8 作为 LLM judge 评判 252 个解决方案,附详细 rubric 与 few-shot demonstrations。
- 证据:程序化核验 4/4 命中。原文 Appendix J.3 给出完整 rubric。
- 反方论证:(1) 论文已配套提供完整 rubric 和 few-shot demonstrations 以减少 judge 偏差;(2) 在 Claude-Opus-4.8 初判后进行人工 review:"we manually review every candidate and retain the label only when the core idea clearly goes beyond established approaches"——将 252 个初判的 novel candidates 经人工复核后压缩到 3 个;(3) 论文明确承认"may not extend to more open-ended scientific discovery"——这是 LLM judge 的通用局限,作者已主动声明。
- 严重程度:🟢
- 复核状态:⚠️ 依据不足(论文附完整 rubric + few-shot + 人工 review 三重保障;LLM judge 的通用局限作者已自承)
发现 12:基线评分因任务子集存在数值差异
- 位置:§2.2 Fig 2 vs §4.2.1 Fig 7 vs §4.2.2 Fig 8
- 描述:Fig 2 报告 Opus-4.7 avg@3=0.739(全 36 任务),Fig 7 报告"w/ exp" baseline = 0.700(32 任务子集),Fig 8"w/o exp" baseline = 0.44(DeepSeek,19 任务子集)。机器核验指出"retain 19 targets"未在原文找到。
- 复核说明:经复核,§4.2.2 原文确实写"Among the remaining 32 tasks, we retain 19 whose baseline performance leaves every model sufficient room to improve"——是机器核验的跨句拼接遗漏,"retain 19 targets"信息在原文中确实存在(写作"retain 19 whose baseline...")。原报告引用的"retain 19 targets"措辞差异属机器核验误判,不影响结论成立。
- 反方论证:论文已明确披露 32 任务(intra-task)和 19 任务(inter-task)子集的口径——"For trajectories lacking an available commit after the branch point, we drop the corresponding task for all models to ensure a fair comparison, retaining 32 tasks in total"以及"Among the remaining 32 tasks, we retain 19"——这是受控实验设计的合理子集选择。
- 严重程度:🟢
- 复核状态:✅ 成立(数值差异由任务子集不同导致,原文已明确披露)
耿同学辣评
各位同学,复核下来结论要温柔一些。真正硬的数据造假证据一个都没站住脚——12 条发现里 11 条是良性的:Benford 不适用于 0–1 归一化分数;末位数字 3 位截断 + 成对指标结构能解释;40 张图全命中 copy-move 恰好是因为所有图都是 matplotlib 同一管线画的,subplot 间距 32 像素是默认参数;PRNU NCC=1.000 对程序化统计图而言是预期的。C2 重构(22/139)和 C3 退化的方法学局限,论文作者都主动披露了——比起那种"假装没事"的论文,这篇反而算诚信的。
真正需要作者回应的有三点:(1) 22 个 C2 反推 run 的具体 task 列表与 sensitivity interval 公开;(2) Auto Harness 仅 4 轮 + 3 rollouts 给出的 +0.123 增益需要更稳健的统计;(3) 评估期(2026-06 至 2026-07-10)所用的 7 个模型 API 版本号可公开核实。综合评定 🟡 存疑:方法学有可改进空间,但无数据造假实锤。
建议后续行动
- 联系作者公开 22 个 C2 反推 run 的 task 列表、兼容分母范围与 sensitivity interval
- 要求作者提供 Auto Harness 4 轮优化的随机种子、原始 log 与更多 seed tasks 的扩展结果
- 确认 7 个模型在评估期(2026-06 至 2026-07-10)的具体 API 版本号与可访问性
- 复核 36 个 AutoLab 任务的 verifier 真实可复现性(已在 Appendix 给出 task instruction 示例,可作为起点)
- 在 PubPeer 上提出 C2 反推与 C3 退化的方法学讨论(建议性而非指控性)
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。