Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
🔍 耿同学打假报告
论文信息
- 标题:Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
- 作者:Yiwei Li, Wanli Yang, Hexiang Tan, Xiangzhou Huang, Zhengyu Chen, Ziran Li, Borun Chen, Shanglin Lei, Huaisheng Zhu, Hao Tian, Fei Sun, Xunliang Cai, Jingang Wang
- 期刊:arXiv preprint
- DOI:arXiv:2608.13417v1
- 发表年份:2026 (arXiv:2608.13417v1 [cs.AI] 13 Aug 2026)
综合评定:🟡 存疑
详细发现
⚠️ 发现 1:C2 Execution 分数过于压缩,与原始行为差异脱节
- 位置:§3.2 / Figure 4 / Figure 6
- 描述:原文明确报告 C2 Execution 分数范围仅 0.880 到 0.967(跨度仅 0.087),且自述"successful delivery is common across the evaluated models"。同时 Figure 6 显示模型间"builds per round"差异巨大(Gemini-3.1-Pro 7.49 vs GPT-5.5 0.51),"rounds with build errors"亦差异显著(LongCat-2.0 17.1% vs GPT-5.5 0.8%),但 C2 分数却高度压缩——LongCat-2.0(C2=0.888)与 Kimi-K2.7-Code(C2=0.880)在 build 行为差异巨大的情况下获得几乎相同的 C2 分。这提示 C2 指标对 build 错误频次不敏感,存在结构性地板效应或天花板效应。结合 Appendix C.3 的定义(C2 主要由 delivery 成功与否决定,discount 最多降至 0.50),该现象可由原文正面支持的 C2 定义解释,但定义本身是否合理仍属开放问题。
- 证据:原文 Figure 4 "C2 ranges from 0.880 to 0.967";原文 Figure 6 "Kimi-K2.7-Code and LongCat-2.0 obtain nearly identical C2 scores of 0.880 and 0.888, yet LongCat-2.0 performs 4.66 builds per round, and encounters build errors in 17.1% of rounds, compared with 2.70 and 8.5% for Kimi-K2.7-Code";Appendix C.3 的 bounded discount 定义。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(原文 C.3 定义 bounded discount 使 delivery 成功成为主要贡献,build 错误仅做有界折扣,结构性压缩属方法论设计结果而非数据造假;但指标区分度低仍是方法学短板)
⚠️ 发现 2:C2 数据存在 22 次"复算重建"操作,方法选择偏乐观
- 位置:Appendix C.3
- 描述:原文明确承认 139 个 scored runs 中 117 个可通过 transcript replay 在 10⁻⁴ 精度内复现,剩余 22 个 run 因原始 per-commit build artifact 未保留,采用"利用分数必属离散集合 {0, 0.50, 0.60, 0.70, 0.85, 1.00}"反推兼容分母,并在 4 个多解情形中选择"largest compatible denominator"。虽然原文给出了"minimizes the leverage of the removed administrative checkpoint"的解释,但该操作本质上是对缺失数据的回填,且选择"largest"分母偏向乐观值(即分母越大、每点权重越小),方法论透明度高但具体选择无可独立验证。
- 证据:原文 Appendix C.3 "The exported dataset does not retain every original per-commit build artifact. We therefore clean C2 non-destructively and accept a value through one of two auditable paths. For 117 of the 139 affected scored runs, transcript replay reproduces the stored C2 within 10⁻⁴. For the remaining 22, we exploit the fact that every round score belongs to {0, 0.50, 0.60, 0.70, 0.85, 1.00}. ... Four have multiple compatible denominators; for these we use the largest compatible denominator, which minimizes the leverage of the removed administrative checkpoint, and retain the full compatible range as a sensitivity interval."
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(原文明确披露了方法、范围(22/139 ≈ 16% 的 C2 runs)、和敏感区间;选择 largest denominator 有明确的方法学理由;但属"对缺失数据的回填",建议复核原始 build log 保留情况)
⚠️ 发现 3:时间线异常——2026 年前沿模型引用与 arXiv 编号系统
- 位置:§2.1 脚注、References
- 描述:论文声明评估时间为"June 2026 to July 10, 2026",引用了多份标注为 2026 年的模型发布材料:GPT-5.5 system card (April 2026)、Gemini 3.1 Pro model card (February 2026)、GLM-5.2 (June 2026)、Kimi K2.7 Code (June 2026)、LongCat-2.0 (June 2026)、DeepSeek-V4 (arXiv:2606.19348)、Anthropic Claude Opus 4.7 system card (April 2026)。论文本身的 arXiv 编号为 2608.13417(2608 = 2026 年 8 月)。这些日期相对当前日期 2026-08-14 处于"过去约 2-7 个月",时间线在 arXiv 编号系统内自洽(YYMM 格式一致),且参考文献明确标注了 2026 年各月发布信息,不存在与论文自身时间线的直接冲突。但部分 arXiv 引用编号(2603.xxxxx、2606.xxxxx、2607.xxxxx)暗示这些预印本在 2026 年密集发表,与当前真实世界的模型发布历史不在复核者可独立验证的范围内。
- 证据:原文脚注 "Evaluations were conducted from June 2026 to July 10, 2026";References 中各 2026 年标注;arXiv:2608.13417v1。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足(论文时间线在 arXiv YYMM 编号系统内自洽,所有模型日期均在评估窗口之前或同月发布,无直接时间线冲突;但部分"2026 年新模型"的真实发布情况不在复核者独立验证范围内)
耿同学辣评
"这篇论文号称花了约十万美金、跑了 756 次 rollout 评估 7 个前沿 agent,结论是'当前 agent 更像工程优化器而非全自动研究员'——结论本身平淡无奇,但数据处理过程中确实有两个值得注意的'方法学灰色地带':第一,C2 Execution 分数从 0.880 到 0.967,跨度仅 0.087,而 Gemini 跑 7.49 builds/round 跟 GPT 跑 0.51 builds/round 拿到的 C2 分几乎一样——这个指标设计本身就有结构性压缩问题,build 错误率差异 17.1% vs 0.8% 居然在 C2 里几乎看不到区别,建议作者补一个'build-density adjusted C2';第二,139 个 C2 scored run 中有 22 个原始 build artifact 没保留,靠分数'必属离散集合'反推回填,且在 4 个多解情形中选了'最大兼容分母'——虽然作者把方法、范围、敏感区间都写出来了,但这本质上是在用先验假设补缺失数据,建议期刊评审要求作者公开那 22 个 run 的 transcript 原始记录。另外,机器取证提示的 Benford 检验偏离、PRNU NCC=1.000 等统计线索,在'所有图共享同一渲染管线'这一原文已确认的批量导出场景下属于良性同源,不构成造假证据;copy-move 同偏移 (32,0) 的系统性命中也主要是图表模板中重复元素(如多 panel 边框、刻度线)所致。综合来看,这是一篇工程量扎实但过程指标设计需要修订、数据透明度可进一步提升的论文,建议送外审重点审查 C2 公式区分度与缺失数据回填方法。"
建议后续行动
- 联系作者要求公开 22 个 C2 回填 run 的原始 transcript
- 要求作者补充 build-density-adjusted C2 变体分析,验证 C2 指标的区分度
- 在 PubPeer 上提出关于 C2 分数结构性压缩的质疑
- 复核 Appendix C.3 的 sensitivity interval 报告是否完整
- 验证 7 个模型 API 版本与发布日期的真实性
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
特别说明:Benford 联合检验在受控范围/编号类数据上检验前提可能不满足,PRNU 高同源在"同一论文批量导出图表"场景下属良性同源,copy-move 同偏移命中可能由图表模板中的重复元素(多 panel 边框/刻度线)导致而非数据篡改。本报告将所有异常标注为"线索"而非"实锤",最终结论需结合原始数据复核。