Data Recipes for Agentic Models
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:Data Recipes for Agentic Models
- 作者:Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha 等 (UC Berkeley, Stanford University, JSC 等多家机构联合团队)
- 期刊:Preprint (arXiv)
- DOI:N/A
- 发表年份:2026 (arXiv 提交日期:2026-06-23)
综合评定:🟡 存疑
详细发现
发现 1:图表呈现过于平滑(机器学习中的“完美数据”嫌疑)
- 位置:Figure 1, Figure 3 (依据视觉分析摘要及图注)
- 描述:论文中的核心性能对比曲线(如 SWE-Bench Verified 和 Terminal-Bench 2.0 的 Scaling Law 图表)在视觉上呈现出异常平滑且单调的趋势。例如,Figure 3 中 Method 1 在多个数据集上同时出现极度平滑的平台期,而 Method 3 则呈现完美的持续上升趋势,分离度极高且缺乏交叉。
- 证据:在真实的大规模模型微调(SFT)和强化学习(RL)实验中,由于随机种子、硬件抖动和评估任务采样误差,即便报告了标准误差,数据点通常也会带有明显的毛刺或非线性波动。这种“教科书式”的完美曲线虽然养眼,但高度可疑,不排除作者为了图表美观进行了过度平滑处理,或者只挑选了表现最完美的随机种子。论文原文图注(Figure 3)也描述了 Method 1 从 31.6K 到 100K 出现平台期,而 Method 3 在所有三个基准测试中持续改进,这种极度完美的对比与视觉摘要指出的平滑度异常相吻合。
- 严重程度:🟡
- 复核状态:✅ 成立
发现 2:实验数据逻辑与计算自洽性极高(未发现造假痕迹)
- 位置:Appendix A.3 (Compute-Controlled Ablation)
- 描述:作者在进行控制变量实验(固定 Token 预算对比)时,提供了一个极容易被普通读者忽略但造假者经常编造错误的数学细节:“保留最长片段(9,859行)与随机子样本(14,470行)消耗相同的~145M Token预算”。
- 证据:根据论文原文描述,长片段平均包含更多 Token。经简单心算复核:9859行与14470行的比例约为 0.68,这完美对应了论文中“min-turns filter 比未过滤数据多约 45% tokens”的背景描述(1/1.45 ≈ 0.69)。真实的实验数据往往在这些隐蔽的物理约束上严丝合缝,而本论文的数学约束完全自洽,未见随机编造的迹象。
- 严重程度:✅ (正面证据)
- 复核状态:✅ 成立
发现 3:时间线与工具引用合理
- 位置:References 及 全文背景
- 描述:论文投稿日期为 2026 年 6 月。文中引用并使用了 GLM-4.7-AWQ、Qwen3-32B、GPT-5.3-Codex 等模型作为 Teacher Model 或 Base Model。
- 证据:参考文献列表及原文显示,使用的基座模型 Qwen3 [45] 发布于 2025,Teacher 模型 GLM-4.7-AWQ 对用的 GLM 系列 [41] 发布于 2025,Kimi K2.5 [42] 发布于 2026,且 Table 6 中确实列出了 GPT-5.3-Codex。以论文设定的发表时间线为基准,文中所述使用的工具链和模型版本在时间线上完全成立,未发现“穿越时空”使用尚未发布的模型现象。
- 严重程度:✅ (正面证据)
- 复核状态:✅ 成立
耿同学辣评
搞 AI 的这帮人画图就跟搞生物的画 Western Blot 一样,不用平滑滤镜浑身难受!虽然曲线平滑得像是用贝塞尔曲线手画的(存在轻微的美化嫌疑),但人家附录里把算力账(Token 预算换算)算得清清楚楚、严丝合缝,模型引用的时间线也没毛病。就目前放出的文本数据逻辑来看,这是一篇干货满满、基本没有注水的硬核“炼丹”手册。
建议后续行动
- 无需联系作者要求提供原始数据(文本逻辑自洽)
- 无需在 PubPeer 上提出质疑
- 无需向期刊编辑部举报
- 关注后续代码与数据集开源情况(论文宣称已在 openthoughts.ai 开源)
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。