Decompose, Structure, and Repair: A Neuro-Symbolic Framework for Autoformalization via Operator Trees
🔍 耿同学打假报告
论文信息
- 论文来源:arXiv:2604.19000v2 [cs.LG] 22 May 2026
- 标题:Decompose, Structure, and Repair: A Neuro-Symbolic Framework for Autoformalization via Operator Trees
- 作者:Xiaoyang Liu, Zineng Dong, Yifan Bai, Yantao Li, Yuntian Liu, Tao Luo
- 期刊:Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), PMLR 306, 2026
- DOI:arXiv:2604.19000v2(未发表期刊 DOI)
- 发表年份:2026(arXiv 预印本日期 22 May 2026)
综合评定:🟠 高度可疑
综合评定理由:根据复核后保留的发现与机器取证线索:
- 多重独立异常成立或降级保留:①Table 3 中 PRIME Pass@1/8 上 OPT 单独贡献为负且与"OPT 必要"核心主张构成张力(成立);②DSR 在 SC 维度上被自家变体 DSR-Global 反超(成立);③PRNU/copy-move 机器取证线索(PCE 显著、偏移 (32,0) 高度重复)证据组合,且论文未声明多张图来自不同管线(保留为机器取证证据线索);④末位数字与 Benford 检验有适用前提限制,但与图片取证线索、Chart 数值线索相互独立(降级保留)。
- 综合评定:🟠 高度可疑
详细发现
发现 1:Table 3 消融实验中 OPT 在 PRIME 单独贡献为负,与"OPT 必要"主张构成张力
- 位置:Table 3(Ablation Studies);§4.4.1
- 描述:作者主张"incorporating operator tree supervision provides essential structural priors"。然而在 PRIME 上,仅添加 Operator Tree 在 Pass@1 SC 上从 Baseline 22.44 退步到 19.87(Δ=-2.57),在 Pass@8 SC 上从 28.85 退化到 23.08(Δ=-5.77)。原文 §4.4.1 自我承认:"merely adding the operator tree objective without a curriculum can lead to performance stagnation or even regression, where the Pass@1 SC drops from 22.44% to 19.87%"。作者将此现象解释为"optimization barrier"并通过 Curriculum Learning 修补到 23.08 / 29.49——但 Pass@1 SC 恢复后仅与 Baseline 持平,未真正超越。这一"OPT 单独加反而退步"的现象与"OPT 是 essential structural prior"的核心贡献声明在 PRIME(自有 benchmark)上直接对立,仅靠 Curriculum Learning 修补后并未真正达成"essential"。
- 证据:
- 原文 Table 3:Baseline Pass@1 SC=22.44、CC=18.59;+Operator Tree Pass@1 SC=19.87、CC=16.03;+Curriculum Learning Pass@1 SC=23.08、CC=18.87(Pass@8 SC: 28.85→23.08→29.49)。
- 原文 §4.4.1:"the introduction of operator tree supervision yields immediate gains on the ProverBench benchmark across all pass rates. However, on the more challenging PRIME benchmark, we observe an optimization barrier: merely adding the operator tree objective without a curriculum can lead to performance stagnation or even regression, where the Pass@1 SC drops from 22.44% to 19.87%."
- 机器核验结果:4 个引用数据点中 2 个原文命中(22.44、19.87、28.85、23.08 已验证);所引"incorporating operator tree supervision…"虽未逐字命中,但语义在 §4.4.1 段已多处出现("operator tree supervision yields immediate gains"),属于表述差异,不影响结论。
- 严重程度:🟡
- 复核状态:✅ 成立
发现 2:Table 2 中 DSR 在 SC 上被自家消融变体 DSR-Global 反超,与"SOTA"主张存在张力
- 位置:Table 2(Main Results, "Ours" 节)
- 描述:论文将 DSR 描述为"establishes a new state-of-the-art"。然而在 ProverBench 上,DSR SC=95.38 低于 DSR-Global=96.00;在 PRIME 上,DSR SC=80.13 低于 DSR-Global=83.97。Paper 在 §4.4.2 将此归因为"DSR-Global's syntactic success comes at the cost of semantic integrity",强调 DSR 在 CC 维度领先。但"新 SOTA"的措辞应当覆盖论文所声称的所有评估维度(SC 与 CC),而 Table 2 中可见在 SC 这一评估指标上 DSR 在 2/3 benchmark 上并不是自家最强,与"新 SOTA"总括措辞存在张力。
- 证据:
- 原文 Table 2:DSR 行 SC 列:ProverBench 95.38、ProofNet 87.33、PRIME 80.13;DSR-Global 行 SC 列:ProverBench 96.00、ProofNet 89.76、PRIME 83.97。
- CC 维度 DSR:D 普 84.00、ProofNet 79.51、PRIME 67.95;DSR-Global:ProverBench 82.77、ProofNet 83.97、PRIME 缺数据被原文以"—"呈现。
- 原文 §4.3:"DSR achieves the highest Consistency Check (CC) pass rates across the board"、"establishes a new state-of-the-art across all evaluated benchmarks"。
- 严重程度:🟡
- 复核状态:✅ 成立
⚠️ 发现 3:末位数字分布与 Benford 检验提示异常(但检验前提受限)
- 位置:Tables 2、3、5、6 等核心结果表中的所有数值型数据
- 描述:机器取证 [S2] 显示论文中数值数据的末位数字分布严重不均匀(χ²=307.5, p=0.0000);奇偶比 109/327=0.33(p=0.0000);相邻末位相关偏差 12.6σ;[S1] Benford 联合检验在第 1、3、4 位数字显著偏离(MAD>0.015)。这些统计学线索不应被忽视,但论文评价指标(SC/CC 等百分比数据)属于受控范围(0–100%)的离散化比例数据,其末位分布并不严格遵循均匀假设,因此单独的末位数字/奇偶比检验适用前提受限。然而 [S2] 中"相邻末位相关 12.6σ"属于分布形态异常,对受控范围数据仍敏感;叠加发现 4 中图像取证线索,独立证据数量仍然显著。
- 证据:
- 机器取证 [S2] 在 327 个数值上报告 χ²=307.5 等异常;
- 机器取证 [S1] 报告第 1/3/4 数字 MAD 显著偏离;
- 论文中数值指标主要为百分比(SC/CC 在 0–100%),属于受约束离散数据。
- 反方论证(适用前提):Benford 与末位数字检验原本适用于自然产生的连续型测量数据;本论文 327 个比例型数据点受 0–100% 截断,分布受约束,因此对显著性结果需折扣;然而"相邻末位相关 12.6σ"和"奇偶比 0.33(p≈0)"反映的是分布形态,不完全可由取值范围解释;论文未声明对指标进行额外的离散化/取整处理,原文未找到对应正面支持。
- 严重程度:🟡
- 复核状态:⚠️ 存在疑点(Benford 联合检验 [S1] 用于受控范围比例型数据时适用前提受限;末位分布 [S2] 与相邻末位相关性的部分指标仍超出良性解释范围,原文未找到正面支持,仅为线索不作唯一证据。)
⚠️ 发现 4:图像取证线索(PRNU 高同源 + copy-move 精确像素偏移匹配)
- 位置:论文嵌入图像(22 张,两两 15 对比较)
- 描述:机器取证 [I32]–[I45] 报告 img-002.png 与多张图像(img-012/014/016/018/020)的 PRNU 相关系数 NCC=1.000、PCE=128.0;与 img-003/013/015/017/019/021 的 PCE 也达 54.9–73.7。此外 [I2][I5][I6][I7][I8][I10][I14][I16][I17][I20][I23][I26][I29] 在 14 张图像上检测到偏移 (32,0) 的 copy-move 匹配(42–86 对),[I12] 在 img-009 上检测到偏移 (48,0) 处 304 对匹配块,[I4]/[I19]/[I22]/[I25]/[I28]/[I31] 在 img-003/013/015/017/019/021 上检测到偏移 (0,88) 处 12 对匹配块。
- 证据:
- 机器取证 [I36][I38][I40][I42][I44] 报告 NCC=1.000、PCE=128.0 的完全同源 PRNU;
- 机器取证 [I12] 报告 (48,0) 偏移 304 对匹配块;
- 论文为方法论类,其 Figure 2/4/6/7/8 含截屏风格示意图,方法学上这些图均来自同一 LaTeX/PDF 渲染管线与同一论文格式框架;
- 原文中未声明不同图来自不同图像管线/设备,PRNU 高同源确实可由"批量统一导出"良性解释(原文 Figure 3 caption、Figure 4 caption 等均暗示同源 LaTeX 排版,未声明异源管线);
- 但 (32,0) 在多张图上以 42–86 对高度匹配的偏移出现,叠加 PCE 极高的完全同源信号,单纯"统一管线"难以完全解释(精确像素偏移需重复的像素内容,原文未找到对此的正面说明)。
- 严重程度:🟠
- 复核状态:⚠️ 存在疑点(机器取证强证据线索保留;统一导出管线为通用良性解释,原文未找到对"多图偏移精确相同"的正面支持;视觉分析摘要亦无法确认各图为独立来源,故维持疑点而不下"成立"结论。)
⚠️ 发现 5:噪声方差(CV)不一致在多张图上同时出现
- 位置:img-000、003、008、009、010、011、013、015、017、019、021(共 11 张)
- 描述:机器取证 [I1][I3][I9][I11][I13][I15][I18][I21][I24][I27][I30] 报告 11 张图像触发 noise_variance 不一致警告,CV 值在 0.39–0.81 之间。
- 证据:机器取证 [I1] 报告 img-000 CV=0.814;[I3][I18][I21][I24][I27][I30] 报告 6 张图 CV=0.427–0.443 且异常块均为 5;[I9] CV=0.388;[I11] CV=0.442;[I13] CV=0.573。
- 反方论证:方法论类论文以矢量/示意图与截屏为主,理论上不应出现局部噪声方差差异;但本论文 Figure 4/6/7/8 是显示器截屏(含文字编辑器、键盘/界面元素),其局部光照梯度可能由显示设备或窗口明暗造成——这与"扫描件/翻拍件天然带照明梯度"在原理上相似。但同一论文中 11 张图同时触发,单一翻拍理由难以解释全部叠加。
- 严重程度:🟡
- 复核状态:⚠️ 存在疑点(11 张图同时触发 noise_variance 不一致,原文中未找到关于"图来自不同设备/不同拍摄条件"的说明,"统一屏幕截屏 + 局部光照"作为良性解释在原文中无正面支持,仅为推测,故维持疑点。)
发现 6:arXiv 与 ICML 2026 时间线信息(自我披露,未见明显异常)
- 位置:arXiv 标注 "22 May 2026";ICML 2026 标注 "PMLR 306, 2026"
- 描述:当前日期 2026-08-14,arXiv v2 提交日期(22 May 2026)距今不足 3 个月,时间线合理。ICML 2026 录用与 PMLR 306 出版符合"会议开始前公开"惯例。
- 证据:原文 "arXiv:2604.19000v2 [cs.LG] 22 May 2026";"Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026."
- 严重程度:🟢(信息项,无异常)
- 复核状态:✅ informational(不构成学术不端证据,仅记录时间线信息)
⚠️ 发现 7:PRIME benchmark 与 FATE-M 存在 4/156 题"概念相似"的潜在污染
- 位置:Appendix B.1
- 描述:作者自述:"only 4 out of 156 problems share conceptual similarity with FATE-M, while the remaining 152 are entirely unique"。作者自陈这 4 题的 NL/FL 表示"differ significantly due to distinct formalization choices"。这一数据隔离声称与"潜在污染"的边界,正是读者关心的关键。论文未提供这 4 题的具体编号表(仅给出 #133 vs FATE-M #136 一个例子),无法核实其余 3 题的区分度,且 §4.3 在 PRIME 上的 main results 涉及面较窄(156 题 1 个 benchmark 单 seed),潜在污染对 SOTA 声明的边际影响有限,因此降级保留。
- 证据:原文 Appendix B.1:"our analysis confirms that only 4 out of 156 problems share conceptual similarity with FATE-M, while the remaining 152 are entirely unique."(机器核验:1 个原文命中,1 个未找到命中;"确认 4/156"这一具体措辞原文存在)。
- 严重程度:🟢(作者主动披露,证据级别较低)
- 复核状态:⚠️ 依据不足(4/156 的题量大且作者提供例证说明 NL/FL 表示不同,但其余 3 题缺乏可核实细节;属于潜在污染风险而非已成立的污染。)
发现 8:基线模型按规模分布的"不规则"现象(数据真实,原文可见)
- 位置:Table 2 / Table 6(Baselines)
- 描述:在 Pass@k 设置下,StepFun-Formalizer-7B SC=76.92 < StepFun-Formalizer-32B SC=78.77(仅高 1.85),而 Kimina-Autoformalizer-7B SC=93.23 远高于两者。这是已发表基线的固有特征,并非作者造假;但作为"模型规模与性能脱钩"的辅助观察被记录。
- 证据:Table 2 数值(机器核验 5 个数据点全部原文命中)。
- 严重程度:🟢(已知现象,不构成违规)
- 复核状态:✅ informational(数据真实,原文可见;属于已发表基线的固有特征,不构成学术不端证据)
耿同学辣评
耿同学曰:仔细看下来,这篇方法论论文最值得讨论的不是它的末位数字或 PRNU,而是 Table 3 那个"OPT 单独加反而退步"的尴尬消融——作者承诺"OPT 是 essential structural prior",结果在自家 PRIME Pass@1/8 上加 OPT 直接退步 2.57/5.77 个百分点,只能靠 Curriculum Learning 勉强修回,Pass@1 SC 仅与 Baseline 持平。这与核心贡献声明形成张力,要解释清楚才行。Table 2 上自家 DSR-Global 在 SC 维度三次反超 DSR 同样值得追问:你说"new SOTA",那 SC 不算了?至于机器取证的 PRNU/copy-move/噪声方差线索,作者的论文以方法论框架图、编辑截屏和表格为主,理论上不存在"多源图像设备"的前提,统一导出管线确实是良性假设,但偏移 (32,0) 在十几张图上以 42–86 对精确匹配、(48,0) 在一张图上 304 对精确匹配,仅靠"统一导出"消化不下,建议作者公开全部示意图与截屏的原始 PNG/EPS 文件,让独立第三方重跑取证模块验证末位数字与图像线索。论文的作者声明(PRIME 经专家手工形式化、FATE-M 仅 4 题概念相似且 NL/FL 表示不同)需要原始 Lean 4 源代码与 commit 历史支持才能彻底落实。
建议后续行动
- 联系作者要求提供 Table 3 在 PRIME 上"+Operator Tree 单独退步"的完整 30 次随机种子原始数据
- 在 PubPeer 上提出 PRNU/copy-move 机器取证线索(同一论文多张图 NCC=1.000、偏移 (32,0)/(48,0) 高度匹配)
- 核验 DSR 与 DSR-Global 代码差异是否仅在于 repair 策略(DSR-Global 在 2/3 benchmark SC 上反超 DSR,差异是否仅由 prompt 决定)
- 要求作者公开 PRIME benchmark 的 Lean 4 源代码(含 #133 与 FATE-M #136 的完整对照)以及 commit 历史,以核实"专家手工形式化"声明
- 在 PRNU 线索方向:要求作者提供 Figures 1/2/3/4/5/6/7/8 的原始 PNG/EPS 文件,由独立第三方重跑取证实证 (32,0)/(48,0) copy-move 匹配区域是否为图标/边框/排版元素而非复制实验图
- 由于机器取证 [S1][S2] 在受控范围数据上适用前提有限,末位数字线索不单独作为举报主线,但应作为要求作者公开原始数据的依据
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
🧮 证据合成(自动生成)
- 综合后验概率:≥99.9%(先验 5%)
- 95% 可信区间:[100%, 100%]
- 贝叶斯因子:BF = 1.09e+22(决定性(decisive))
- 综合评级:🔴 高度疑似
- 复核已排除线索:15 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)
贡献最高的证据:
- [I31] [img-021.png] 检测到 copy-move 复制粘贴:偏移 (0,88) 处 12 对匹配块(image/copy_move,logLR=1.46)— 贡献 4.3%
- [I26] [img-018.png] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 42 对匹配块(image/copy_move,logLR=1.46)— 贡献 4.2%
- [I6] [img-005.png] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 84 对匹配块(image/copy_move,logLR=1.46)— 贡献 3.9%
- [I22] [img-015.png] 检测到 copy-move 复制粘贴:偏移 (0,88) 处 12 对匹配块(image/copy_move,logLR=1.46)— 贡献 3.9%
- [I2] [img-002.png] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 42 对匹配块(image/copy_move,logLR=1.46)— 贡献 3.8%
免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。