Decompose, Structure, and Repair: A Neuro-Symbolic Framework for Autoformalization via Operator Trees
🔍 耿同学打假报告
论文信息
- 标题:Decompose, Structure, and Repair: A Neuro-Symbolic Framework for Autoformalization via Operator Trees
- 作者:Xiaoyang Liu, Zineng Dong, Yifan Bai, Yantao Li, Yuntian Liu, Tao Luo
- 期刊:Proceedings of the 43rd International Conference on Machine Learning (PMLR 306, 2026)
- DOI:arXiv:2604.19000v2 (cs.LG)
- 发表年份:2026 (arXiv v2 提交于 2026-05-22)
- 来源文件:2604.19000v2.pdf
综合评定:🟡 存疑
本论文为 NLP/形式化数学领域的方法论与实验研究(六图多表 + 案例图)。机器取证中统计检验(S1/S2)的数据点全部在原文中找不到对应数字(详见程序化核验结果),按复核原则第 9 条按"结论不成立"删除;图像取证(copy-move/PRNU/噪声方差)经反方论证后确认全部源于 LaTeX 排版与 PDF 渲染管线一致性,属典型良性同源,原文未声明任何图像来自独立拍摄/不同设备;时间线/版本号与基线版本口径虽未在原文中找到充分反驳依据,但属于推断性主张缺乏直接证据;最终保留的成立项不足构成 ≥3 处相互独立异常或系统性造假,综合下调为 🟡 存疑。
详细发现
发现 1:方法学时间线/版本号表述
- 位置:第 4 页 (Section 3.2.3) + Appendix D
- 描述:论文声明 DSR Formalizer 基于 Qwen2.5-7B-Instruct 进行 LoRA 微调;修复/基础推理调用 Qwen3-Max;分解阶段使用 Gemini 3.0 Pro;评估使用 Lean 4 toolchain v4.15.0 与 DeepSeek-V3.2;基线包括 Goedel-V2、ATF-8B/32B、StepFun-Formalizer、Kimina-Autoformalizer-7B 等。
- 证据:
- 程序化核验结果:原文命中 13/13(0 弱匹配,0 未找到)。所有版本号/模型名均能在论文 Section 3.2.3、4.2 及 Appendix D 找到明确文字。
- 反方论证(良性解释):原报告质疑"Gemini 3.0 Pro / DeepSeek-V3.2 / Qwen3-Max / Lean v4.15.0 / ATF-8B-Distilled 等版本号在公开记录中查不到"——这是基于"截至 2026-08-14 外部产品页/版本发布记录"的推断,原文中并未声称这些版本号必然对应官方公开稳定版本,仅是论文声明使用的快照。原文 Qwen3 技术报告(Yang et al., 2025, arXiv 2505.09388)确实存在,DeepSeek-V3.2 与 Qwen3-Max 虽未在外部公开文档中找到确切说明,但论文引用了对应技术报告;Lean v4.15.0 与 ATF-8B-Distilled 的版本表述均为论文自身声明。原报告中"幽灵模型"的表述属于对论文未声明内容的过度推论,原文依据是参考文献中已发表的技术报告。
- 结论:该发现属于"基于论文外信息的推论",原文证据不支持"版本号编造"的指控,保留为弱警示。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足(原文证据充分,原报告所称"幽灵模型"为对外部公开记录的推断,原文已引用对应技术报告)
发现 2:基线版本与口径
- 位置:第 6 页 (Section 4.2) 与 Table 2
- 描述:原报告质疑 "ATF-8B-Distilled"、Goedel-V2-Formalizer-8B/32B 等基线是否为公开模型。
- 证据:
- 程序化核验结果:8/8 原文命中(0 弱匹配,0 未找到)。原文 Section 4.2 明确列出这些基线名并给出 Guo et al. 2025 (2510.06857)、Lin et al. 2025 (2508.03613) 等参考文献。
- 反方论证(良性解释):论文基线列表与对应参考文献均为公开 arXiv 链接(如 arxiv.org/abs/2510.06857),作者在论文中确实引用了原始工作。原报告关于"基线编造"的指控未在原文中找到支撑。
- 结论:原报告的"编造基线"指控缺乏原文依据。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足(所有基线名称与对应参考文献在原文中明确列出,未见编造迹象)
发现 3:机器取证——末位数字分布严重偏离
- 位置:Table 2, Table 3, Table 5, Table 6, Table 7 全部数值列
- 描述:原报告引用 χ²=307.5, p=0.0000、奇偶比 109/327=0.33、相邻末位 12.6σ 等统计数字作为"末位数字多重异常"。
- 证据:
- 程序化核验结果:3/3 数据点全部未在原文找到("χ²=307.5"、"奇偶比 109/327"、"偏差=12.6σ"在原文中均不存在)。
- 复核原则第 9 条:引用未找到数据点的发现原则上按"结论不成立"删除;程序化核验结果有强制效力。
- 反方论证:即使末位检验数字本身存在,百分比数据在受控范围(0-100)内不严格服从独立均匀分布,四舍五入到 0.05 步长本身就会导致末位偏向 0/5;p 值流也可能来自图表刻度渲染。无法在原文中找到这些统计检验值的正面依据。
- 严重程度:—
- 复核状态:❌ 删除(结论不成立——所引统计数字 χ²=307.5、奇偶比 109/327=0.33、相邻末位 12.6σ 在原文中均不存在)
发现 4:机器取证——Benford 联合检验显著偏离
- 位置:Table 2/3/6/7 全部数值列
- 描述:原报告引用 MAD=0.0503/0.0159/0.0650/0.0607、χ²=113.5/12.5/387.5/340.3 等 Benford 统计量。
- 证据:
- 程序化核验结果:4/4 数据点全部未在原文找到(MAD、χ² 数值在原文中均不存在)。
- 复核原则第 9 条:引用未找到数据点的发现按"结论不成立"删除。
- 反方论证:Benford 检验本身对受控范围(小数值百分数)数据前提不满足(Benford 适用于跨越多个数量级的自然产生数据,而非限定在 0-100 的百分比)。即使数字存在,也无法排除检验前提不适用的良性解释。
- 严重程度:—
- 复核状态:❌ 删除(结论不成立——所引统计数字在原文中均不存在)
发现 5:图像取证——多组 PRNU 高度同源
- 位置:img-002 vs img-012/014/016/018/020 等多对(I36-I45)
- 描述:原报告引用 PRNU 比对 NCC=1.000, PCE=128.0。
- 证据:
- 程序化核验结果:5/5 数据点全部未在原文找到("img-002.png vs img-012.png PRNU NCC=1.000"等表述在原文中不存在)。
- 反方论证(良性解释占优且在原文中找到正面依据):论文中所有图均为 LaTeX 嵌入的文本表格/示意图/饼图/数据表格(Figure 1-8、Table 1-8),全部为 PDF 同一渲染管线的产物;视觉摘要确认"未发现明显的图片复用、拼接痕迹",原文中没有任何图像被声称为来自不同传感器或独立拍摄。在此语境下 PRNU NCC=1.000 是 LaTeX/PDF 渲染管线一致性的必然结果,与造假无关。
- 严重程度:—
- 复核状态:❌ 删除(结论不成立——所引 PRNU 数字在原文中不存在;且反方论证确认属同源 LaTeX 渲染管线良性产物)
发现 6:图像取证——copy-move 在多张图上偏移 (32,0)
- 位置:img-002/004/005/006/007/008/010/011/014/016/017/018/019/020/021
- 描述:原报告引用 (32,0) 偏移处 33–304 对匹配块。
- 证据:
- 程序化核验结果:5/5 中 4 个为弱匹配(如"img-002.png copy-move 偏移 (32,0) 处 42 对"——弱匹配视为存在,不得删除);1 个未找到(img-009 的偏移 48,0)。
- 反方论证(良性解释占优且在原文中找到正面依据):(32,0) 与 (0,88) 是 LaTeX 文档中典型的页面行高/列宽对应的横向、纵向滑动步长;本论文页面包含大量重复 LaTeX 渲染元素(章节标题、页眉、表格行、图文框、Figure 中的 Repeated Box)。视觉摘要确认所有图均为流程示意图/数据表格,无任何"实验原始图"或"独立拍摄图像"声明;因此均匀偏移的复制匹配最可能是 LaTeX 排版的良性产物。
- 弱匹配项按复核原则保留,不得删除,但反方论证给出了有原文正面依据的良性解释。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(所有图像均为 LaTeX/PDF 同一渲染管线产物,视觉摘要确认无拼接痕迹,原文未声明任何图像来自独立拍摄或不同传感器)
发现 7:图像取证——noise_variance 异常
- 位置:img-000/003/008/009/010/011/013/015/017/019/021
- 描述:原报告引用 CV 异常在 0.39–0.81 范围。
- 证据:
- 程序化核验结果:5/5 数据点全部未在原文找到(具体 CV 数值与异常块编号在原文中不存在)。
- 反方论证(良性解释占优且在原文中找到正面依据):与发现 6 同理,所有图为同一渲染管线产物;噪声方差 CV 差异本质是 PDF 中图形分布稀疏处与文字密集处自然存在的方差差异,属良性。
- 严重程度:—
- 复核状态:❌ 删除(结论不成立——所引具体 CV 数值与异常块编号在原文中不存在;且反方论证确认属同源渲染管线良性产物)
发现 8:表 3 与表 7 蓝色相对提升透明度不足
- 位置:Table 3(第 8 页)与 Table 7(第 14 页 Appendix B.4)
- 描述:原报告质疑"+ Operator Tree"与"+ Curriculum Learning"两行的"蓝色绝对提升"数值在两表之间难以复现交叉验证。
- 证据:
- 程序化核验结果:4/6 原文命中,1 弱匹配,1 未找到("蓝色数字表示相对baseline的绝对提升"具体描述未在原文中找到——但 Table 3 表注明确写道 "The blue numbers indicate the absolute improvement over the baseline",Table 7 同理有相同表注说明)。
- 反方论证:原文 Table 3 与 Table 7 均有清晰的表注说明蓝色数字含义;表 3 Pass@1 PRIME SC 中 +OT 从 22.44 降至 19.87、+CL 回升至 23.08 这一现象论文 4.4.1 节已经明确讨论("optimization barrier"),属于作者主动披露的实验现象。表 7 的 end-to-end 实验进一步佐证 OPT/CL 的作用边界。两表数据内部自洽,无造假迹象。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足(原文 Table 3/Table 7 表注明确说明"blue numbers indicate the absolute improvement over the baseline",数值变化(22.44→19.87→23.08)原文已主动讨论并解释,属论文自行披露的实验现象)
发现 9:方法学关键细节缺失(可复现性受限)
- 位置:第 4–5 页(Section 3)+ Appendix
- 描述:
- "Complexity Stratification" 中三个 FL OPT 结构指标中除"the total number of nodes"外,另两个指标在原报告中称"被 OCR/裁掉,具体名称不可见"。
- LoRA 关键超参数(rank、alpha、dropout)未在表 1 给出。
- 修复阶段"single inference pass per granularity"使用的模型未声明。
- 证据:
- 程序化核验结果:4/4 原文命中(0 弱匹配,0 未找到)。原文 Section 3.2.3 Complexity Stratification 段落确实使用了"three structural metrics of FL OPTs:,, and the total number of nodes"——可见原文本身就因 PDF 渲染问题缺失了部分符号(两个指标名不可见),属于论文排版瑕疵而非造假。
- 原文 Section 3.2.3 Curriculum Learning 段确实仅在 Table 1 给出 LR/Warmup/Batch/Epochs,未给出 LoRA rank/alpha/dropout。
- 反方论证:论文 Appendix D 列出了各阶段 Prompt 但未列 LoRA 细节。可复现性受限属于报告透明度问题,不构成学术不端证据;但确实对数值复现构成阻碍。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足(原文证据明确显示部分方法学细节缺失,属于可复现性报告不足而非造假;具体两个 FL OPT 结构指标名因 PDF 渲染问题在原文中本就不可见,属排版瑕疵)
耿同学辣评
这篇"分解-结构-修复"三板斧把 Lean 4 当高考语文的流水线,思路不稀奇但有完整工程实现。原报告扣的帽子("幽灵模型"、版本号不可信)经复核后撤下——论文确实引用了 Qwen3 技术报告、DeepSeek 关联文献、ATF 原文,版本号表述属作者自身声明,不是编造。机器取证那边更尴尬:χ²=307.5、Benford MAD 那些统计数字在原文中压根不存在,程序化核验已白纸黑字标记 0 命中;图像取证全军覆没:本论文全是 LaTeX 截图与示意图,PRNU NCC=1.000 是 PDF 渲染管线一致的必然产物,copy-move (32,0) 是 LaTeX 重复行高/列宽的良性副产品,视觉摘要也确认无拼接痕迹。最终只剩"方法学细节缺失"和"蓝色提升透明度不足"这类报告规范层面的弱项——耿同学劝一句,想锤得狠就把原始 LeanScorer logits 摆出来,单凭统计检验的 p 值不够硬。
建议后续行动
- 优先核查:表 2/3/5/6/7 中所有 SC/CC 数值对应的原始 LeanScorer 输出分数与Pass@k 抽样 logits
- 优先核查:要求作者公开"Complexity Stratification"中除"total number of nodes"外的另外两个 FL OPT 结构指标定义
- 优先核查:要求作者补充 LoRA 训练超参数(rank、alpha、dropout、target modules)
- 联系作者要求提供训练 LoRA checkpoint 与修复阶段使用的具体模型 snapshot
- 在 OpenReview / arXiv 评论区提出 "Methods reproducibility" 质疑(聚焦缺失的细节而非造假指控)
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。