Loading...
正在加载...
请稍候

D-RAG: Differentiable Retrieval-Augmented Generation for Knowledge Graph Question Answering

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:D-RAG: Differentiable Retrieval-Augmented Generation for Knowledge Graph Question Answering
  • 作者:Guangze Gao, Zixuan Li, Chunfeng Yuan, Jiawei Li, Jianzhuo Wu, Yuehao Zhang, Xiaolong Jin, Bing Li, Weiming Hu
  • 期刊:Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)
  • DOI:文本中未提供
  • 发表年份:2025
  • 论文来源:2025.emnlp-main.1793.pdf

综合评定:🟠 高度可疑

详细发现

发现 1:方法学与时间线内部矛盾(文本与图片对不上)

  • 位置:Figure 3 (Page 6) / Appendix G Implementation Details (Page 13)
  • 描述:论文在正文部分展示了训练轮次曲线,并在附录中详细说明了训练策略。然而,正文图片和附录文本在“预训练阶段的时间线”上存在直接冲突。
  • 证据:在 Appendix G 中,作者明确写道:“During the first training phase (retriever pre-training), we train the model for 10 epochs.” 然而,在 Figure 3 的图注和视觉表现中,明确标示为:“Epochs 1-4 represent retriever-only pretraining”。作者自己写的文字和自己的配图发生了严重的自相矛盾,这说明图表极有可能是拼凑、沿用了旧版本数据,或者文字部分存在造假虚构。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 2:数据造假检测(不符合物理规律的“完美”曲线)

  • 位置:Figure 3 (Page 6)
  • 描述:Figure 3 中关于 "Retrieval Number"(检索数量,虚线)的下降曲线呈现出极度不自然的“断崖式阶跃”形态,违背了深度学习梯度下降的常理。
  • 证据:根据图片视觉分析,在 Epoch 4 到 Epoch 5(即预训练切换到联合训练)的节点,检索数量曲线从约 100 瞬间垂直跌落至约 20-30,随后保持一条绝对水平的直线直到 Epoch 12 结束。真实的基于 Gumbel-Softmax 等梯度的神经网络参数更新,绝不会产生如此完美的瞬间突变和随后绝对的“死水微澜”(即完全停滞)。这种曲线极大概率是人为设定硬阈值截断,或者干脆是人为画上去的理想化数据。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 3:数据造假检测(网格化的“生成器”数据)

  • 位置:Figure 4 (Page 6)
  • 描述:Figure 4 的热力图散点呈现极其反常的数学规律性,缺乏真实实验应有的“噪声”。
  • 证据:作者在图注中声称这是评估不同检索器配置对生成器影响的实验结果(各种概率阈值采样)。但在真实的大规模机器学习实验中,不同超参数(阈值)采样的模型表现必然会因为随机种子、Dropout 等因素产生无序的波动。然而,该图中所有数据点严格落在一条狭窄的对角带状区域内,且分布呈现完美的网格状。这强烈暗示该图并非真实跑出来的实验数据,而是通过某种数学公式或后处理脚本人为平滑、生成的“理论边界图”。
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 4:消融实验数据高度重叠(Baseline 数据复用?)

  • 位置:Table 6 (Page 14)
  • 描述:在 CWQ 数据集的 4-hop 细粒度消融实验中,不同训练方法(甚至架构完全不同的方法)得出了完全一致的 Precision(精确率)数值,数据过于“巧合”。
  • 证据:观察 Table 6 中 Retrieval Precision 这一栏的 4-hop 列,REINFORCE 方法和 Static Cascade 方法的 Precision 数值竟然一模一样,都是 14.1。考虑到这两种方法在梯度回传、检索器更新机制上有根本性差异,在如此细粒度(4跳)的复杂评测中得出完全相同的两位小数,极有可能是复制粘贴错误或批量生成数据时留下的马脚。
  • 严重程度:🟡
  • 复核状态:✅ 成立

耿同学辣评

咱们就是说,这篇主打“端到端可微”的 D-RAG 论文,在实验数据的处理上可一点都不“自然可微”啊!左边正文写着预训练 10 个 epoch,右边配图大笔一挥只画了 4 个 epoch,主打一个“左右互搏”;最离谱的是 Figure 3 那个“垂直降落然后躺平”的阶跃曲线,物理意义上相当于模型在第 5 个 epoch 突然被点了穴,之后再也没动过。怎么着,你们这模型不仅学会了知识图谱推理,还学会了“原地假死”来省算力是吧?建议把这些“过于完美”的图表原始日志掏出来让大家开开眼,别拿 AI 生成或者 PS 的理想图来糊弄审稿人!

建议后续行动

  • 联系作者要求提供原始训练日志(特别是 Figure 3 和 Figure 4 的底层数据)
  • 在 PubPeer 上提出质疑
  • 向期刊编辑部举报
  • 向作者所在机构学术委员会举报

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。