Loading...
正在加载...
请稍候

HOW TO SYNTHESIZE TEXT DATA WITHOUT MODEL COLLAPSE?

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:HOW TO SYNTHESIZE TEXT DATA WITHOUT MODEL COLLAPSE?
  • 作者:Xuekai Zhu, Daixuan Cheng, Hengli Li, Kaiyan Zhang, Ermo Hua, Xingtai Lv, Ning Ding, Zhouhan Lin, Zilong Zheng, Bowen Zhou
  • 期刊:预印本
  • DOI:未提供
  • 发表年份:2024 (基于文中引用的 Llama-3、Dohmatob et al. 2024 等文献推断)
  • 论文来源:HOW TO SYNTHESIZE TEXT DATA WITHOUT MODEL COLLAPSE.pdf

综合评定:🟠 高度可疑

详细发现

发现 1:核心实验与消融实验数据“左右互搏”(数据造假/逻辑矛盾)

  • 位置:Table 2 (Page 9) 与 Table 7 (Page 11)
  • 描述:论文核心主张是使用阈值 p=0.99 的 Token-Level Editing (ToEdit) 方法能提升模型性能。但在主实验表(Table 2)和消融实验表(Table 7)中,针对同一模型、同一领域的数据出现了无法自洽的严重矛盾。
  • 证据
    • 在 Table 2 中,模型 OLMo-1B 在 Biomedicine 领域的 CPT 基线平均分为 38.83,使用作者力推的 ToEdit 方法后平均分提升至 40.89
    • 然而在 Table 7 的消融实验中,同样是 OLMo-1B 在 Biomedicine 领域,同样是使用 p≥0.99 的策略,平均分竟然暴跌至 38.69!不仅与 Table 2 中的 40.89 大相径庭,甚至低于 Table 2 中的基线分数(38.83)。
    • 这种同一实验条件得出截然不同结果的状况,极度怀疑是东拼西凑数据或人为篡改结果所致。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 2:“挂羊头卖狗肉”的最优超参数(统计学异常/结果挑选)

  • 位置:Table 7 (Page 11)
  • 描述:作者在消融实验中对比了不同的重采样阈值,结果却发现作者最终选择的 p=0.99 根本不是表现最好的参数,但作者却在正文中强行掩盖了这一事实。
  • 证据
    • 根据 Table 7 的数据,p≤0.001(即重采样大量低概率 token)在 Biomedicine 领域的平均分达到了 39.16
    • 而作者在全篇论文和所有主实验中强行采用的 p≥0.99,在同样数据集上的平均分仅有 38.69(甚至不如基线)。
    • 既然 p≤0.001 效果更好,为何主实验(Table 2, 3, 4)全都强行使用 p=0.99?这暴露了作者可能在“挑选”符合自己预期的数据,甚至是为了掩盖某些实验失败的结果。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 3:参考文献大面积缺失与乱码(引用与方法学异常)

  • 位置:Introduction (Page 2), Related Work (Page 13) 等全篇多处
  • 描述:论文的引用格式极其混乱,大量核心文献的作者名字和年份被直接抹除或替换成了无意义的数字/标点符号,这在严谨的学术论文中是极不寻常的。
  • 证据
    • 第一页即出现:“As generative artificial intelligence (AI) (Rombach et al.,;,)”
    • “(et al.2024) and 2024a) identify the model collapse phenomenon”
    • “Synthetic datasets (Trinh et al.,;,;,) have been proven”
    • 这不仅反映出论文排版极度的草率,也让人怀疑这些文献是否真的支持作者的观点,或者文献本身就是伪造的。
  • 严重程度:🟡
  • 复核状态:✅ 成立

耿同学辣评

主实验图表画得花里胡哨、漂漂亮亮,结果一到消融实验就自己打自己的脸!主实验说考了90分,消融实验交出同样的卷子却只考了59分;明明旁边那套卷子能考61分,非要硬着头皮说自己这套59分的卷子是天下第一。这种“掩耳盗铃”式的数据挑选,当读者都是不看表格的瞎子吗?连参考文献都能大面积缺失乱码,这篇论文的严谨性简直是个笑话。

建议后续行动

  • 联系作者要求提供原始实验日志和原始数据
  • 在 PubPeer 上提出公开质疑
  • 向预印本平台(如 arXiv)或相关学术机构反映数据矛盾问题

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。