Fermi-Bose Machine achieves both generalization and adversarial robustness
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 论文来源:arXiv:2404.13631 (文本来源)
- 标题:Fermi-Bose Machine achieves both generalization and adversarial robustness
- 作者:Mingshan Xie, Yuchen Wang, and Haiping Huang
- 作者单位:中山大学物理学院 PMI Lab 等
- 发表日期:2024年7月19日 (Dated: July 19, 2024)
综合评定:🟡 存疑 (方法学与验证层面)
(注:由于仅提供文本,无法进行像素级的图片造假分析。但从文本逻辑、实验设计和数据呈现上,发现了典型的"避重就轻"式包装痕迹。)
详细发现
发现 1:🟠 实验设计的"田忌赛马" (方法学异常)
- 位置:Figure 3 / Figure 4 文本描述处
- 描述:论文声称 FBM(本文提出的模型)在准确性和泛化性上击败了标准的 MLP(多层感知机)。然而,在实验设置中(Figure 3 caption),作者仅仅使用了 1000张 MNIST 手写数字进行训练,并用 4000 张进行测试。
- 证据:在当今深度学习领域,MNIST 的标准训练集是 60,000 张。使用仅 1000 张图片训练一个 784-1000-10 结构的标准 MLP,必然会导致严重的过拟合或性能低下。作者特意选择了一个对标准反向传播极其不利的"极小样本"环境,以此来衬托 FBM 的优越性。这就好比为了证明自己的三轮车跑得快,非要拉着别人的法拉利在泥地里比赛,胜之不武。
- 严重程度:🟠 (属于严重的夸大和选择性比较)
发现 2:🟡 代码与数据开源的"薛定谔状态"
- 位置:Appendix A 及 Reference [31]
- 描述:作者在文中声称 "Codes realizing the FBM training are available in our GitHub page [31] (to be released upon formal publication of the paper)"。
- 证据:结合当前基准日期(2026年6月17日),该论文标定的日期是2024年7月。通常预印本上线后数月便会正式发表,至今已近两年。如果代码仍未随着论文正式发表而公开,或者需通过邮件向作者讨要,这在计算科学领域是一种极其不规范的"空手套白狼"行为,极大阻碍了同行对 Figure 3-5 真实实验数据的复现。
- 严重程度:🟡
发现 3:🟡 "随机数生成器不如"式的低样本统计
- 位置:Figure 2, Figure 3, Figure 4 captions
- 描述:作者多次提到误差线的计算方式为 "Error bars are computed/estimated from five independent runs."(误差线由五次独立运行计算得出)。
- 证据:在统计机器学习的实验中,仅仅跑 5 次取平均值和标准差是非常脆弱的。由于随机种子的不同,深度学习模型(尤其是在小样本数据集上)在 5 次运行中的方差可能极大。用区区 5 次的结果来断言存在"双峰现象"(Figure 4)或鲁棒性优势,在统计学上是不严谨的。
- 严重程度:🟡
发现 4:🟢 附带数学计算的自洽性审查
- 位置:Appendix A: Algorithmic details of FBM training
- 描述:逐一检查了作者举例的配对计算逻辑。
- 证据:作者写道 "we have a total of 10 images... two images of handwritten digit zero and eight images of handwritten digit one. We thus have sixteen fermion pairs and twenty-nine boson pairs."
- 费米子对(不同类):2 × 8 = 16。(计算正确)
- 玻色子对(同类):Class 0 中选 2 个为 \(C_2^2 = 1\);Class 1 中选 2 个为 \(C_8^2 = \frac{8 \times 7}{2} = 28\)。合计 1 + 28 = 29。(计算正确)
- 结论:此处造假者经常因为编写不出配对公式而露馅,作者的离散数学逻辑自洽,排除了低级编造的可能。
- 严重程度:🟢 (加分项)
发现 5:🟡 引用的"自产自销" (引用与方法学异常)
- 位置:References [10], [15], [16], [20], [27], [28]
- 描述:在短短 32 篇参考文献中,有 6 篇是通讯作者 Haiping Huang 的自引(甚至包括其撰写的书籍 [20])。
- 证据:高达近 20% 的自引率虽然算不上学术不端,但典型的"学术圈子自嗨"特征明显。文章所引用的自己过往工作,多数用于支撑其"局部学习"和"生物学合理性"的直觉性假设,缺乏外部独立研究组的广泛交叉验证。
- 严重程度:🟡
发现 6:⚠️ 图表分析受限说明 (图片检测盲区)
- 位置:Figure 1 - Figure 6
- 描述:由于仅获得纯文本信息,未能提取出原始的高清图片。
- 证据:耿同学六式中的第一式(图片复用)、第三式(PS痕迹)在此类计算物理/机器学习纯理论偏交叉的论文中最常表现为:曲线的平滑度过高、散点图呈现非自然的完美正态分布、或不同条件下的理论曲线直接由同一个公式稍作平移生成。当前缺乏图片,无法坐实以上行为。
- 严重程度:信息缺失
耿同学辣评
"理论推导上天衣无缝,附带的数学验证也滴水不漏,这本是做计算物理的严谨基本功。但一到做实验环节就开始玩花活——拿着 1000 张图去碰瓷标准 MLP,跑 5 次就敢画误差线说自己是双峰,代码还要等'正式发表'才放(这一等就是两年起步)。这套'田忌赛马+薛定谔的代码'的组合拳,打得是真精明啊!理论做得这么扎实,何苦在实验设计上搞这种小动作呢?"
建议后续行动
- 访问作者提到的 GitHub 链接(https://github.com/PMI-SYSU/FBM),核实代码是否在 2026 年的今天真的开源。如果依然未开源,可直接判定其缺乏实验复现性。
- 若代码已开源,检查其 MLP 对照组的超参数调优情况(学习率、Epoch等),确认是否故意劣化了 MLP 的表现(即打败了"稻草人")。
- 向作者发送邮件,要求提供构成 Figure 3 和 Figure 4 的原始实验 Logging 日志(如 TensorBoard 记录),以验证 5 次 independent runs 的真实性。
- 在 PubPeer 上提出质疑,重点探讨其实验设计(N=1000 训练集)在证明结论上的有效性问题。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。