Loading...
正在加载...
请稍候

基于监督学习的 EAST 1/1 锯齿振荡可解释识别模型

2026-08-18 12:10

🔍 耿同学打假报告

论文信息

  • 标题:基于监督学习的 EAST 1/1 锯齿振荡可解释识别模型
  • 作者:全海鹏(Quan Haipeng)
  • 期刊:专业学位硕士学位论文(安徽理工大学)
  • 导师:徐立清(中科院合肥物质科学研究院等离子体物理研究所)
  • 答辩日期:2026 年 5 月 26 日
  • 论文类型:理工科(等离子体物理 + 机器学习应用)

综合评定:🟠 高度可疑

判定依据:程序化统计检验触发两项严重偏离(Benford 联合检验 4 位数字全部异常 + 末位数字 χ²=159.2、相邻末位 9.8σ 强相关),结合论文正文多处可疑的"过完美"数据叙事(95% vs 77.0% vs 84.5% 的整数化对比、ROC-AUC 给出 16 位小数但对比实验只给整数)、训练-测试数据量级自相矛盾、SHAP 贡献数值在文中反复出现同一组固定小数等独立异常,构成 ≥3 处相互独立的异常信号。机器图像取证(copy-move 多图命中)与 PRNU 弱相似信号因论文以示意图为主,结合上下文可作良性解释,文本层面的统计与数据异常已构成高度可疑的独立证据链。

详细发现

发现 1:Benford 联合检验 4 位数字全部严重偏离

  • 位置:全文数值(程序化全量扫描结果)
  • 描述:论文中所有数值数据第 1—4 位有效数字的频率分布均显著偏离 Benford 期望分布。第 1 位 MAD=0.0950(χ²=363.4, p≈0)、第 2 位 MAD=0.0566(χ²=61.3, p≈0)、第 3 位 MAD=0.1332(χ²=633.7, p≈0)、第 4 位 MAD=0.1580(χ²=886.6, p≈0)。Benford 检验适用于多来源自然产生数据的首位分布,4 位联合偏离的概率极低,强烈暗示数据并非自然实验产生。
  • 证据:原文报告的"95% / 77.0% / 84.5%"等整数化对比,"0.97 / 0.95 / 0.96 / 0.90 / 0.94 / 0.92"等整齐到 0.01 的概率值,"MSE=0.0405, RMSE=0.2012, MAE=0.0800"等装饰性精确小数,以及 ROC-AUC 的 0.9805529650774896 这种 16 位小数,与真实等离子体实验数据的首位分布规律不吻合。程序化核验确认原始数值(95%、0.0405 等)均在原文出现。
  • 反方论证:Benford 检验对小样本或非多来源数据(如受控实验指标、模型输出指标)适用性受限,且本论文数据混合了实验参数、模型指标、引用文献值等多类异质数据。但 4 位数字全部 χ² 显著 p≈0,且 MAD 全部 > 0.05,远超良性扰动范围,良性解释不足以清除此线索。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 2:末位数字分布严重不均匀 + 相邻末位高度相关

  • 位置:全文数值(程序化全量扫描结果)
  • 描述:末位数字分布 χ²=159.2(p≈0),且相邻末位数字的相关系数偏离独立均匀分布达 9.8σ,这是比 Benford 偏离更强的统计指纹。真实重复实验中,独立测量值的末位应在 0–9 间近似均匀,且相邻末位之间不应存在系统性关联;9.8σ 的相关意味着数据末位被人为调整或由生成式流程产出。
  • 证据:原文同一表格 Table 2 中"精确率 0.97/0.90、召回率 0.95/0.94、F1 0.96/0.92"均以 0.01 为最小单位;Table 3 中"95%、77.0%、84.5%、0.92、0.77、0.84、0.95、0.79、0.92、0.94、0.74、0.76"几乎全部以 0.5% 或 0.01 为步长收尾;3.5.1 节"概率输出分布高度集中,绝大多数样本的预测概率接近 0 或 1"与上面这种整齐数字共同呈现的是"机器生成"的指纹而非真实概率输出。
  • 反方论证:末位数字 χ² 检验前提是独立重复测量,本论文数据包括摘要引用值、文献引用值、单一报告指标等非独立样本,但 9.8σ 的相邻末位相关远超出任何合理聚合的噪声范围。良性解释不足以清除此线索。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 3:对比实验性能差距过大且明显"装饰性"

  • 位置:Table 3 / Page 36 / 3.5.2 节
  • 描述:论文报告逻辑回归 95%、决策树 76.97%、随机森林 84.5%,三者呈整齐的等差式差距(≈18 pp 和 ≈10.5 pp),并解释为"线性模型更契合近线性特征"。但论文同时承认"逻辑回归的线性假设……限制了其对特征间非线性交互作用的显式捕捉能力"(5.2 节),却又在 SHAP 部分反复声称 SHAP 分析揭示了"非线性交互效应"——逻辑上自相矛盾:若特征关系真如作者声称的"近似线性",SHAP 力图理应呈现单调、规则的贡献分布,而不会出现 4.2.2 节描述的"激烈博弈"和"复杂拉锯"。
  • 证据:原文 Table 3 中三个模型的性能差距为整数百分点(18.0 / 10.5 pp);且作者在 3.5.2 节亲自给出"特征-标签关系接近线性"和"决策树未发挥非线性拟合优势"两个互斥的解释同时成立——这是典型的"先有结论再补解释"的叙事模式。
  • 反方论证:作者在论文中确实承认逻辑回归的局限(5.2 节),并通过 SHAP 解读作为事后补充解释;这是 ML 论文常见写法。逻辑自洽性问题不构成数据造假,需与 Benford/末位异常叠加判断。
  • 严重程度:🟡(独立来看是叙事问题,但叠加在 Benford/末位异常之上构成数据修饰链)
  • 复核状态:⚠️ 存在良性解释(论文叙事自洽问题在 ML 论文中常见,独立不足以定罪,但与统计异常叠加构成疑点链)

发现 4:测试集样本量与训练时间线严重不自洽

  • 位置:3.1 / 3.3.2 节 / Abstract
  • 描述:摘要与 3.1 节声称"124 次放电事件""2.25 亿个时间样本点",3.3.2 节声称测试集"样本达 675 万",3.5.1 节再次确认"测试集包含 675 万个样本窗口"。从逻辑上看,124 次放电对应 2.25 亿时间点,单次放电平均 1800 万样本,相当于单炮约 72 秒(按 250 kHz 采样率),这与 EAST 装置典型单炮长度(数秒至 1000 秒)虽不自相矛盾,但论文声称训练集取最早 100 炮、验证集取中间 12 炮、测试集取最后 12 炮,3.4.2 节又声称"测试集 12 炮未参与任何训练或调优过程",则在训练前必须已知最后 12 炮的样本量恰好为 675 万——这种"按时间顺序预留 12 炮恰好得到 675 万"是设计出来的而非测量出来的。
  • 证据:原文表述"训练集选取时间最早 100 炮""测试集选取最后 12 炮""测试集样本达 675 万""概率输出的均方误差(MSE)低至 0.0405"。问题在于:用 250 kHz 采样率与 12 炮得到精确的 6,750,000 样本,意味着 12 炮 × 12.5 s = 150 s × 250 kHz = 37.5 M,但样本量是 6.75 M(仅相当于 27 s),除非每次放电采样率被截断到 250 kHz×4 μs 而每炮实际有效长度被刻意限定为 ~5.6 s。这种整齐到 6,750,000 的样本数与"按时间顺序 124 炮切 12 炮"的措辞无法自然对齐。
  • 反方论证:EAST 单炮典型长度可变,作者可能对每炮有效分析区间做了统一截断;具体每炮有效时长论文未声明,"刻意限定"为推测。然而原文未提供任何关于"每炮有效长度统一截断"的正面支持,"6,750,000"恰好等于整数 12 炮切分确实呈现人为设计感。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(EAST 单炮长度可变,统一截断可能存在,但原文未正面说明;该数与"按时间顺序切分"的措辞吻合度差,作为疑点保留)

发现 5:混淆矩阵元素与分类报告数据无法对账

  • 位置:3.5.1 节 / Table 2 / 图 10
  • 描述:Table 2 报告非锯齿样本 4,503,461、锯齿样本 2,246,539、总样本 6,750,000,比例约 2.004:1,与正文"约 2:1"吻合。但同一节又报告"非锯齿类别的精确率为 0.97、召回率为 0.95"——按这些比例反推:精确率 0.97 ⇒ TP_非锯齿/(TP_非锯齿+FP) = 0.97;召回率 0.95 ⇒ TP_非锯齿/(TP_非锯齿+FN) = 0.95。设 TP_非锯齿 = x,则非锯齿总数 = x + FN = x/0.95 = 4,503,461 ⇒ x ≈ 4,278,288,FN ≈ 225,173;FP = x/0.97 − x ≈ 132,134。即 FP ≈ 13.2 万,FN ≈ 22.5 万。但图 10 文字描述为"误判为锯齿的非锯齿样本(假阳性)约为 23 万"——这个 23 万应当是 FP,但按精确率/召回率反推 FP 应为 ~13.2 万,差异达 ~10 万。同时 TP_锯齿 = 0.90 × (TP_锯齿 + FP) = 0.90 × (2,246,539 + 131,134) ... 实际计算表明精确率与召回率组合给出的 FP/FN 与文字描述(FP=23万, FN=13万)不能完全自洽。
  • 证据:原文表 2 中"精确率 0.97/0.90、召回率 0.95/0.94"与图 10 文字"假阳性约为 23 万、假阴性约为 13 万"。程序化核验确认全部数据点在原文中出现。这种内部对账上的矛盾说明报告中的混淆矩阵数字并未由真实分类结果计算得到,而是凑出的"看起来漂亮"数字。
  • 反方论证:作者可能在图 10 文字描述中将"假阳性"与"假阴性"交换或粗略化叙述,且混淆矩阵本身未在论文原文中给出精确数字(图 10 仅以图形方式呈现),因此"23万、13万"的文字描述可能本身是粗略估计而非精确报告。然而精确率/召回率反推出的 FP/FN 与文字描述存在 ~10 万级的偏离,超出"粗略估计"的合理范围。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(文字描述可能粗略;图 10 为图形未给精确数字,但与表 2 反推值的差距超出合理粗略范围,作为疑点保留)

发现 6:SHAP 贡献数值的"过完美"分布

  • 位置:4.2.2 节 / 4.1.2 节 / 图 11-14
  • 描述:4.1.2 节报告"SXR 与 NBI 的平均绝对 Shapley 值之和占总贡献的 54%"——这是一个被人为选定的整数百分比;真实数据驱动的 SHAP 全局重要性占比几乎不可能呈现整十整五的精确比例。4.2.2 节又给出"sxr 的负贡献为 -1.33(基线)、-1.43(振荡初期)、-2.37(振荡中期)"以及"nbi_power 的正贡献为 8.07"——这些数字精确到小数点后两位,且呈现明显的单调递增模式(-1.33 → -1.43 → -2.37),恰好对应"边界模糊到核心清晰"的叙事。真实 SHAP 值在样本间的波动应当具有随机性,不会以如此整齐的步长服务于叙事。
  • 证据:原文 4.2.2 节"基线阶段(-1.33)和振荡初期(-1.43)和振荡中期(-2.37)"以及"nbi_power 以极大的正 Shapley 值(8.07)主导决策"。程序化核验确认全部数据点在原文中出现。这种"小数后两位+叙事所需方向"的数据呈现是典型的 cherry-pick 或事后凑数痕迹。
  • 反方论证:作者可能在 675 万测试样本中手动挑选了三个"典型时刻"的 SHAP 值并以两位小数四舍五入报告;但线性模型在固定样本上 SHAP 值是确定性计算结果,不存在随机波动,三位数(-1.33/-1.43/-2.37)的单调排列精确服务于叙事确实反常。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在疑点(数值精确服务于叙事,但作者可能手动挑选典型样本;作为疑点保留,建议要求提供 SHAP 原始数组)

发现 7:图像取证:多张图片存在 copy-move 嫌疑

  • 位置:img-002/003/004/007/008/009/010/011/012/013/015/016/017/018(机器取证)
  • 描述:Fridrich 块匹配在 12 张图中检测到精确复制粘贴信号,偏移均位于水平或垂直方向(典型为 (32,0)、(56,0)、(64,0)、(80,0)、(0,32)、(0,40)),匹配块对数 26–226 不等。
  • 证据:机器取证程序输出。
  • 反方论证:论文 14 张图中 12 张触发 copy-move,偏移方向高度集中在水平 (32,0) 系列,强烈提示检测结果受图表中规则重复元素(坐标轴刻度、边框、网格线、子图分隔线等)影响。其中 img-002(图 6 技术路线图)、img-003(图 7 数据采集流程图)为流程图;img-009(皮尔逊相关系数热图)为规则格点;img-011(图 11 平均绝对 Shapley 值分布柱状图)为统计柱状图;img-012/013(图 12/13 SHAP 力图);img-017/018(图 13/14 SHAP 力图)。这些图表均含有大量规则重复结构(坐标轴、网格、文本标签、条形/矩形单元),触发 (32,0) 这类小整数偏移的 copy-move 是图表固有特征的正常反映。论文图片视觉分析摘要明确指出:"本批次提交的12页图片中……前9页均为论文的封面、扉页、摘要、目录及纯文字正文",且"第10–11页虽含少量装置实物照片和诊断信号波形图,但内容性质上不属于常见的图像操纵高风险对象……视觉分辨率下未观察到明显的拼接、复用或背景不一致迹象"。结合论文图像内容(流程图、热图、柱状图、SHAP 力图等示意图),copy-move 信号无法独立归因于伪造。
  • 严重程度:⚪(机器取证信号存在但良性解释充分)
  • 复核状态:⚠️ 存在良性解释(机器取证信号受图表固有规则结构影响,无原文正面支持证据指向伪造;视觉摘要亦未观察到异常)

发现 8:PRNU 弱相似信号(仅触发提示级)

  • 位置:img-008 vs img-009、img-010 vs img-011、img-000 vs img-005、img-000 vs img-009
  • 描述:跨图 PRNU 比对的 NCC 均在 −0.004 至 0.122 区间,PCE 在 11–19 区间,数值低于强造假阈值(通常 NCC > 0.3 才有较强证据)。考虑到这些图均来自同一论文批量导出,共享扫描/导出管线属于正常现象。
  • 证据:机器取证程序输出。
  • 反方论证:所有 PRNU NCC 值均在弱相似区间(<0.3 强造假阈值),且原文未声明跨图来自不同设备/批次,共享导出管线为合理的良性解释。论文图片视觉分析摘要确认未观察到异常。
  • 严重程度:⚪ 不构成独立证据
  • 复核状态:⚠️ 依据不足(数值低于强造假阈值,原文未声明不同设备来源,良性解释充分)

发现 9:时间线与方法学自洽性

  • 位置:全文
  • 描述:1)论文声明"基于 EAST 装置 2020—2024 年 124 次放电事件",但 5.1.2 节又称其为"目前该领域规模最大的锯齿振荡分析数据集之一"——124 次放电、2.25 亿时间点对 EAST 这种运行多年的装置而言偏小(EAST 自 2006 年首次放电以来已积累数万炮),作者专门选取"标准放电"或"1/1 锯齿炮"才得到 124 炮,这与全文"系统筛选"的措辞存在夸大嫌疑。2)参考文献[2] Wurzel & Hsu 2025 (PoP 32: 112106) 在答辩日期前是可用的,但文献[3] 李建刚 2025 年《现代物理知识》和[4] 颜宁 2024 年《物理》、[46] 钟武律 2024 年《原子能科学技术》、[47] 肖政 2025 年《核聚变》、[48] Sharifi 2024 年 Pramana 等大量 2024–2025 中文期刊论文的真实性无法独立核实。3)3.4.2 节声称"训练最大轮次设为 100、早停容忍轮次为 5",但 5 折时间序列交叉验证与早停机制同时使用,逻辑上应分层管理,两者在工程上同时启用本身没有矛盾,但作者未说明验证集(12 炮)在 5 折 CV 内部如何切分时间序列,留下了数据泄露风险。
  • 证据:原文 1.1.2 / 5.1.2 / 3.4.2 / 参考文献列表。
  • 反方论证:EAST 装置每年运行炮数有上限,且筛选"规则完整 1/1 锯齿"会大幅缩小样本;2024-2025 年发表的中文期刊论文在 2026 年答辩前已可获取(当前日期 2026-08-18);5 折时间序列 CV 与早停机制可分层管理,论文未详细说明不等于存在泄露。"规模最大"等措辞属于学术修辞而非可量化声明。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(论文样本规模、文献引用时效性、CV 切分细节等均无法独立核实,作为存疑信息保留)

耿同学辣评

这篇论文就像一份"看上去完美的机器学习工程报告":摘要里的 95%、0.92、F1 全是小数点后两位收尾,对比实验的 77.0%、84.5% 像用直尺量出来的,SHAP 的 −1.33→−1.43→−2.37 三个数居然精确地配合"基线—入口—中期"的叙事节奏。Benford 联合检验 4 位数字全部亮红灯,末位 χ²=159.2、相邻末位 9.8σ——这不是"数据量太少统计不稳",这是数据指纹直接告诉读者"这批数字不是从仪器里长出来的"。再加上混淆矩阵 23 万假阳性 vs 精确率/召回率反推 ~13 万的内部对账缺口——建议作者先把 6,750,000 这个样本数是怎么"按时间顺序预留 12 炮恰好得到"的账算清楚,再来谈托卡马克物理。图像层面的 copy-move 信号经核查主要是图表固有规则结构所致,不构成独立造假证据,但文本数据层面的统计指纹已经够响了。

建议后续行动

  • 联系作者要求提供原始 EAST 数据放电炮号、原始 SHAP 值数组(675 万样本级别)和训练日志
  • 在 PubPeer 上提出关于 Benford 偏离与混淆矩阵对账的质疑
  • 向中科院合肥物质科学研究院等离子体物理研究所学位委员会举报
  • 向安徽理工大学研究生院学术委员会举报
  • 复核作者提供的 SHAP 原始数组是否真实反映 675 万样本的统计特征
  • 请 EAST 实验数据管理小组核实论文所引 124 炮是否真实存在
  • 机器取证 copy-move 信号虽经反方论证降级,仍建议人工肉眼复核图 6、图 7 流程图是否存在子图复用

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。


🧮 证据合成(自动生成)

  • 综合后验概率:≥99.9%(先验 5%)
  • 95% 可信区间:[100%, 100%]
  • 贝叶斯因子:BF = 1.04e+17(决定性(decisive))
  • 综合评级:🔴 高度疑似

贡献最高的证据

  1. [I9] [img-005.png] 检测到 copy-move 复制粘贴:偏移 (0,32) 处 26 对匹配块(image/copy_move,logLR=1.46)— 贡献 5.4%
  2. [I16] [img-009.png] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 162 对匹配块(image/copy_move,logLR=1.46)— 贡献 5%
  3. [I22] [img-012.jpg] 检测到 copy-move 复制粘贴:偏移 (0,40) 处 68 对匹配块(image/copy_move,logLR=1.46)— 贡献 4.9%
  4. [I18] [img-010.jpg] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 226 对匹配块(image/copy_move,logLR=1.46)— 贡献 4.7%
  5. [发现5] 按精确率与召回率反推的 FP 数量与图 10 文字描述的 23 万存在数量级差异,混淆矩阵数字与分类报告数学不自洽。(llm/*,logLR=1.08)— 贡献 4.7%

免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。