蛋白质多类型结合位点预测研究:基于边感知图神经网络的方法与系统实现
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:蛋白质多类型结合位点预测研究:基于边感知图神经网络的方法与系统实现
- 作者:杨维森
- 期刊/机构:景德镇陶瓷大学硕士学位论文
- DOI:未提供
- 发表年份:推测为 2025/2026 年(基于参考文献年份)
- 论文来源:蛋白质多类型结合位点预测研究:基于边感知图神经网络的方法与系统实现_杨维森.pdf
综合评定:🟠 高度可疑
详细发现
发现 1:数据异常重复(随机数生成器都不如)
- 位置:表 3-4(1H9D_A 预测的高置信度蛋白质结合位点)/ Page 41
- 描述:在预测 DNA/RNA 结合位点的案例中,表 3-4 列出的残基 ASP 66 和 LEU 62 的平均预测概率(mean_probability)竟然完全一致,精确到了小数点后四位:
0.9558。 - 证据:在真实的深度学习模型推理过程中,两个不同位置、不同理化性质的氨基酸残基(天冬氨酸 vs 亮氨酸),其经过多层图注意力网络计算后输出的 Sigmoid 概率值,能在小数点后 4 位实现 100% 完全重合的概率极低。这通常是把数据拉进 Excel 里手动编造或复制粘贴时不小心留下的“马脚”。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 2:统计评价指标的逻辑割裂
- 位置:表 3-2(Edge-aware GAT 模型在五类结合位点预测任务上的性能指标)/ Page 36
- 描述:在 DNA/RNA 结合位点的预测结果中,模型展现出极高的整体区分能力(ROC-AUC = 0.933)和不错的精确率-召回率曲线下面积(PR-AUC = 0.765)。但是,该类别的 F1 分数却仅有 0.512。
- 证据:PR-AUC 高达 0.765 说明模型绝对具备在各个阈值下平衡 Precision 和 Recall 的潜力。在表 3-1 的算法流程中,作者声明使用的是固化的
0.5作为判定阈值。如果 PR-AUC 有 0.765,却用 0.5 阈值得到了低至 0.512 的 F1 分数,意味着作者根本没有去寻找最优阈值,或者这个 PR-AUC 的数值存在水分。真实实验中,通常会报告在最佳阈值下的 F1 或单独列出 Precision 和 Recall,这种“高分低能”的数据组合略显生硬。 - 严重程度:🟡
- 复核状态:✅ 成立
⚠️ 发现 3:无法进行像素级图片审查
- 位置:Figure 3-1 至 Figure 4-4
- 描述:本文为纯文本提取格式,未提供原始的高清图片文件。
- 证据:根据学术打假常规流程,Western Blot、显微镜图、甚至损失函数曲线图都需要进行像素级噪点比对和 PS 痕迹分析。由于当前文本中未包含足够的原始图片信息,无法进行“一图多用”和“图片拼接”的实锤检测。
- 严重程度: informational
- 复核状态:⚠️ 依据不足
发现 4:引用与时间线逻辑(真实有效)
- 位置:参考文献列表 / 全文
- 描述:基于当前日期(2026-06-25),重点核查了文献的时间线。文中引用了大量 2025 年和 2026 年(如文献[21] PLOS Comput Biol 2026; 文献[38] 2026)的最新研究。
- 证据:这些文献的卷期号逻辑与截至 2026 年中的时间线是自洽的。此外,实验环境使用了 RTX 4090 显卡,符合近两年深度学习科研算力的常规配置,未发现使用“未来设备”或已停产老古董的异常现象。Web系统部署描述的并发瓶颈(单卡 4090 跑 Flask 挂载深度学习模型,10-20人并发时响应3秒,50人崩溃)极其符合真实工程落地的表现。
- 严重程度:✅
- 复核状态:✅ 成立
耿同学辣评
系统开发部分写得挺像那么回事儿,单卡 4090 跑并发被 50 个用户挤崩的画面太有画面感了,工程量是实打实做了的。但是!表 3-4 里那俩不同的氨基酸(ASP66 和 LEU62)算出来的 Sigmoid 概率在小数点后 4 位严丝合缝地对上(0.9558),深度学习模型又不是你肚子里的蛔虫,哪能精确到这份上?这大概率是建表的时候 Ctrl+C 和 Ctrl+V 按串行了。此外,表 3-2 里 DNA/RNA 结合位点的评价指标存在明显的逻辑冲突,PR-AUC 高达 0.765 却用 0.5 阈值跑出仅有 0.512 的 F1 分数,说明作者对模型评估指标的理解可能流于表面,或者干脆就是凑数据露了馅。搞工程落地值得鼓励,但在学术严谨性和数据真实性上可千万不能糊弄!
建议后续行动
- 联系作者要求提供 1H9D_A 蛋白质推理的原始日志文件,核实 ASP66 和 LEU62 的真实概率输出。
- 建议作者公开代码库或补充说明表 3-2 中各评价指标(特别是 F1 和 PR-AUC)的具体计算逻辑与阈值选择依据。
- ( Optional )如果在 PubPeer 或相关学术平台讨论,可针对表 3-4 的概率重合现象及表 3-2 的数据割裂问题提出友善的疑问。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。