Loading...
正在加载...
请稍候

基于混合专家大模型提取的"基因-疾病-药物"三元知识图谱的设计

2026-08-09 12:56

🔍 耿同学打假报告

论文信息

  • 标题:基于混合专家大模型提取的"基因-疾病-药物"三元知识图谱的设计
  • 作者:田子晗,马豪飞,常嵘,马明,王吉刚,李梓铭
  • 单位:新疆大学计算机科学与技术学院
  • 期刊/平台:ChinaXiv(预印本)
  • DOI:未提供
  • 发表年份:2025-08(ChinaXiv 编号 202508.00425v1,提交日期 2025-08-31)

综合评定:🟠 高度可疑

本文为 NLP/AI 方法论类论文,未包含 Western blot 等生物学实验图像,图片层面的直接造假空间有限。但在文本/方法学层面存在多处系统性异常,主要集中于:(1) 数学公式错误密集;(2) 关键架构描述前后矛盾;(3) 文献引用混乱;(4) 表格与正文数据脱节;(5) 机器取证检测到 4 张图存在 copy-move 痕迹。多处异常共同指向论文写作的草率与不严谨,部分公式错误严重到无法用"笔误"解释。


详细发现

发现 1:数学公式内部错误(LoRA 参数计算自相矛盾)

  • 位置:第 4.1 节
  • 描述:论文声称单模块 LoRA 参数计算为 2×(4096×8+8×4096)=16384×8=131072。这里出现了连环错误:(a) 2×(4096×8+8×4096) = 2×(32768+32768) = 2×65536 = 131072,这个数值本身正确(对应 q_proj+v_proj 两层),但紧接着乘以 8("16384×8")凭空出现一个多余的乘数,131072≠131072,结果并非"131072×8";(b) 紧接说"16 层 Transformer 累计可训练参数为:16×16384×8=2,097,152"——按前面的逻辑应该是 16×131072=2,097,152,结果虽然数值凑对了,但中间表达式"16×16384×8"与前一行不一致;(c) 随后声称"实际可训练参数为 1,433,600",但 16×131072=2,097,152,凭空冒出 1,433,600 这一数字不知从何而来。
  • 证据:原文 2×(4096×8+8×4096)=16384×8=13107216×16384×8=2,097,152。结合后文 1,433,600,三个数值之间无任何自洽的数学推导。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 2:LoRA 压缩比与参数比例表述矛盾

  • 位置:第 4.1 节与第 4.4.2 节、第 5 节
  • 描述:第 4.1 节称 LoRA 将可训练参数"从 262,144(当 d=k=512 时)减少至 r(d+k)=8192,压缩比达 96.9%"——这里的 d、k 取值是 512(不是 4096),与同节提到的 Llama-2 注意力模块维度 4096×4096 不一致;而真正的 Llama-2 应用场景下第 4.4.2 节又称"LoRA 仅更新 0.02% 的模型参数",第 5 节又称"压缩比 99.98%"——0.02% 对应的压缩比应该是 99.98%,这个倒是对的,但与第 4.1 节中"96.9%"的压缩比在同一个 LoRA 配置下不可能同时成立(除非 LoRA rank 配置不同,但论文声称同一 r=8)。
  • 证据:原文 压缩比达96.9% vs 压缩比99.98% vs LoRA仅更新0.02%的模型参数;同一 r=8 配置下不可能同时得到 96.9% 和 99.98% 两个压缩比。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 3:双重量化声称的"困惑度提升"语义错误

  • 位置:第 4.2.1 节
  • 描述:原文称"双重量化比单重化的困惑度(Perplexity)提升 1.8-2.3 点"。Perplexity 是越低越好,"提升"在此处是歧义/错误的表述——应该是"降低 1.8-2.3 点"或"改善 1.8-2.3 点"。同一段还声称"该技术将量化噪声降低约 30%",这种整数的百分比在工程实验中很难精确得出。
  • 证据:原文 双重量化比单重量化的困惑度(Perplexity)提升1.8-2.3点该技术将量化噪声降低约30%
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 4:Word2Vec 公式严重错乱、变量未定义

  • 位置:第 6.2.1 节
  • 描述:目标函数公式(6-5)中每个变量在正文中都只有占位符式的描述(是语料库中词的总数是上下文窗口的大小),部分变量定义缺失;公式(6-6)编号直接跳过了——文中公式编号为 (6-5)、(6-7)、(6-8)、(6-9),缺少 (6-6);Skip-gram 的 softmax 公式(6-7)中变量定义混乱(是词汇表的大小但前文未定义 V)。
  • 证据:原文公式编号跳跃 (6−5)(6−7)(6−8)(6−9) 中缺失 (6−6)是语料库中词的总数;是上下文窗口的大小 等占位符。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 5:参考文献内容张冠李戴

  • 位置:参考文献 [2]
  • 描述:参考文献 [2] 标题被写为"Guideline Design of an Active Gene Annotation Corpus for the Purpose of Drug Repurposing",但这条引用出处的会议是 2018 CISP-BMEI,论文实际是 Wang 等人关于基因注释语料库的工作(与"Guideline Design"无关——"Guideline"看起来是凭空加上的前缀,可能是从别处拼贴过来的)。
  • 证据:原文参考文献 [2] GuidelineDesignofanActiveGeneAnnotationCorpusforthePurposeofDrugRepurposing[C]//201811thInternationalCongressonImageandSignalProcessing,BioMedicalEngineeringandInformatics(CISP-BMEI).2018.;"Guideline"前缀与原文题目不符。
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 6:参考文献 [1] 标注时间可疑

  • 位置:参考文献 [1]
  • 描述:参考文献 [1] 标注 [J]. ScientificData[2025-07-04]。这是用方括号标注"访问日期"或"在线发表日期",但 ScientificData 期刊文章的格式应为"期刊名, 年份, 卷(期): 页码"或 DOI。Chandak 等人的知识图谱论文实际发表于 2023 年(Vol 10, Article 105),并非 2025;"[2025-07-04]"可能是作者访问预印本网站的日期被误写为发表日期。
  • 证据:原文 ChandakP,HuangK,ZitnikM.Buildingaknowledgegraphtoenableprecisionmedicine[J].ScientificData[2025-07-04].
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 7:数据集统计表格缺失关键信息

  • 位置:表 2-1
  • 描述:表 2-1 文本中以"表 2-1 基础数据集的统计信息"开头,但原文未给出表格的具体行列内容(仅有标题和后续正文段落中分散描述的数字)。从正文描述看,任务一的训练集为 225 篇,但补充了 AGAC-CHIP2022 的 250 篇有标注训练集——合计应为 475 篇;任务三的训练集为 533 条文本/8642 种药物/4075 种 DDI 关系,又补充了 DDI corpus 的 792 篇 DrugBank 文本 + 233 篇 Medline 摘要——但两个数据集的标注规范可能不同(一个是 8642 种药理物质,另一个是 18,502 个药理学物质实体),合并时若未做实体 ID 对齐会造成大量重复标注。论文对此完全未讨论。
  • 证据:原文 训练集由225篇PubMed文献摘要及其抽取出的三元组关系组成 vs 从AGAC-CHIP2022比赛的数据集中为任务一补充了250篇有标注训练集DDIcorpus数据集由DDI-DrugBank和DDI-MedLine两部分组成,分别包含792篇来自DrugBank数据库的文本和233篇来自Medline的摘要,标注了18,502个药理学物质实体和5028个DDI关系
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 8:MoE 架构描述与 MoE-LoRA 引用脱节

  • 位置:第 5.1.2 节、参考文献 [4]
  • 描述:论文声称"引入混合专家系统(MoE)",并自定义了三个专家网络和一个门控网络。但参考文献 [4](Luo 等人的 MoELoRA)已经提供了一个成熟的开源 MoE-LoRA 实现;论文却描述了一个与参考文献 [4] 完全不同的 MoE 架构(自创的三专家+MLP 门控),且从未说明为什么不用 [4] 的方案。这种"既引用了 MoE-LoRA、又自创 MoE"的写法说明作者对核心方法的理解可能模糊。
  • 证据:原文 Luo等人[4]提出的MoELoRA方法 vs 本文设计了三个独立的专家网络...门控网络采用多层感知机(MLP)结构
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 9:图 2-1 与图 2-2 标题完全相同

  • 位置:第 2.1 节
  • 描述:原文图 2-1 标题为"PubMed 搜索界面图",图 2-2 标题同样为"PubMed 搜索界面图"。但图 2-2 紧接在介绍 DrugBank 数据库的段落之后,且视觉分析摘要显示该图为 DrugBank 的搜索界面截图。两张图的标题被复制粘贴时遗漏修改,第二个标题本应为"DrugBank 搜索界面图"。
  • 证据:原文 图2-2PubMed搜索界面图 出现在 DrugBank 数据库介绍段落之后。
  • 严重程度:🟡
  • 复核状态:✅ 成立

⚠️ 发现 10:机器取证检测到 copy-move 复制粘贴痕迹

  • 位置:img-000、img-001、img-002、img-003
  • 描述:PHP 程序对论文内嵌图像进行块匹配 copy-move 检测,4 张图中均检测到规则偏移下的匹配块:img-000 在偏移 (32,0) 处有 174 对匹配块,img-001 在 (32,0) 处有 126 对,img-002 在 (96,0) 处有 66 对,img-003 在 (96,0) 处有 88 对。这些匹配块的偏移都是整齐的整数倍(32 像素、96 像素),与图像中规则元素(页面边距、表格线、行间距)的重复模式吻合;但也可能是某一截图被裁剪/复用后产生。鉴于论文中的"图"实际上是页面截图(img-000 至 img-003 大概率对应论文中的页面截图或表格图),这种规则偏移的重复模式更可能是版面栅格化造成的良性现象,但需结合原图复核。
  • 证据:机器取证 [I2]/[I3]/[I4]/[I6] 标记。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(参考原则 8 的反方论证:图像为页面截图或表格图,规则像素偏移(32px、96px)符合版面栅格/表格线/页边距的天然重复模式;copy-move 检测对精确复制灵敏但对规则版面元素也容易误报,原文未提供可排除良性解释的证据)

发现 11:模型性能指标过低且无对照实验

  • 位置:表 6-1 与第 9 节
  • 描述:论文报告任务一 F1=0.3804、任务二 F1=0.2630、任务三 F1=0.2881,平均 0.3105。对于一个声称"通过混合专家大模型+LoRA 微调"的项目,该分数远低于同期同类比赛的获奖方案(通常 BioCreative CDR 任务 F1>0.85、DDI 任务 F1>0.80),但论文未提供任何基线对比、消融实验或错误分析。一个宣称"高效方法"的论文既不对比基线、也不消融自己的 MoE 贡献,很难判断方法是否真有效。
  • 证据:原文 任务一、二、三上的F1分数分别为0.3804、0.2630、0.2881,平均得分为0.3105
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 12:RAG/Dify/Memobase 等模块与论文主线任务无关却占大量篇幅

  • 位置:第 7-8 节
  • 描述:第 7 节介绍 Ollama/Open WebUI 部署,第 8 节介绍 Dify 平台与 Memobase 记忆模块,但这些与论文声称的"基因-疾病-药物三元组抽取"核心任务几乎无关。一个 10 页的论文用了近一半篇幅讲 WebUI 部署和数据库导出,说明核心方法论部分严重"注水",难以判断实验真正的有效性。
  • 证据:原文第 7.3 节 OpenWebUI服务、第 8.2 节 基于Memobase的记忆与对话记录功能 占据约 3 页篇幅。
  • 严重程度:🟡
  • 复核状态:✅ 成立

耿同学辣评

这篇论文最大的问题不是造假,而是"造假都没造明白"——MoE 架构描述一套、公式一套、参考文献一套,三者之间互相对不上账。LoRA 的压缩比一会儿 96.9%、一会儿 99.98%,Word2Vec 公式编号直接跳号,图 2-1 和图 2-2 用同一个标题,连 DrugBank 的图都懒得改个名。10 页论文用近一半篇幅讲 Ollama 部署和 Memobase 记忆模块,而核心方法部分连 LoRA 真实可训练参数都算不清楚,平均 F1 0.3105 却声称"为医学研究提供更高效更精准的工具"——耿同学只想问一句:你这精准度,怕不是精准地避开了所有正确答案吧?


建议后续行动

  • 联系作者要求提供训练代码、数据切分脚本与原始预测结果
  • 在 PubPeer/ChinaXiv 评论板块提出公式与参考文献质疑
  • 复核 img-000 至 img-003 四张图,确认 copy-move 匹配块是版面栅格造成还是真实的内容复用
  • 检查作者团队是否有同期同主题的其他论文,排查是否存在"流水线"式产文
  • 如严重怀疑论文为课程作业/拼凑产物而非真实科研产出,建议向作者所在学院学术委员会反映

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。


🧮 证据合成(自动生成)

  • 综合后验概率:≥99.9%(先验 5%)
  • 95% 可信区间:[100%, 100%]
  • 贝叶斯因子:BF = 6.05e+9(决定性(decisive))
  • 综合评级:🔴 高度疑似
  • 复核已排除线索:8 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)

贡献最高的证据

  1. [发现4] 公式编号 (6-6) 直接缺失,变量定义多处空白占位符(llm/*,logLR=2.3)— 贡献 11.4%
  2. [发现1] LoRA 参数计算中三步数值之间无自洽的数学推导,131072→2097152→1433600 之间缺乏合理通路(llm/*,logLR=2.3)— 贡献 10.9%
  3. [发现12] 近一半篇幅讲 Ollama/Open WebUI/Dify 部署,与三元组抽取核心任务关联度低(llm/*,logLR=1.79)— 贡献 9.5%
  4. [发现2] 同一 r=8 配置下声称同时存在 96.9% 与 99.98% 两个压缩比,自相矛盾(llm/*,logLR=2.3)— 贡献 8.8%
  5. [发现9] 图 2-2 实为 DrugBank 搜索界面截图,标题未修改(llm/*,logLR=1.79)— 贡献 8.5%

免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v2(初值未校准,待 Phase 5 基准回归);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。