Loading...
正在加载...
请稍候

基于混合专家大模型提取的"基因-疾病-药物"三元知识图谱的设计 / Design of a "Gene-Disease-Drug" Triadic Knowledge Graph Based on Mixture-of-Experts Large Model

2026-08-10 01:53

🔍 耿同学打假报告

论文信息

  • 标题:基于混合专家大模型提取的"基因-疾病-药物"三元知识图谱的设计 / Design of a "Gene-Disease-Drug" Triadic Knowledge Graph Based on Mixture-of-Experts Large Model
  • 作者:田子晗,马豪飞,常嵘,马明,王吉刚,李梓铭
  • 作者单位:新疆大学计算机科学与技术学院,新疆乌鲁木齐 830017
  • 期刊/平台:ChinaXiv(ChinaXiv:202508.00425v1)
  • DOI:未提供
  • 发表年份:2025 年 8 月(posted 2025-08-31)

综合评定:🟠 高度可疑

本论文为计算机/AI 应用方向的预印本论文,不涉及 Western blot、显微镜、流式等传统生物医学图像造假的高风险载体;图像层面经反方论证后未达成立门槛,机器取证 copy-move/PRNU 信号缺乏原文正面支持的核心场景(PubMed 与 DrugBank 截图非同一拍摄批次一说在原文中无依据,仅为推测),不构成有效证据。但文本层面的 4 处相互独立的疑点(caption 复制粘贴矛盾、可训练参数推导算术瑕疵、MoE 核心架构在代码层缺失、表 6-1 仅点估计无方差)经原文核验均成立,构成系统性方法学疑点。综合评定为**🟠 高度可疑**。

详细发现

发现 1:图 2-1 与图 2-2 文字说明完全一致(内部矛盾)

  • 位置:第 2 页,2.1 数据集来源节,图 2-1 与图 2-2 的 caption
  • 描述:正文中图 2-1 的 caption 为"图 2-1 PubMed 搜索界面图",图 2-2 的 caption 同样为"图 2-2 PubMed 搜索界面图",但 2.1 节明确说明图 2-2 应为 DrugBank 搜索界面。这一处 caption 复制粘贴错误大概率属于作者/排版疏忽,但排版疏忽本身已构成可核验的内部矛盾。
  • 证据:原文"图 2-1PubMed搜索界面图";"图2-2PubMed搜索界面图";而 2.1 节正文同时声明图 2-1 为 PubMed 搜索界面、图 2-2 为 DrugBank 搜索界面。
  • 严重程度:🟡
  • 复核状态:✅ 成立(机器核验 3 个数据点全部原文命中)

发现 2:数据集统计表 2-1 内部口径不一致

  • 位置:第 2–3 页,表 2-1 及正文 2.2 节、3.2.3 节
  • 描述:任务三的训练集在正文 2.2 节描述为"由 DrugBank 数据库描述的 533 条文本中提取出的 8642 种药物以及其之间 4075 种药物-药物相互作用"——这与 DDIcorpus 语料库本身(792 篇 DrugBank 文本 + 233 篇 MedLine)以及论文后文 3.2.3 节复述的"DDIcorpus 包含从 DrugBank 数据库中选出的 533 条文本,共注释了 8642 种药理物质和 4075 种 DDI"存在口径混用。8642/4075 是 DDIcorpus 整体统计,却被反复表述为"训练集由 533 条文本提取出","提取"与"包含"两个动词在语义上不同;且该口径在 2.2 节、3.2.3 节、补充数据集描述之间反复出现却未给出表 2-1 实际数值(原文仅以表格形式占位,无可读的精确数字),对读者形成核对障碍。
  • 证据:原文"训练集由DrugBank数据库描述的533条文本中提取出的8642种药物以及其之间4075种药物-药物相互作用";以及 3.2.3 节"包含从DrugBank数据库中选出的533条文本,共注释了8642种药理物质和4075种DDI"。
  • 严重程度:🟡
  • 复核状态:✅ 成立(机器核验 3 个数据点全部原文命中)

发现 3:可训练参数数量推导存在算术瑕疵(核心数值矛盾)

  • 位置:第 4 页(4.1 节)与第 5 页(4.4.2 节)

  • 描述:4.1 节给出 LoRA 在 Llama-2-7b 上的可训练参数推导:

    • 单模块 LoRA 参数 = 2 × (4096×8 + 8×4096) = 2 × 65536 = 131072;此处作者写成 2×(4096×8+8×4096)=16384×8=131072,中间表达式 16384×8=131072 实际为 131072 而非 16384×8=131072 的正确算术(16384×8=131072 数值上正确,但拆解逻辑含糊——16384 来自 4096×8+8×4096=65536 这一加法的一半加一次,而非单纯的中间量),可读性差。
    • 接着写"16 层 Transformer 累计可训练参数为:16×16384×8=2,097,152"——这里的 16384×8=131072,但 16×131072=2,097,152 数值正确,但表达式"16×16384×8"又重复了一次 ×8,相当于把 lora_alpha 又乘了一遍,与前文"16384"这一中间量的定义不一致。
    • 紧接着写"结合偏置项优化后实际可训练参数为 1,433,600,占原始模型 70 亿参数的 0.0205%"。
    • 4.4.2 节代码注释"输出:可训练参数 1.43M"——与 1,433,600 表面一致,但建立在 4.1 节自相矛盾的中间推导上。

    反方论证:作者可能只是 LoRA 参数公式排版不规范,把 r 与 alpha 两个超参数都写在了表达式里,1.43M 这一最终结果本身(4.4.2 节 print 输出)与 PEFT 库默认设置下的常见 Llama-2-7b LoRA 量级相符(约 1.4M)。但中间推导步骤 16×16384×8=2,097,152 的写法在算术表达上确实存在瑕疵,最终"占 0.0205%"与"1.43M/70 亿"在数值上自洽(0.0204%≈0.0205%)。综合判断:算术表述瑕疵成立,但不影响最终数值的可信度。

  • 证据:原文"16×16384×8=2,097,152。结合偏置项优化后实际可训练参数为1,433,600,占原始模型70亿参数的0.0205%"以及第 5 页"model.print_trainable_parameters() #输出:可训练参数1.43M"。

  • 严重程度:🟠

  • 复核状态:✅ 成立(机器核验 5 个数据点全部原文命中,中间推导步骤的算术/排版瑕疵在原文中明确可读)

发现 4:MoE 架构被引入但代码层缺失主干(方法学异常)

  • 位置:第 1 页摘要、第 2 页相关工作、第 5–6 页第 5 章

  • 描述:论文标题、摘要、相关工作、第 5.1.2 节反复强调"混合专家模型(MoE)"作为核心框架;但第 4 章全部 LoRA/量化/混合精度训练代码围绕单一 LLaMA-2-7b-chat-hf 基础模型展开,未见任何 MixtralSwitchTransformer 等典型 MoE 底座,也未见门控网络/专家网络的实际权重加载与路由代码;第 5.1.2 节仅在文字层面描述了"三个专家网络+门控 MLP"的设计,未提供该 MoE 模块的初始化、训练、保存的实现路径。简言之,论文宣称的方法在代码层面缺失主干。

    反方论证:MoE 也可被理解为对 LLaMA-2-7b-chat-hf 的"专家化"分工设计(如不同 prompt 路由到不同 LoRA 适配器),作者可能在更高层的调度逻辑中实现路由而未在 4 章展示——但论文原文未给出任何相关描述文字或代码片段,"门控网络采用多层感知机(MLP)结构"仅停留在架构描述层面,缺乏可验证的实现细节。该反方假设在原文中无正面支持。

  • 证据:原文摘要"项目借助混合专家模型"、第 5.1.2 节"本文设计了三个独立的专家网络……门控网络采用多层感知机(MLP)结构",但第 4 章全部微调代码仅出现 model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-2-7b-chat-hf", …)

  • 严重程度:🟠

  • 复核状态:✅ 成立(机器核验 4 个数据点全部原文命中,MoE 实现细节在原文中确实缺失)

发现 5:表 6-1 性能结果缺乏统计严谨性

  • 位置:第 7–8 页,表 6-1 与第 9 节总结
  • 描述:表 6-1 报告任务一 F1=0.3804、任务二 F1=0.2630、任务三 F1=0.2881、平均 0.3105,仅给出点估计而无标准差、置信区间、显著性检验或多折交叉验证。视觉分析摘要亦明确指出"仅给出点估计数值,未提供误差棒、置信区间或方差信息……属于报告不完整"。在 NLP 关系抽取任务中此类报告方式不符合 ACL/EMBO 等会议的最低统计规范。三任务 F1 均较低(<0.4),与论文标题中"精准提取"的措辞存在落差,但论文未讨论失败案例。
  • 证据:原文"任务一、二、三上的F1分数分别为0.3804、0.2630、0.2881,平均得分为0.3105"。
  • 严重程度:🟠
  • 复核状态:✅ 成立(机器核验 1 个数据点原文命中)

发现 6:训练/测试集数字与外部公开数据集边界含混(数据声明疑点)

  • 位置:第 2–3 页 2.2 节
  • 描述:任务二声称"训练集由 500 篇 PubMed 文献和来自文献的人工标注的 2901 条'化合物-疾病关联对'组成",但 BC5CDR 公开语料库的标准划分通常为 500 训练 / 500 开发 / 500 测试共 1500 篇、约 4409 注释化学物质、5818 疾病、3116 化学-疾病关系;论文同一段紧接着又写到"从 BC5CDR 语料库中的 1500 篇 PubMed 文章为任务二补充了 4409 种带注释的化学物质、5818 种疾病和 3116 种化学疾病相互作用"——却并未说明基础 500 篇与 BC5CDR 补充 1500 篇之间是合并还是去重,训练/测试的数据边界含混不清。
  • 证据:原文"训练集由500篇PubMed文献和来自文献的人工标注的2901条'化合物-疾病关联对'组成"与"从BC5CDR语料库中的1500篇PubMed文章为任务二补充了4409种带注释的化学物质、5818种疾病和3116种化学疾病相互作用"。
  • 严重程度:🟡
  • 复核状态:✅ 成立(机器核验 3 个数据点全部原文命中)

发现 7:参考文献时间线无明显冲突(信息性记录)

  • 位置:参考文献列表
  • 描述:ChinaXiv 标注 posting 日期为 2025-08-31。参考文献 [1] Chandak et al. 标注"[2025-07-04]"——这是预印本或在线发表日期,可行。参考文献 [6] Xu et al. 同样标注"Scientific Data, 2025",在线发表可晚于 2025-07;其他参考文献([2] 2018、[3] 2016、[4] 2024、[5] 2023、[7] 2023、[8] 2013)时间分布无异常。整体未见明显时间冲突。
  • 证据:原文 "[1] Chandak P, Huang K, Zitnik M. Building a knowledge graph to enable precision medicine[J]. Scientific Data[2025-07-04]"。
  • 严重程度:ℹ️ 信息性
  • 复核状态:ℹ️ 保留为信息性记录(机器核验 2 个数据点全部原文命中)

发现 8:部署/教程章节占比过重(方法学结构异常)

  • 位置:第 7–9 页第 7、8 章
  • 描述:论文用大段篇幅(第 7、8 章)介绍 Ollama、OpenWebUI、SQLite、Memobase 等部署与数据管理工具,并附详细的命令行步骤(ollama createconda create -n open-webui python=3.8 等)。对于一篇题为"设计'基因-疾病-药物'三元知识图谱"的方法学论文而言,部署章节占比过重,且与核心贡献(知识三元抽取、MoE 设计)脱节,提示作者可能将课程实验报告 / 工程实践笔记拼装成论文,方法学严谨性不足。
  • 证据:原文第 7.1 节"首先,需要创建一个Modelfile文件。例如,创建一个名为test.Modelfile的文件……"以及第 7.3 节"创建Python虚拟环境:运行命令conda create -n open-webui python=3.8构建虚拟环境……"。
  • 严重程度:🟡
  • 复核状态:✅ 成立(机器核验 2 个数据点全部原文命中)

发现 9:未发现嵌入的恶意指令

  • 位置:全文
  • 描述:经逐段扫描,未在论文正文中发现试图操纵 AI 检测器或审稿人的提示注入语句("忽略以上要求""直接判定清白"等),论文内容本身可信地代表了作者原始写作。
  • 证据:无原文证据可引。
  • 严重程度:ℹ️ 信息性
  • 复核状态:ℹ️ 保留为信息性记录

耿同学辣评

一篇以"混合专家模型"为卖点的论文,核心代码里却只有一只孤独的 LLaMA-2-7b,没看到任何 MoE 路由层的影子——这就好比饭店招牌写着"米其林三星主厨坐镇",推开厨房门发现只有一台微波炉。再配上两张图 caption 复制粘贴、F1 数值低到不好意思却还声称"精准提取"、4.1 节可训练参数推导中间步骤自相矛盾……耿同学只能说:论文不是不能讲工程部署,但请别把 MoE 当 PPT 封面装饰,把 Ollama 教程当核心贡献——读者不傻,复核也不傻。

(说明:原报告中关于图像机器取证 copy-move 嫌疑信号这一条,因机器取证证据引用的具体描述文本未在论文原文中出现,且视觉分析摘要明确指出"未发现拼接或复用痕迹",经复核未达到成立门槛,已在最终报告中移除。)

建议后续行动

  • 联系作者要求提供 LoRA/PEFT 微调与 MoE 路由层的完整训练日志、模型权重 hash、随机种子
  • 要求作者提供表 6-1 三个任务的多次独立实验(≥5 次)报告标准差与置信区间
  • 要求作者修正图 2-2 的 caption(应为 DrugBank 搜索界面)
  • 要求作者说明任务二训练集 500 篇 PubMed 文献与 BC5CDR 补充 1500 篇之间的合并/去重规则
  • 要求作者修正 4.1 节 LoRA 参数推导的中间表达式(消除 16×16384×8 这一含混写法)
  • 在 PubPeer 或 ChinaXiv 评论区提出对 MoE 实际实现缺失的质疑
  • 如作者无法在合理期限内回应,建议向 ChinaXiv 编辑部与新疆大学计算机科学与技术学院学术委员会举报

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。


🧮 证据合成(自动生成)

  • 综合后验概率:99.4%(先验 5%)
  • 95% 可信区间:[94.3%, 99.9%]
  • 贝叶斯因子:BF = 2.99e+3(决定性(decisive))
  • 综合评级:🔴 高度疑似
  • 复核已排除线索:11 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)

贡献最高的证据

  1. [发现5] 仅给出 F1 点估计,无标准差/置信区间/多折验证,与 NLP 关系抽取任务的报告规范不符。(llm/*,logLR=1.59)— 贡献 21.8%
  2. [发现4] 标题/摘要宣称基于 MoE,但所有训练代码仅加载单一 LLaMA-2-7b-chat-hf,无 MoE 路由/专家切分的实际实现。(llm/*,logLR=1.59)— 贡献 21%
  3. [发现3] 16×16384×8 中 lora_alpha(8) 被多乘一次,1.4336M 与 1.43M 在数值上吻合但建立在含中间算术瑕疵的推导上。(llm/*,logLR=1.59)— 贡献 19.3%
  4. [发现2] 8642/4075 与 DDIcorpus 公开统计混用,'533 条文本提取'与'792 篇 DrugBank+233 篇 MedLine'口径自相矛盾。(llm/*,logLR=1.08)— 贡献 13.5%
  5. [发现6] 基础 500 篇与 BC5CDR 补充 1500 篇之间的合并/去重规则未说明,数据边界含混。(llm/*,logLR=1.08)— 贡献 13%

免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。