基于医疗文本的儿童体质辨识研究
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 来源:10561_202321044628_LW.pdf
- 标题:基于医疗文本的儿童体质辨识研究
- 作者:廖浩东
- 期刊:华南理工大学硕士学位论文
- DOI:无
- 发表年份:2026年(论文提交日期:2026年4月9日;答辩日期:2026年5月20日)
综合评定:🟠 高度可疑
详细发现
发现 1:数据呈现异常——完美的“零违背率”与缺失的统计度量
- 位置:全文核心实验结果(表4-2,表4-3,摘要)
- 描述:
- 论文核心指标“逻辑违背率(LVR)”在所提模型(LVD-MoE)中被报告为绝对完美的 0.000。虽然作者解释这是通过“硬逻辑掩码”实现的规则拦截,但这意味着模型在1250例测试集上没有任何一例出现违背医学先验规则的预测。在实际临床数据中,完全杜绝此类错误几乎不可能,尤其当模型特征(如口语化文本)本身就可能包含歧义时。此“完美”结果高度可疑,可能暗示了以下情况:a) 硬规则过于宽松;b) 测试集经过筛选;c) 结果被“优化”。
- 所有性能数据(准确率、F1等)均未报告标准差或置信区间。深度学习实验通常需要多次独立运行以评估结果的稳定性与可复现性。论文仅提供了单次运行结果,无法判断这些性能数字是偶然还是稳定趋势,这在学术上是不严谨的。
- 证据:表4-2中LVD-MoE的LVR为0.000;全文无任何标准差或统计检验信息。
- 严重程度:🟠
发现 2:方法学描述内部矛盾——数据集时间线冲突
- 位置:第3.5.2节与第4.5.2节
- 描述:关于多模态数据集的构建描述存在不一致。
- 第3.5.2节(第27页)声明:“该数据集来源于2020年至2025年间产生的真实门诊电子病历…”
- 第4.5.2节(第47-48页)声明:“本数据集严格截取了医院全面推行标准化电子病历的2023至2025年数据,摒弃了早期字段缺失的旧病案。”
- 证据:同一数据集的来源时间段描述前后不一致(2020-2025 vs. 2023-2025)。
- 严重程度:🟡 (可能是笔误,但降低了数据来源的可信度)
发现 3:可视化与文本描述不符
- 位置:图3-5(t-SNE可视化)及相关文本
- 描述:图3-5是多模态特征t-SNE降维可视化图,图例中应区分九种体质类别。然而,图中可视化的散点仅使用了三种颜色(蓝、绿、橙),与论文研究的“九大基础儿童体质”严重不符。这可能导致读者误解聚类效果,或暗示作者在生成图片时做了简化处理而未在文中说明。
- 证据:图3-5的图例与颜色数量(3种)与文本描述的体质类别数(9类)不匹配。
- 严重程度:🟡
发现 4:实验结果“过于完美”的模式
- 位置:全文实验结果部分(表3-2,表3-3,表4-2,表4-3等)
- 描述:论文中的实验结果呈现出一种“教科书式完美”的模式,这本身也是一个红旗信号。
- 改进方向一致:每一个提出的模块(知识图谱、双路径、硬逻辑、混合损失、软投票)在消融实验中都稳定且单调地提升了性能(表4-3)。现实中,模块组合常存在相互干扰或边际效益递减。
- 基线对比全面碾压:所提模型在所有指标上全面、显著地优于所有基线模型,没有展现出任何局限性或在特定任务上的弱点。
- 长尾问题完美解决:自适应混合损失函数在大幅提升尾部类别(特禀质)召回率至0.682的同时,头部类别(脾虚型)召回率几乎未受影响(从0.924微降至0.918),这种“双赢”在解决长尾问题时非常罕见且困难。
- 证据:表4-2,表4-3,表4-4中,LVD-MoE及其变体在各项指标上呈现全面且线性提升。
- 严重程度:🟠 (系统性可疑)
发现 5:方法学验证不充分
- 位置:第3.6.2节(聚类分析)
- 描述:论文使用轮廓系数评估多模态特征聚类效果。然而,所有对比方法(包括最佳方法Hard-Concat)的轮廓系数均低于0.25(处于较差或无意义的聚类范围)。作者将此结论作为后续构建复杂融合网络的动机。但一个关键问题被忽略:如果原始特征在无监督聚类下本身就没有清晰的簇结构,那么在此基础上有监督学习如何能获得高分类性能(Accuracy=0.816)? 这之间存在逻辑断裂,可能暗示特征质量存在问题,或实验设置有问题。
- 证据:表3-3中所有轮廓系数均≤0.215,但下游分类任务取得了0.816的准确率。
- 严重程度:🟠
发现 6:开源与可复现性承诺缺失
- 位置:全文
- 描述:论文详细描述了复杂的模型(LVD-MoE)、算法和系统,但完全没有提供代码、数据集或预训练模型的开源链接。在2026年,以人工智能和深度学习为主题的学位论文,公开核心代码以供同行验证已成为惯例。此处的缺失使得所有宣称的实验结果无法被独立核实,是学术诚信检测中的重要风险点。
- 证据:全文无任何代码仓库链接。
- 严重程度:🟠
耿同学辣评
这篇论文就像一个精心打扮的“六边形战士”——模型创新拉满(MoE+逻辑验证+长尾优化+软投票),实验结果完美无瑕(逻辑违背率0.000),连麻烦的“长尾问题”都被安排得明明白白。但当我们想扒开外衣看看它结实的肌肉(代码、原始数据、统计误差)时,却发现它是个铁布衫,啥也不让看。更可疑的是,它用来打地基的特征(轮廓系数0.2左右),按理说建不出它那0.816的摩天大楼。这不禁让人怀疑:这大楼的图纸画得再漂亮,是不是全凭一张嘴在盖?
建议后续行动
- 联系作者要求提供原始数据、训练代码、多次运行日志及统计测试结果(最关键)
- 在 PubPeer 上提出关于数据完美性、统计报告缺失、可视化矛盾等质疑
- 向论文指导教师及华南理工大学学术委员会反映情况,要求内部核查
- 建议作者在公开平台开源核心代码与匿名化数据,以供学术社区验证
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。