基于联邦学习的代谢性疾病预测方法
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:基于联邦学习的代谢性疾病预测方法
- 作者:王俊逍
- 期刊:哈尔滨理工大学硕士学位论文
- DOI:无(学位论文)
- 发表年份:2025年7月(预期答辩时间)
综合评定:🔴 实锤
详细发现
发现 1:核心方法学公式存在反常识的致命错误
- 位置:3.1.5 全局参数的聚合和更新机制,公式 (3-8)
- 描述:论文声称采用“余弦相似度”作为核心判定指标来筛选异常参数,但给出的公式 (3-8)
𝑐𝑖𝑗 = √∑(𝑚𝑖 − 𝑚𝑗)²却是经典的欧几里得距离公式。 - 证据:余弦相似度的计算涉及向量点积与模的乘积,范围在 [-1, 1]。作者不仅将距离公式强行称为余弦相似度,还在公式 (3-9) 中规定
𝑐𝑖𝑗 ≤ 𝜌,并在文中解释“余弦相似度低于所设定的阈值𝜌时,该局部模型就会被判定为异常模型”。如果按欧氏距离,距离越大越异常,剔除大数值是合理的;但按作者文中表述的“余弦相似度”,相似度越低才越异常。整个核心算法的逻辑由于公式和术语的张冠李戴,陷入了自相矛盾的境地,极大概率为AI自动生成或生搬硬套。 - 严重程度:🔴
- 复核状态:✅ 成立
发现 2:核心实验数据集数量“张冠李戴”且无法自洽
- 位置:3.2.1 数据收集 与 3.2.4 数据融合
- 描述:作者对两个核心数据集的样本量描述在不同章节出现了离奇的“互换”魔术。
- 证据:
- 在 3.2.1 节中,作者声称:“痛风数据集……最终保留 50,932 份……糖尿病数据集……最终提取 63,728 份”。
- 然而在 3.2.4 节中,作者写道:“痛风数据集 F51(维度为 63728×14)与糖尿病数据集 F52(维度为 50932×14)”。
- 不仅把两个数据集的数量完全对调,且融合后的总数据集 F6 维度被称为 114660×14(摘要中也强调是 114,660 条病历)。但实际上,50932 + 63728 = 114,660。试问,如果连自己研究的数据集大小都能在不同章节随便互换,这数据的真实性从何谈起?
- 严重程度:🔴
- 复核状态:✅ 成立
发现 3:图表与正文描述交叉错乱(Copy-paste 翻车现场)
- 位置:3.2.2 数据预处理 (4) 特征关联度分析
- 描述:图注与正文描述出现极其低级的交叉错位。
- 证据:
- 正文写道:“痛风的卡方分析结果如图 3-4 所示。” 但图 3-4 的图注却是:“图 3-4 糖尿病特征的卡方特征关联度分析结果”。
- 正文写道:“糖尿病数据集的随机森林分析结果如图 3-5 所示。” 但图 3-5 的图注却是:“图 3-5 痛风病特征的随机森林特征关联度分析结果”。
- 此外,表 3-4(痛风特征值)和表 3-5(糖尿病特征值)中的特征如 BMI 等计算公式标为“体重/身高”,这是极其不专业的错误(正确应为 体重/身高的平方)。这些都是为了凑字数或拼凑结构时疏于修改的典型痕迹。
- 严重程度:🟠
- 复核状态:✅ 成立
发现 4:通信参数规模的数学计算严重造假
- 位置:3.3.3 实验结果分析,表 3-11 及其后文文字描述
- 描述:参数传递规模的加法与文末宣称的总数差了几百万,属于明显的数据捏造。
- 证据:表 3-11 中列出了 MDPFL 各层的参数量:3120 + 43380 + 21720 + 11616 = 79,836。传统联邦框架 M-DNN 参数量为:3120+43380+21720+11616+4656+1176+300+78 = 86,046。
然而,正文紧接着宣称:“通过计算得出 MDPFL 的参数传递总量为 10,834,560,传统联邦框架下 M-DNN 的参数传递总量为 11,616,210”。表里的数字加起来不到10万,作者却硬编造出了上千万的总数(且11616210这个数字明显是直接把倒数第二层的参数“11616”拿来魔改的)。同样的计算错误也出现在第四章表 4-1 中。 - 严重程度:🔴
- 复核状态:✅ 成立
发现 5:隐私保护实验数据违背基本统计学常识
- 位置:3.1.4 隐私保护算法,表 3-1
- 描述:衡量高斯噪声标准差 σ 与原数据差距(MSE)的数据呈现出明显违背数学规律的特征。
- 证据:高斯噪声的方差为 \(\sigma^2\),因此添加方差为 \(\sigma^2\) 的噪声后,其均方误差(MSE)的期望值应当近似等于 \(\sigma^2\)。也就是说,当 σ=0.5 时,MSE 理论上应在 0.25 左右;当 σ=3 时,MSE 应在 9 左右;当 σ=5 时,MSE 应在 25 左右。
但论文表 3-1 给出的数据:σ=1 时 MSE 为 0.44;σ=3 时 MSE 为 2.39;σ=5 时 MSE 为 5.4。这种随着 σ 增大,MSE 递增却远远小于实际方差的现象,完全违背概率论常识,说明这些衡量指标(包括信噪比 SNR)极有可能是随手编造的,根本没有经过真实代码运行。 - 严重程度:🔴
- 复核状态:✅ 成立
发现 6:图表标注与内部数据逻辑自相矛盾
- 位置:3.3.3 实验结果分析,表 3-2 与 3-3
- 描述:各医疗机构分配的病历数据数量与正文描述完全不匹配。
- 证据:
- 表 3-2(痛风):各方数据相加为 12733+14002+12667+12639 = 52,041。正文声称有效痛风病例为 50,932。
- 表 3-3(糖尿病):各方数据相加为 20451+22038+20565+22368 = 85,422。正文声称提取有效糖尿病数据为 63,728。
且不论前文已经把两个数字对调过一次,单看表格内的求和,也根本对不上正文宣称的样本量。这进一步印证了数据集的划分完全是凭空捏造的。
- 严重程度:🔴
- 复核状态:✅ 成立
耿同学辣评
这篇硕士学位论文简直是把“学术造假”四个字写在了脸上。连余弦相似度和欧氏距离都能混为一谈,高斯噪声的方差连自己都管不住;上一节刚写痛风有5万条数据,下一节马上大变活人成了6万条;最可笑的是表格里明明加起来才几万的参数,大笔一挥就成了上千万的通信开销。把AI大模型生成的内容直接复制粘贴进毕业论文,连小学数学的加法都不愿意亲自算一下,这哪是做科研,这简直是在考验答辩评委的血压!
建议后续行动
- 联系作者要求提供原始数据和训练日志
- 在知网或学校论文库提出学术不端举报
- 向哈尔滨理工大学学术委员会及导师张宏国举报
- 建议学校启动硕士学位论文抽查复核程序
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。