Loading...
正在加载...
请稍候

基于知识图谱的属性自适应授权模型研究

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:基于知识图谱的属性自适应授权模型研究
  • 作者:劳启迪
  • 期刊:硕士学位论文(佛山大学,Foshan University)
  • DOI:无(学位论文)
  • 发表年份:2024年5月
  • 论文来源:基于知识图谱的属性自适应授权模型研究_劳启迪.pdf

综合评定:🔴 实锤

详细发现

发现 1:基础数据规模严重自相矛盾(数据造假检测)

  • 位置:表 3.3 vs 第 4.4.1 节 vs 第 4.4.2 节 vs 第 5.4 节
  • 描述:论文中对于同一核心数据集的统计描述存在多处无法自圆其说的矛盾。
    • 矛盾点 A(用户数量):第三章表 3.3 明确记录“PERSON_ID”属性数量为 4253。然而在第四章 4.4.2 节中,作者写道:“对 4353 个用户节点进行出度统计”。
    • 矛盾点 B(规则数量):第四章 4.4.1 节写明:“数据集中包含的 28843 条访问控制规则”。而到了第五章 5.4 节,变成了“数据集中包含了 28433 条访问控制规则”。
  • 证据:同一份开源数据集(亚马逊员工访问数据集)经过去重处理后,样本数量绝不应该在不同的章节中发生几百个数值的随意波动。且第五章仅是使用第四章消解后的数据集,消解过程仅剔除了 4 条无效规则,数量绝不可能从 28843 暴跌至 28433。这是典型的数据拼凑或复制粘贴其他文献数据时忘记统一全局数字的低级失误。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 2:违背常理的机器学习准确率(统计学异常检测)

  • 位置:第五章 第 5.4 节 表 5.1
  • 描述:作者报告了在未平衡数据集上的分类器表现,出现了统计学上极其荒谬的“倒挂”现象。
  • 证据:作者在文中明确交代,数据集极度不平衡,正样本(允许)占 94.8%(26956条),负样本(拒绝)仅占 5.1%(1477条)。这意味着,哪怕是一个什么都不干的“傻瓜分类器”,只要无脑全部预测为“允许”,它的准确率也至少能达到 94.8%
    然而,表 5.1 中作者报告的逻辑回归、朴素贝叶斯、授权分类器、支持向量机的准确率分别为 92.5%、90.3%、93.8%、91.1%——所有模型的准确率竟然全部低于瞎蒙的 94.8% 基准线!
    如果模型连最基础的多数类基线都达不到,说明模型不仅没学到特征,反而在疯狂误判。真实实验中几乎不可能出现所有算法准确率全线跌破无脑基线的情况,这强烈暗示数据是人为编造或直接照搬了其他平衡数据集的实验结果。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 3:SMOTE 后的数据呈现出“童话般”的完美(数据造假检测)

  • 位置:第五章 第 5.4 节 表 5.2
  • 描述:采用 SMOTE 算法处理后,本文提出的“授权分类器”各项指标突兀地呈现出极其不合理的完美状态。
  • 证据:表 5.1(未平衡)中,本文分类器的负样本识别正确率仅为可怜的 22.0%。但在使用 SMOTE 算法后(表 5.2),本文分类器的负样本识别正确率瞬间飙升至 94.0%,且精确度达到了极为罕见的 99.8%
    作为对比,同表中的逻辑回归(28.6%)、朴素贝叶斯(20.0%)和 SVM(57.6%)的提升幅度符合常规认知。唯独本文模型如同“开了挂”,在没有任何特殊网络结构创新(仅使用基础的随机森林)的情况下,面对复杂数据展现出 99.8% 的精确度和 94% 的少数类召回率,这种“一脚踩油门直接飞出地球”的数据表现是典型的 AI 随机数生成器都不如的造假特征。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 4:阈值选取存在逻辑断层与生搬硬套(方法学异常)

  • 位置:第四章 第 4.3.1 与 4.4.2 节
  • 描述:在冲突消解策略中,作者对 PageRank 阈值的选取和描述存在生硬拼凑的痕迹。
  • 证据:在 4.3.1 节举例时,作者写道:“去掉极大值后取均值为 0.5...节点分数为 0.21”。但到了 4.4.2 节的真实实验中,作者写道:“计算了其评分的平均值,并得出了 0.32 这一结果”。而且前面 4.3.1 举例的节点评分(0.21)甚至高于理论最大 PR 值 1 的五分之一,而 4.4.2 节又说有 9 个节点评分超过 10。PageRank 在带阻尼因子的标准算法中,所有节点 PR 值总和为 1。作者文中出现了 PR 值大于 10 的节点,说明作者根本没弄懂 Neo4j GDS 插件中 PageRank 的具体 score 物理意义,属于拿着 A 论文的例子和 B 论文的参数强行缝合进自己的学位论文。
  • 严重程度:🟠
  • 复核状态:✅ 成立

⚠️ 发现 5:文本未提供足够的图片信息,无法进行像素级分析(图片复用/拼接检测)

  • 位置:全文图表区
  • 描述:文本仅提供了图表的描述性文字(如伪代码、统计表格),缺失图 3.1、图 4.2、图 5.9 等核心实验结果图的可视化源文件。
  • 证据:由于无法获取原图,无法进行 Western Blot 泳道、显微镜图噪点一致性或 PS 拼接痕迹的检测。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足

耿同学辣评

这论文的实验数据就像是拼夕夕上买的“史诗级缝合怪”——上一章数据集还有 4253 个用户,下一章就自我繁殖成了 4353 个;规则数量也是忽上忽下,跟闹着玩似的。最搞笑的是第五章的分类器实验,面对 94.8% 都是正样本的数据,所有模型准确率竟然全在 90% 出头疯狂徘徊,连“闭着眼睛全选对”的及格线都够不着!建议这位同学在编造随机森林数据之前,先去补习一下机器学习的 Baseline 常识,别把随机数生成器都显得那么没智商。

建议后续行动

  • 联系作者要求提供原始数据(尤其是亚马逊数据集的处理日志)
  • 在学校盲审/答辩系统中提出具体质疑
  • 向佛山大学研究生院/学术委员会举报核心实验数据造假
  • 在 PubPeer 上提出质疑(学位论文通常不适用,建议走学校渠道)

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。