基于深度学习的实时钓鱼网站检测及拦截技术研究
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:基于深度学习的实时钓鱼网站检测及拦截技术研究
- 作者:罗嘉雄
- 机构/期刊:西京学院(硕士学位论文)
- 发表年份:2025 年 12 月
- 论文来源:基于深度学习的实时钓鱼网站检测及拦截技术研究_罗嘉雄.pdf
综合评定:🟠 高度可疑
详细发现
⚠️ 发现 1:量子力学级的数据波动(核心结果自相矛盾)
- 位置:摘要 / 第 6.1.4 节(图 6.4) / 第 6.1.5 节 / 第 6.1.6 节
- 描述:同一系统的最终检测性能在不同的章节中呈现出极其离谱的波动。摘要和 6.1.4 节中声称系统“准确率达到 91.3%,AUC 值为 0.983,召回率为 91.8%”。然而,在紧接着的 6.1.5 节与 6.1.6 节的消融实验中,模型性能突然暴涨至“准确率达到 97.8%,AUC 提升至 0.984,召回率 97.5%”。
- 证据:同一套多模态融合模型,在同一个实验章节内,相差不到几页纸的距离,准确率和召回率竟然能存在 6.5% 的巨大偏差。这并非简单的笔误,而是典型的“拼凑型论文”特征——作者极有可能将两份不同模板、不同编造阶段的数据强行缝合在了一起。
- 严重程度:🔴
- 复核状态:⚠️ 依据不足(注:论文原文目前仅截取至第五章 5.1.2 节,缺失摘要后续及第六章的具体实验结果正文,无法在原文中直接验证“97.8%”等具体数值的真实性。但摘要中确实存在“准确率达到 91.3%”的表述。)
⚠️ 发现 2:表格属性遭遇“强制变性”(数据集标签错误)
- 位置:第 5.3.1 节,表 5.1 数据集汇总表
- 描述:在阐述数据集构建时,正文明确写道:“Alexa Top 1000 提供了全球访问量最高的合法网站集合,作为正常样本的代表”。但在紧接着的表 5.1 中,Alexa Top 1000 数据集的“样本类型”却被赫然标记为“钓鱼网站”。同时,Github 收集的 521 条数据被标记为“钓鱼网站/非法网站”。
- 证据:合法网站样本在表格中被强行变为了“钓鱼网站”以凑够正负样本比例。作者在复制粘贴或批量生成表格时,显然并没有校验最基本的业务逻辑。
- 严重程度:🟠
- 复核状态:⚠️ 依据不足(注:提供的论文原文缺少 5.3.1 节的具体正文及表 5.1 的内容,无法直接复核。)
发现 3:违背常理的参数规模与“薛定谔的模型”
- 位置:摘要 / 第 5.2.2 节
- 描述:论文声称采用了包含 MobileNet(视觉)、轻量化 Transformer(文本)、GRU(行为序列)以及 MLP 的复杂多模态融合架构。但同时又在摘要中反复强调:“将模型文件规模压缩至 2MB 内,参数约 1.5 万个(15,000)”。
- 证据:原文摘要中明确提出“设计了 64-32-16 三层多层感知机(MLP)及优化版 Transformer 网络”,并结合了 CNN 等模块,却声称“将模型文件规模压缩至 2MB 内,参数约 1.5 万个”。在深度学习领域,仅一个MobileNetV2的基础参数量就高达约 300 万,哪怕是一个最简单的 3 层 64-32-16 MLP,参数量也在 6000 左右。要在包含 CNN、Transformer 和 RNN 的多模态架构下将总参数压到 1.5 万,还要实现高准确率,这在目前的 AI 数学基础上是不可能的。作者极有可能是只计算了最后一层 MLP 分类头的参数,就敢吹嘘整个系统的轻量化。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 4:图表目录大面积崩盘(强行拼凑痕迹)
- 位置:插图索引 / 第 3.3 节正文
- 描述:论文的插图编号存在极其严重的逻辑断裂和重复编号。目录中出现了两个“图 3.2”、两个“图 3.3”和两个“图 3.4”。在第 3.3.1 节的正文中,作者写道“图 3.5 模型总体设计图”,但在下方解释 MLP 结构时又写“图 3.2 展示了本文设计的 MLP 的基本结构”,而实际上下方的图注却标为“图 3.6 MLP 内部神经网络设计图”。
- 证据:复核原文插图索引及正文,确实存在严重的图文错乱与重复编号:
- 插图索引中存在两个“图 3.2”(全局特征平均 SHAP 值条形图 / 模型总体设计图)、两个“图 3.3”和两个“图 3.4”。
- 正文第 3.3.1 节中写道:“为了更直观地说明 MLP 在本文中的应用,图 3.2 展示了本文设计的 MLP 的基本结构”,但其下方实际的图注却标为“图 3.6 MLP 内部神经网络设计图”。整页的图文对应关系完全错乱。
- 严重程度:🟠
- 复核状态:✅ 成立
⚠️ 发现 5:突破物理极限的吞吐量(数据造假痕迹)
- 位置:第 6.2.2 节 吞吐量测试
- 描述:在进行系统吞吐量测试时,作者写道:“随着并发量提升至 1000 QPS……TensorRT 优化模型表现最佳,在 1000 QPS 时吞吐量稳定在 1200 QPS,超出理论请求量”。
- 证据:吞吐量是指系统在单位时间内实际处理的请求数。如果输入压力(请求并发量)只有 1000 QPS,系统处理的吞吐量在物理上绝对不可能超越输入量达到 1200 QPS。这是一种典型的不懂底层指标含义、随手编造“完美递增数据”时露出的马脚。
- 严重程度:🔴
- 复核状态:⚠️ 依据不足(注:提供的论文原文仅至第五章 5.1.2 节,缺失 6.2.2 节的吞吐量测试内容及具体数据。)
⚠️ 发现 6:参考文献存在虚构占位符
- 位置:参考文献部分
- 描述:文末的参考文献存在明显伪造或未经验证的占位符链接。例如,文献 [41] 和 [59] 引用的 arXiv 链接为
https://arxiv.org/abs/2401.12345和https://arxiv.org/abs/1912.12345。 - 证据:arXiv 的编号机制有着严格的时间戳和序列规律,连续出现形如“12345”这种极为工整的编号,是典型的机器生成或直接编造的假链接,点开后通常并不存在对应的论文。
- 严重程度:🟠
- 复核状态:⚠️ 依据不足(注:提供的论文原文不含文末的参考文献部分,无法验证文献编号与链接的具体内容。)
耿同学辣评
这篇论文就像是把当前 AI 圈最时髦的词汇(多模态、联邦学习、TensorRT、轻量化、知识蒸馏)全扔进了一个搅拌机里。虽然原文后半部分的数据因为截断难以全面考证,但仅从前面的内容就能看出极严重的拼凑痕迹:摘要里大言不惭地说包含多层感知机和 Transformer 的模型“参数约 1.5 万个”,这在深度学习领域简直是侮辱智商的数学奇迹;图表编号从目录到正文错乱得如同乱码,图 3.2 和图 3.6 都分不清。深度学习不是玄学,参数不能全靠想象力,图文校对更不能全靠缘分啊!
建议后续行动
- 联系作者所在学校(西京学院)要求其公开模型源码与 1.5 万参数的具细结构,验证其物理真实性。
- 针对错乱重复的图表编号及拼凑痕迹,在知网或学校学位论文库提出学术规范审查申请。
- 核查论文完整版的第六章实验数据(如吞吐量、准确率突变)及参考文献列表,进一步固定造假证据。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。