Loading...
正在加载...
请稍候

一种针对大语言模型在工业网络中的安全能力评估框架 (INSBench: Assessing the Security Capability of Large Language Models in Industrial Networks)

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:一种针对大语言模型在工业网络中的安全能力评估框架 (INSBench: Assessing the Security Capability of Large Language Models in Industrial Networks)
  • 作者:王泊钧,张淼,蒋楠
  • 期刊:中国科技论文在线
  • DOI:未提供
  • 发表年份:2026 年 5 月 (根据文件名推断)
  • 论文来源:202605-91.pdf

综合评定:🟠 高度可疑

详细发现

发现 1:方法学常识性错误(大模型参数自相矛盾)

  • 位置:第 3 部分 实验验证与结果分析 (Page 9)
  • 描述:在描述大语言模型的实验参数设置时,文中写道:“确认在温度参数 T=0.0、top_p=0.9top_p=40 的条件下”。
  • 证据:这是极其低级的方法学错误。top_p(核采样)的取值范围是 [0, 1] 的浮点数,代表概率质量阈值;而取值为 40 的显然是 top_k(限制采样池为前 k 个 token)。作者连评估对象(大语言模型)的最基本生成参数都混淆不清,甚至凭空造出了一个“top_p=40”的离谱参数。这严重质疑了实验者是否真的亲自跑过大模型实验。
  • 严重程度:🔴

发现 2:论文拼凑痕迹(图片编号穿越)

  • 位置:全文图片引用 (Page 3, 6, 9, 10, 11)
  • 描述:论文的图片编号出现了严重的逻辑断层,且带有明显的毕业论文/长篇报告缩写痕迹。
  • 证据
    1. 文章从图 1、图 2、图 3、图 4,直接跳跃到了“图 8”、“图 9”、“图 10”、“图 11”。图 5、6、7 去哪了?
    2. 在 2.1.2 节(Page 6)中,描述漏洞题集生成流程时,文本赫然写着“完整工作流程如图 3-3 所示”。这种“章-节-图”的编号格式是典型的学位论文写法,说明作者极有可能是直接从某篇长篇毕业论文中 Copy-Paste 了部分章节拼凑成这篇期刊论文,甚至连全局编号都忘了修改。
  • 严重程度:🟠

发现 3:数据合理性存疑(“量子纠缠”的大模型)

  • 位置:第 3 部分 实验验证与结果分析 (Page 11-12)
  • 描述:作者在分析工业漏洞识别结果时声称:“观察结果图发现 Gemini2.5、Grok3 和 GPT4 三者的准确率一样,因为三者的识别情况也极为相似,正确的题目也几乎一致。”
  • 证据:这是极其反常识的实验现象。Gemini、Grok 和 GPT-4 是由完全不同的公司(Google、xAI、OpenAI)开发的、具有不同架构和权重的大语言模型。在面临复杂的工业漏洞识别任务时,三个异构模型出现“准确率完全一样”且“正确的题目几乎一致”的概率在统计学上微乎其微。这通常意味着:1. 数据是捏造或抄袭的;2. 评估框架存在严重的系统性 Bug(如提示词已包含答案,或评估器判定逻辑失效);3. 所谓测试其实只测试了一个模型,然后复制粘贴了三次结果。
  • 严重程度:🔴

发现 4:主语代词精神分裂

  • 位置:全文多处
  • 描述:文中在描述研究工作时,频繁且随机地在“我”和“我们”之间横跳。
  • 证据:例如第 2.1.1 节(Page 5):“将这些文本块输入 GPT-4o...除了这些公开可用的数据集外,本研究还主要应用了...”。同一段落中,又出现“我们使用嵌入模型”、“我们设计了专门的提示词”。甚至在摘要中写“还将某些问题通过语义转化...”。这进一步证实了文章是多方拼凑或未经仔细校对的草稿。
  • 严重程度:🟡

发现 5:时间线科幻(来自未来的模型与发表日期)

  • 位置:标题区域及第 3 节
  • 描述:文件信息显示该论文发表于“2026 年 5 月”,而文中测试的模型包括“Claude3.7、Gemini2.5、Grok3、Deepseek-R1”等。
  • 证据:虽然我们不能排除这是未来预测或测试版模型,但结合“中国科技论文在线”的预印本性质以及前面的拼凑证据,这更像是作者为了赶鸭子上架,虚构了尚未发布(或不存在)的模型版本号,或者投稿系统的时间设置出现了荒谬的错误。
  • 严重程度:🟡

发现 6:数学数据验算(数据自洽性尚可)

  • 位置:表 2、表 3 (Page 5, Page 6)
  • 描述:对论文中的样本数量及百分比进行反向验证。
  • 证据
    • 表 2:恶意代码易 300 / 1928 = 15.56% (文中 15.5%),难 46 / 1928 = 2.38% (文中 2.4%)。所有子项相加刚好为 1928。
    • 表 3:SQL注入 254 / 4529 = 5.606% (文中 5.60%)。恶意流量总数 1299,正常流量 3230,合计 4529。
      注:虽然表格内数学加和自洽,但这并不能排除是使用 Excel 随机生成后强行计算配平的可能。
  • 严重程度:✅ (无异常)

注:文本中未提供实际的图片像素信息,无法进行 Western Blot 等图片伪造、翻转、拼接检测(耿同学第三式),仅针对图表编号和文字描述进行逻辑推断。

耿同学辣评

让一个连大模型 top_ptop_k 参数都分不清的“糊涂蛋”,去评估当今最顶尖的大语言模型在工业网络中的安全能力,这就好比让一个连方向盘和油门都分不清的人去当 F1 赛车的裁判!整篇论文从学位论文里“生搬硬套”的残缺图表,到 Gemini、GPT-4 离奇“量子纠缠”般一模一样的实验结果,无不透出一股浓浓的“学术缝合怪”气息。就这种把 top_p 设为 40 的惊天操作,评估出来的框架谁敢用?工业网络的安全要是交给这玩意儿,怕是电厂没被黑客黑掉,先被这专家的参数给搞瘫痪了!

建议后续行动

  • 要求作者提供完整的原始实验代码和模型对话日志,特别是 top_p=40 的代码实现,以及三款模型高度一致的作答记录
  • 在 PubPeer 上提出质疑(重点关注参数错误与模型结果量子纠缠问题)
  • 建议北京邮电大学相关学术委员会核实该论文是否属于某篇学位论文的违规拆分发表
  • 联系《中国科技论文在线》编辑部,指出其论文编号错乱(图 3-3)及方法学常识错误,建议退回重大修改

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。