Loading...
正在加载...
请稍候

机器学习的信息科学原理:基于形式化信息映射的因果链元框架(Information Science Principles of Machine Learning: A Causal Chain Meta-Framework Based on Formalized Information Mapping)

2026-08-10 01:48

🔍 耿同学打假报告

论文信息

  • 标题:机器学习的信息科学原理:基于形式化信息映射的因果链元框架(Information Science Principles of Machine Learning: A Causal Chain Meta-Framework Based on Formalized Information Mapping)
  • 作者:许建峰(上海交通大学 凯原法学院 / 智慧司法研究院 / 计算机学院)
  • 期刊:ChinaXiv(预印本)
  • DOI:ChinaXiv:202505.00162v11(2025-09-14 版本)
  • 发表年份:2025年5月(投稿),v11 版本于 2025-09-14 张贴

综合评定:🟡 存疑

本论文为纯理论性文章(形式化框架 + 数学定理 + 前馈神经网络仿真验证)。经逐条核验,原报告所列"机器取证证据"中的强信号多由程序对理论性算例常量/矢量示意图的误判所致(Benford/末位数字检验前提不满足、PRNU/copy-move 检验对矢量图不适用),不能成立;唯一保留的实质性疑点为表 1 中"10 次试验正确率全部 100%"与"安全输出+非伦理提示=5000"的算例凑数嫌疑。该项虽有原文依据,但需配合原始试验日志方可定论,故综合评定为存疑。


详细发现

发现 1:列间差值高度恒定——表 1 数据可能为加减法编造

  • 位置:第 6.3 节 表 1(伦理安全试验结果汇总表,第 23 页)
  • 描述:原报告指出表 1 中 10 次试验的"伦理安全输出样本数 + 非伦理安全提示样本数"均精确等于 5000(每行 4517+483、4521+479、4548+452 等均恰好 5000);且 10 次试验的"安全预测输出正确率"和"非伦理安全提示正确率"全部为 100%。核验:表 1 共 10 行,安全输出+非伦理提示求和:4517+483=5000、4521+479=5000、4548+452=5000、4516+484=5000、4523+477=5000、4546+454=5000、4545+455=5000、4538+462=5000、4519+481=5000、4533+467=5000,全部精确等于 5000(与原文"以序号为种子,随机选择 5000 个测试样本"的实验设定一致);两列正确率字段均为 100%。
  • 证据:原文表 1 全部 10 行 30 个数据点均在原文中找到原文命中(核验 20/20 通过)。精确等于样本量的"求和恒等"虽与"每次固定从 5000 个样本中分类归并"的实验设计相符,但 10 次独立随机抽样中安全检测/提示正确率均为 100% 在统计上不寻常——若随机抽样中存在边缘情况,正确率不应如此完美。然而此"完美"也可能源于问题本身较简单(仅判断输出正负)+ 检测逻辑严格,故不能单独定性为造假,仅作为疑点保留。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在疑点(原文依据成立,但单凭"全 100%"不足以定性,需原始日志进一步确认)

⚠️ 发现 2:Benford 联合检验严重偏离(线索 S1)

  • 位置:全文数值(程序对全文数值扫表)
  • 描述:原报告引用 4 个 χ²/MAD 数据点(MAD=0.0711/0.0505/0.0821/0.1484;χ²=121.3/74.0/362.9/1167.6,p=0.0000)作为 Benford 严重偏离证据。
  • 证据:程序化核验显示 4 个数据点全部未在原文找到(0/4 命中)。依据复核原则第 9 条,引用此类数据点的发现原则上按"结论不成立"处理。此外,Benford 检验前提是"自然产生/测量"的混合分布数据,而本文是理论推导文章,数值多为人工设计的算例常量(10000、4951、0.4951、2.9741 等)+ 大量以 1、2、3、4 开头的索引变量、层数、矩阵维数,检验前提不满足。
  • 严重程度:🟡(前提不满足 + 数据点未在原文找到)
  • 复核状态:⚠️ 依据不足(核验数据点未在原文出现,且检验前提不满足)

⚠️ 发现 3:末位数字多重异常(线索 S2)

  • 位置:全文数值末位分布
  • 描述:原报告引用 χ²=144.8, p=0.0000 及"相邻末位相关性偏差达 13.5σ"。
  • 证据:程序化核验显示 2 个数据点全部未在原文找到(0/2 命中)。末位数字检验同样对理论推导/算例型文章前提不满足;即便成立,也无法单独立案。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(核验数据点未在原文出现)

⚠️ 发现 4:图 1 子图视觉复用(视觉分析发现)

  • 位置:第 7 页 图 1(企鹅示例图)
  • 描述:原报告引用视觉分析摘要"图 1(a)中的企鹅原图与(c)信息链最左侧 So₁ 中的企鹅图片相同;笔记本电脑屏幕上的企鹅图片与(c)链中 So₂ 至 Soₙ 各节点显示的企鹅图片相同"。
  • 证据:程序化核验显示 2 个数据点全部未在原文找到(0/2 命中,因原文仅为文字描述,分子图标注 So₁/So₂ 等术语需查图)。视觉分析摘要作为辅助参考仅可定性了解——图 1 caption 表述为"使能映射、有噪声信息和信息传递链示意图",(c) 的文字描述确实写"企鹅活动信息传递链中任一后续信息的载体状态都可以视为前续任一信息本体状态使能映射的结果",从语义上使用同一张企鹅原图来表达"同一对象的不同环节传递"在概念上合理。但视觉上对同一笔记本产品在多个中间节点的复用确实存在排版不严谨。
  • 严重程度:🟡(示意图层级,可解释但排版不严谨)
  • 复核状态:⚠️ 依据不足(原文 caption 未直接描述子图复用细节,仅视觉摘要提示)

⚠️ 发现 5:图像取证 copy-move 信号(线索 I2, I4, I6, I8, I10, I11, I13, I15, I17, I18, I19, I20, I22, I24)

  • 位置:程序检测的 14 张嵌入图像
  • 描述:原报告列出 14 张图均检出 copy-move 复制粘贴信号,匹配对数 12–169 不等。
  • 证据:本论文为理论文章,主体图像为矢量化的概念示意图(企鹅、笔记本、神经网络节点、信息链框图),由 PDF/排版工具直接生成而非位图扫描。矢量图包含大量规则重复的图形元素(边框、节点矩形、连接线、坐标系刻度等),在转 PDF/光栅化时会被填充相同像素模式,被 Fridrich 块匹配误判为复制粘贴是机制性误报。此外核验显示 13 个数据点中 6 个未在原文找到("未在原文找到"视同不存在),7 个为弱匹配(视为存在,但所引"偏移+匹配对数"为程序输出,原文并无图像取证数据)。
  • 严重程度:🟡(理论示意图场景下不构成独立造假证据)
  • 复核状态:⚠️ 存在良性解释(矢量示意图规则重复元素导致的机制性误报,原文无相关取证数据)

⚠️ 发现 6:图像取证 PRNU 高度同源(线索 I25, I26, I27, I28, I31)

  • 位置:成对图像之间
  • 描述:原报告引用 5 对 PRNU 同源数据(NCC=0.231–0.318,PCE=43.7–69.0)。
  • 证据:程序化核验显示 5 个数据点全部未在原文找到(0/5 命中)。PRNU 同源检验前提是"位图传感器原始输出",而本文图像均为矢量示意图渲染结果,根本不存在传感器 PRNU,高 NCC/PCE 完全是渲染管线同源导致的伪信号。原文也从未声明两图来自不同传感器/设备。
  • 严重程度:🟡(前提不适用)
  • 复核状态:⚠️ 存在良性解释(PRNU 检验前提不适用,原文无相关取证数据)

⚠️ 发现 7:图像取证噪声方差不一致(线索 I1, I3, I5, I7, I9, I12, I14, I16, I21, I23)

  • 位置:10 张图均检出异常块,CV 0.58–0.93
  • 描述:原报告列出 10 张图均存在若干噪声方差异常高的局部块。
  • 证据:程序化核验显示 10 个数据点中 9 个未在原文找到(0/9 命中),1 个弱匹配(img-007,视为存在)。同 S6 解释,理论论文图像不含传感器噪声物理基底,矢量图的"平坦块"剔除算法对其并不适用。
  • 严重程度:🟡(前提不适用)
  • 复核状态:⚠️ 存在良性解释(噪声方差检验前提不适用,原文无相关取证数据)

⚠️ 发现 8:图 4 试验描述与定理条件一致性可疑

  • 位置:第 6.2 节(图 4(b)(c)(d))
  • 描述:原报告指出"100 个样本的 RMSE 全部小于统一 TVD 上界"在数学上并非必然成立(TVD 约束期望层面而非逐样本层面),存在概念偷换嫌疑。
  • 证据:原文确实描述"所有蓝点标记的输出均方根误差均小于红线标注的 TVD 上界"(核验 3/3 通过),但作者通过选择"保守预测 + 噪声结构"满足这一现象。作者的解释在工程意义上合理(试验展示了上界对单个样本的"安全余量"),但严格数学层面的表述不够严谨,属于理论性论文中的常见表述模糊,并非数据造假。
  • 严重程度:🟡(理论表述不严谨,但未必是造假)
  • 复核状态:⚠️ 存在疑点(原文描述成立,但属于表述不严谨而非造假)

发现 9:试验设定与训练步数内部一致性核查

  • 位置:第 6 节全部试验
  • 描述:原报告指出作者使用 165 步训练模型(伦理安全/可解释性试验)+ 400 次训练(累积效果解释),时间线无矛盾。
  • 证据:核验 4/4 通过:第 6.3 节明确"训练 165 步后";第 6.4.4 节明确"进行了 400 次训练"。未发现内部矛盾。
  • 严重程度:✅ 未发现异常(仅作记录)
  • 复核状态:ℹ️ 信息性观察(数据自洽)

发现 10:作者署名与机构一致性

  • 位置:第 1 页作者署名
  • 描述:跨学科署名(凯原法学院 / 智慧司法研究院 / 计算机学院)+ 通讯邮箱 xujf@sjtu.edu.cn
  • 证据:核验 2/2 通过。跨学科署名本身不违规;邮箱为上海交通大学官方域名。
  • 严重程度:✅ 未发现异常(仅作记录)
  • 复核状态:ℹ️ 信息性观察

发现 11:参考文献时间线核查

  • 位置:参考文献 [22]–[29]
  • 描述:原报告指出 [29] 为合作者 2025-08-09 预印本,张贴日期晚于本文 ChinaXiv 首次投稿日(2025-05),但 v11 版本发布于 2025-09-14,[29] 已在系统中可引——属边界情形。
  • 证据:核验 3/3 通过。预印本可在发表前引用,本论文 v11 版本(2025-09-14)时间晚于 [29](2025-08-09),引用成立。
  • 严重程度:✅ 未发现异常(仅作记录)
  • 复核状态:ℹ️ 信息性观察

发现 12:可解释性试验权重数值合理性

  • 位置:第 6.4.1 节,公式 (6.1)-(6.2)
  • 描述:原报告指出作者报告的权重矩阵与偏置向量值小数位大多到 3 位。
  • 证据:核验 4/4 为弱匹配(视为存在):@₁、b₁、@₂、b₂ 的数值均在原文中出现。165 步训练的小网络权重收敛到 3 位小数属于正常精度。
  • 严重程度:✅ 未发现异常(仅作记录)
  • 复核状态:ℹ️ 信息性观察

耿同学辣评

"一篇纯理论文章搞'形式化因果链',把每个机器学习环节包装成'合式公式集合的解释'——听起来唬人,本质上就是把流程图翻译成了一阶逻辑符号。机器取证程序拿来做 Benford、末位数字、PRNU、copy-move 这些检验,结果几乎全部'命中'——但这并不奇怪,因为理论文章的数值是作者自己拍的算例常量,图片是矢量示意图,这些检验方法前提就不满足。所以原报告中那些花里胡哨的统计/取证证据基本都得降级或删除。真正剩下的疑点只有一个:表 1 里 10 次独立随机抽样的安全检测正确率全部 100%——这要么说明作者精心挑选了试验数据,要么说明问题本身过于简单(只判断输出正负)使得 100% 成为必然。建议作者公开 GitHub 仓库(https://github.com/xuhu6736/MLT-MF)的完整 commit 历史和 5000 次预测的明细日志来洗清嫌疑——如果是后者,那就当我没说。"


建议后续行动

  • 联系作者(xujf@sjtu.edu.cn)要求公开表 1 试验的完整原始日志(含每轮 5000 个样本的预测明细)
  • 核验 GitHub 仓库(https://github.com/xuhu6736/MLT-MF)的 commit 历史与论文描述的一致性
  • 对图 1 子图复用的排版规范向作者提出改进建议(不涉及造假指控)
  • 表 1 正确率 100% 的疑点可作为"要求作者补充说明"的依据,但暂不构成举报
  • 暂不向学术委员会备案

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。