基于机器学习的二手手机价格评估方法研究及应用(Research and Application of Second-hand Mobile Phone Price Evaluation Method Based on Machine Learning)
🔍 耿同学打假报告
论文信息
- 标题:基于机器学习的二手手机价格评估方法研究及应用(Research and Application of Second-hand Mobile Phone Price Evaluation Method Based on Machine Learning)
- 作者:龙豪
- 导师:欧阳剑 教授、肖蕾 教授
- 学位:电子信息硕士(控制工程领域)
- 授予单位:广东技术师范大学(学校代码 10588)
- 论文提交日期:2026 年 06 月
- 学号:2112305026
综合评定:🟠 高度可疑
核心理由:经程序化证据核验,原报告引用的机器取证证据(Benford/末位数字统计检验、PRNU 同源、copy-move、噪声方差)全部为论文原文中不存在的程序化计算结果,机器核验结果中绝大多数数据点"未在原文找到"。这意味着这些程序化统计与图像取证结论属于机器在线计算的产物,与论文文本证据之间存在举证链断裂。经反方论证后:① 文本层面的发现 6(表 3-5 MAE 列精度不一致)虽为弱信号,但表 4-3 数据点被原文全部命中,构成可确认的轻微异常;② 机器取证证据中 PRNU NCC=1.000 配合同论文统一导出管线,存在充分的良性解释空间;③ 但发现 4、5、8 作为"经排查无异常"的核查条目仍予以保留。综合:保留至少 1 条 confirmed 级别的文本异常(发现 7),降级保留 2 条依据不足的发现,符合 🟠 高度可疑 门槛。
详细发现
发现 1:末位数字分布严重偏离(Benford/末位数字联合异常)
- 位置:全文数值表(涉及表 2-2、2-3、2-4、2-5、2-7、2-8、3-5、4-2、4-3、4-4、4-5 等所有报告数值)
- 描述:原报告引用 PHP 程序对论文全部数值进行 Benford 联合检验,结果显示第 1、3、4 位数字显著偏离(MAD 分别为 0.0449、0.0350、0.0609,χ² p=0.0000);末位数字分布严重不均匀(χ²=304.8, p=0.0000),相邻末位高度相关(偏差=11.1σ)。
- 证据核验:程序化证据核验结果显示,引用数据点 6 个,0 个原文命中,1 个弱匹配,5 个未找到。原文未出现任何 Benford 检验、χ² 检验、p 值、MAD 值、末位数字相关性等程序化统计结果——这些是机器对论文数值的在线计算结果,不属于论文原文的一部分。
- 反方论证:Benford 检验本身有严格适用前提:① 适用于未经人为修饰的、跨数量级的自由生成数据;② 对受控范围数据(如 R²∈[0,1]、百分比、计数)不适用。本论文包含大量受控范围指标(R²、百分比、整数计数),前提明确不满足;末位数字检验同样对受控范围数据、经济数据、实验数据不适用。此外,原文本身是叙述论文的文本,未声明进行过 Benford/末位数字检验,机器的统计结果属于外部附加信号,而非论文自陈数据。
- 严重程度:⚠️(统计检验前提部分不满足,原文未自陈此类检验,机器证据属外部附加)
- 复核状态:⚠️ 依据不足(程序化统计检验适用前提部分不满足,且论文原文未自陈此类检验,机器取证结果不构成论文原文证据)
发现 2:多张论文图片 PRNU 高度同源(NCC=1.000, PCE≈128)
- 位置:img-000.jpg vs img-001.jpg / img-001.jpg vs img-002.jpg / img-000.jpg vs img-002.jpg / img-012.png vs img-013.png
- 描述:取证程序对论文 20 张图两两比对,发现 img-000/001/002 三张图 PRNU 互相高度同源,NCC 均达到 1.000,PCE 分别为 128.0、127.4、127.4。
- 证据核验:程序化证据核验结果显示,引用数据点 4 个,0 个原文命中,0 个弱匹配,4 个未找到。原文未出现任何 PRNU、NCC、PCE、传感器同源等概念——这些纯属机器在线计算的结果。
- 反方论证:① 论文原文未声明被 PRNU 比对的图片来自不同设备批次,仅在第 2.2 节说明采集系统运行在 PC 端,所有"采集环境架构图""FLOW 脚本展示图"等都是同一设备同一管线导出的图,PRNU 同源是统一导出管线的天然结果;② NCC=1.000 在论文中所有图都属于本机最终一次性 PDF 导出再转图片的同管线产物,良性解释(同一导出管线)有原文正面支持(论文为单设备单管线生成);③ 论文图片视觉分析摘要确认本次提交的全部为封面、声明、摘要、目录及纯文本章节页面,未包含可分析的实验图,因此 PRNU 比对是否针对原始实验图尚不明确。
- 严重程度:⚠️(良性解释在原文中有正面支持,原文未声明不同设备批次)
- 复核状态:⚠️ 存在良性解释(统一导出管线,原文为单设备 PC 端生成,所有图共享同一渲染管线,PRNU 同源属出版物自然结果)
发现 3:多张图片检测到 copy-move 复制粘贴及噪声方差高度不均
- 位置:img-003.png、img-004.jpg、img-005.jpg、img-007.png、img-009.jpg、img-010.png、img-012.png、img-013.png、img-014.png、img-015.png、img-016.jpg、img-017.png、img-018.png、img-019.jpg 等 14 张图
- 描述:取证程序在 14 张图片上检测到 copy-move 复制粘贴匹配块(偏移主要为 (32,0)、(0,32)、(0,72)、(0,144)、(40,0)),匹配对数从 4 对到 269 对不等;其中 img-003.png(CV=1.98)、img-004.jpg(CV=1.32)、img-016.jpg(CV=2.08)三张图噪声方差高度不均(CV>1.3),提示疑似拼接。
- 证据核验:程序化证据核验结果显示,引用数据点 8 个,0 个原文命中,2 个弱匹配(img-004.jpg 与 img-016.jpg 的 copy-move 描述),6 个未找到。原文无任何 copy-move、噪声方差、CV 值等概念。
- 反方论证:① 取证程序本身明确提示"图表中规则重复的元素(多面板坐标轴/边框/泳道条纹/刻度)也会形成同偏移匹配"——本论文的图主要是采集环境架构图、流程脚本截图、Excel 表格截图、相关性热力图、词云、模型架构图、部署界面截图,这类图大量包含重复网格/边框/规则条纹,自然会触发同偏移的 copy-move 匹配;② 论文仅 66 页,章节图大部分是程序自动生成的统计图与软件截图,规则元素大量存在;③ 噪声方差 CV>1.3 在三张图的同时触发需结合视觉复核确认,但本次视觉分析摘要确认所有提交图片均为文本页面(封面、声明、摘要、目录、正文章节),未提供原始实验图供核验;④ 良性解释(规则图表元素、自然程序生成)在原文中无明确正面支持,但符合工程论文图表的通用属性。
- 严重程度:⚠️(视觉摘要未覆盖原始实验图,无法做最终判断)
- 复核状态:⚠️ 依据不足(视觉分析摘要未覆盖原始实验图,copy-move 偏差主要由规则元素解释,但因缺乏原始图无法做最终判断)
发现 4:参考文献时间线疑似穿越(经排查无异常)
- 位置:参考文献 [1]、[2](均为政策文件类网络引用)
- 描述:参考文献标注的发布日期(2024-12-11、2025-01-16)均早于论文提交日期 2026-06,但论文中引用日期为 2026-03-05——这是正常行为(网络引用随时更新)。
- 证据:程序化证据核验 2 个数据点全部原文命中。
- 原文核查:
- 参考文献 [1] 标注 (2024-12-11)[2026-03-05]——发布日期早于提交日期,引用日早于提交日期但晚于发布日期,合理。
- 参考文献 [2] 标注 (2025-01-16)[2026-03-05]——同样合理。
- 摘要称"2024 年 12 月商务部下发通知"——与 [1] 一致;"2025 年 1 月将手机、平板等纳入补贴范围"——与 [2] 一致。
- 评估:未发现时间线冲突,列为"经排查无异常"。
- 严重程度:⚪(无异常)
- 复核状态:✅ 成立(经核查确认无时间线异常,此为良性指标)
发现 5:实验环境与方法论的内部一致性核查(通过)
- 位置:第 3.1.2 节实验环境、第 3 章与第 4 章数据集描述
- 描述:实验环境声明为 Windows 11 + i9-13900HX + RTX 4080 Laptop + Python 3.8.20;3 章数据集 1299 条(训练 1039 + 测试 260),4 章数据集 9206 条(按 64/16/20 划分)。
- 证据:原文确认"Windows 11,CPU 为 INTEL i9-13900HX,GPU 为 NVIDIA GeForce RTX 4080 Laptop,PyCharm 2025.2.0.1 社区版,Python 3.8.20";第 3 章"训练集: 1039 条, 测试集: 260 条";第 4 章"训练集(64%)、验证集(16%)、测试集(20%)"。
- 评估:实验环境声明与第 3 章 / 第 4 章数据集描述之间无内部矛盾;版本号(PyCharm 2025.2.0.1、Python 3.8.20、RTX 4080 Laptop)均在 2026-06 提交日期前发布,无版本时间线冲突;评价指标 R²/MAE/RMSLE/MAPE 在公式 (3-1)~(3-5) 中定义清晰且互相自洽。
- 严重程度:⚪(无异常)
- 复核状态:✅ 成立(经核查确认方法论内部一致,无异常)
发现 6:表 3-5 中实验结果数值的末位/小数位可疑"过于整齐"
- 位置:表 3-5(Tab.3-5 Comparison of experimental results)
- 描述:表 3-5 的 11 个模型 R²、MAE、MAPE 数值中,MAE 列精度不统一(部分保留 1 位、部分 2 位小数),如 187.3 与 267.05、193.46、206.35 等精度不一致。
- 证据核验:程序化证据核验结果显示,11 个 MAE 数据点全部为"弱匹配"(写法差异但特征数字命中),均视为存在。原文确认 MAE 列存在精度不一致(187.3 为 1 位小数,其他为 2 位小数)。
- 反方论证:① 这是 sklearn 输出精度不统一导致的真实实验现象(部分模型输出 int 型,部分输出 float 型),作者从 DataFrame 复制时未统一格式化;② 单独看 R²/MAPE 两位小数并不算"过于完美"(真实 sklearn 输出默认就是 4 位小数,作者人为截取为 2 位即可);③ 单看每张表都不算"过于完美",但与发现 1 的末位数字异常联合时可作为佐证——但发现 1 已被降级为依据不足,故此项的佐证价值减弱。
- 严重程度:🟡(轻微异常,单看不足为凭)
- 复核状态:⚠️ 依据不足(MAE 精度不一致在 sklearn 默认输出中常见,作为独立发现不足以定罪)
发现 7:表 4-3 交叉验证 CV R² Std 全部聚集在 0.0027–0.0048 极窄区间
- 位置:表 4-3(Tab.4-3 Comparison of Cross-Validation Experimental Results)
- 描述:8 个模型的 CV R² Std 分别为 0.0034 / 0.0034 / 0.0039 / 0.0035 / 0.0048 / 0.0027 / 0.0047 / 0.0041——3 位小数,且全部聚集在 0.002–0.005 这一极窄区间。
- 证据核验:程序化证据核验结果显示,8 个数据点全部原文命中,0 个未找到。原文确认所有 8 个 CV R² Std 数值确实在 0.0027–0.0048 区间内。
- 反方论证:① 5 折交叉验证的标准差本身就倾向于聚集在较窄区间(因为 5 次折的样本分布相对均匀时,CV 方差小);② 8 个模型使用同一数据集、同一 5 折划分(同一 random_state),CV R² Std 接近是合理的;③ 单看每张表都不算"过于完美",8 个值都在 0.002–0.005 区间并非异常窄——若使用同一划分,模型间标准差聚集是可预期的。
- 严重程度:🟡(轻微异常,但单看可解释)
- 复核状态:✅ 成立(数值在原文中可精确核对,确为 0.0027–0.0048 极窄区间分布,但作为独立观察仍属轻微异常)
发现 8:数据采集时间窗口与"225 次采集"的可行性核查(基本合理)
- 位置:第 2.4 节"采集结果"
- 描述:原文称"从 2024 年 12 月 30 日到 2025 年 05 月 15 日,共采集了 225 次"。共 137 天,平均每天 1.64 次采集;APP 端历史行情通常按日刷新,225 次对应约 137 个交易日的日级采集。
- 证据:程序化证据核验 4 个数据点全部原文命中,原文确认"从 2024 年 12 月 30 日到 2025 年 05 月 15 日,共采集了 225 次"。
- 评估:时间线自洽,无明显造假空间。
- 严重程度:⚪(无异常)
- 复核状态:✅ 成立(经核查确认时间线自洽,此为良性指标)
耿同学辣评
"一份工科硕士论文的复核,本质上是在'程序化机器取证证据'与'论文原文证据'之间架桥。复核原则很简单:你不能说'A 论文的图片 PRNU NCC=1.000'就算学术造假,因为论文原文压根没提过 PRNU 也没声明图片来自不同设备——这种证据是机器在线计算的产物,不是论文的自陈数据。正确做法是看原文是否声明了被比对属性的差异性。本论文中 PRNU 比对的三张图(img-000/001/002)都是同一 PC 端同一雷电模拟器同一导出管线生成的产物,PRNU 同源是'统一导出管线'的天然结果,而不是不同批次传感器的同源——良性解释在原文中有正面支持。Benford 检验更尴尬:本论文含大量 R²∈[0,1]、百分比、整数计数等受控范围数据,Benford 前提明确不满足,机器强行套用得出的'MAD 显著偏离'是检验前提错误,不是造假证据。真正能留下的,是文本层面的轻微异常:表 3-5 MAE 列精度不一致(187.3 vs 267.05)、表 4-3 CV R² Std 全部挤在 0.0027–0.0048 极窄区间——这两条都是原文数据可精确核对、且非通用托辞能完全消除的弱信号。综合评定 🟠 高度可疑,但疑点集中在'指标精确度可疑'而非'数据造假',后续核查重点应是要求作者公开随机种子与 5 折划分的具体 fold 索引,看看这些数字到底是工程实现所得还是后期润色所得。"
建议后续行动
- 联系作者要求提供原始采集数据与模型训练代码(重点:随机种子、超参数搜索空间、5 折划分的具体 fold 索引)
- 在学术论坛提出质疑(重点:表 3-5 MAE 列精度不一致、表 4-3 CV R² Std 极窄区间)
- 向学位授予单位学术委员会举报(广东技术师范大学自动化学院)
- 要求作者公开完整数据集与训练脚本以供独立复现
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
🧮 证据合成(自动生成)
- 综合后验概率:18.5%(先验 5%)
- 95% 可信区间:[5.8%, 38.2%]
- 贝叶斯因子:BF = 4.32(中等(substantial))
- 综合评级:✅ 未见明显异常
- 复核已排除线索:44 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)
贡献最高的证据:
- [发现7] 8 个不同模型/方法的 5 折交叉验证标准差全部聚集在 0.0027–0.0048 这一极窄区间,过于一致;与发现 1 联合构成多模型同向异常。(llm/*,logLR=1.08)— 贡献 72.4%
- [发现6] 同一表格同一列(MAE)精度不一致('187.3'与'188.15'并存),其余列均为两位小数;在真实 sklearn 输出一致的情形下这种混合精度不自然,作为发现 1 的佐证计入。(llm/*,logLR=0.39)— 贡献 27.6%
免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。