基于检索增强生成技术的多表格政府统计文档问答研究
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:基于检索增强生成技术的多表格政府统计文档问答研究
- 作者:马辰飞(指导教师:彭晨)
- 机构:吉首大学
- 期刊/来源:硕士学位论文
- 发表年份:2026年5月
综合评定:🟡 存疑
详细发现
⚠️ 发现 1:多模型对比实验存在明显的“复制粘贴”造假痕迹(随机数生成器都不如)
- 位置:第五章,表 5.1(第 71 页)及 5.5.2 节文字描述
- 描述:原报告指出作者在表 5.1 中对比了四种方法在四种不同大语言模型基座上的表现,数据呈现出极其荒谬的一致性(如 OneR 方法在不同模型上全部精准等于 4%)。
- 证据:原报告列举了表 5.1 中存在不同模型产生完全相同结果的数据。然而,提供的论文原文截断于 5.3.2 节,并未包含表 5.1 的具体数据以及 5.5.2 节的文字描述,无法在原文中核实这些具体数值。
- 严重程度:🔴
- 复核状态:⚠️ 依据不足
⚠️ 发现 2:核心实验数据违背常理的“整数化”完美分布
- 位置:第五章,表 5.1(第 71 页)
- 描述:原报告指出在总样本数为 50 的情况下,表 5.1 报告的准确率呈现出“太完美”的整数化规律,存在凑数嫌疑。
- 证据:虽然原文 3.4.3 节明确指出“共包含 50 组多跳问答对”,但原报告引用的表 5.1 具体实验数据(4%, 40%, 42%, 46% 等)未能在所提供的论文文本中出现,无法对数据进行复核。
- 严重程度:🔴
- 复核状态:⚠️ 依据不足
耿同学辣评
原报告火力全开,直指多模型对比实验存在“复制粘贴”般的造假痕迹。如果原文数据果真如此,那确实是一出“赛博朋克版的机械降神”。但打假得靠实锤,由于目前提供的论文原文在实验结果部分(第五章 5.3.2 节之后)出现缺失,我们无法亲眼目睹表 5.1 中那些“一模一样”的数据。在拿到完整的原始表格之前,这口造假的黑锅只能先挂在“存疑”的衣架上。做学术求真,我们既要敢于质疑,也要严守证据链的底线。
建议后续行动
- 获取论文第五章后半部分的完整原文(特别是表 5.1 的具体内容),以进行二次验证。
- 若核实表 5.1 数据确实存在跨模型一模一样的现象,应立即要求作者提供原始实验日志。
- 在未确认完整图表数据前,暂缓向官方机构举报,保持“疑罪从无”的审慎态度。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。