基于大语言模型的表格布局理解与自动填写系统研究
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:基于大语言模型的表格布局理解与自动填写系统研究
- 作者:何天赐
- 期刊:吉首大学硕士研究生学位论文
- DOI:无(硕士学位论文)
- 发表年份:2026
- 论文来源:main_png.pdf
综合评定:🟠 高度可疑
详细发现
发现 1:基础实验数据发生“薛定谔的突变”(同一实验两套基线)
- 位置:表 4.1 / 表 5.2(基础模型在空白模板上的成绩) vs 表 4.2 / 表 5.3(未微调基线成绩)
- 描述:在完全相同的实验条件(同一批模型、未微调、面对相同的空白模板)下,论文在不同的表格中给出了两套截然不同的“基线”数据。作者在汇报总体平均成绩(如表4.1)时使用了一套数据,而在证明自己微调方法“卓有成效”(如表4.2)时,又使用了另一套被大幅度压低的数据,存在严重的数据造假嫌疑。
- 证据:
- Llama-3.1-8B-Instruct 的空白模板(任务一)成绩:在表4.1中为 26.24%,但在表4.2的基线列中却变成了 23.60%。
- Gemma-2-9B-it 的空白模板(任务一)成绩:在表4.1中高达 59.95%,而在表4.2的基线列中却变成了 54.35%。微调后的成绩为52.47%,作者利用这套被压低的基线(54.35%),将原本相比真实基线(59.95%)的负增长(-7.48%),粉饰成了看似可以接受的微小下降(-1.88%)。
- 严重程度:🔴
- 复核状态:✅ 成立
⚠️ 发现 2:为强行包装“显著提升”,系统性篡改对照基线
- 位置:表 5.2 vs 表 5.3,以及第 4.4.2 节与 5.5.3 节的正文描述
- 描述:作者为了让微调后的数据显得提升“极为突出”(如声称Mistral提升+10.44%),在计算提升幅度时弃用了前面章节刚汇报过的高分基线,转而使用被篡改的低分基线来进行对比。
- 证据:原报告指出表 5.2 中 Mistral-7B 任务二未微调真实成绩为 18.21%,微调后为 21.99%,而表 5.3 基线被改成了 11.55%。由于当前提供的论文原文中缺乏表 5.2 和表 5.3 的具体数据文本支撑,无法对该具体数值变动进行完全复现核实。
- 严重程度:🔴
- 复核状态:⚠️ 依据不足
发现 3:文本未提供原始图像,无法进行图像造假检测
- 位置:全文图片(图 1.1 - 图 6.13)
- 描述:当前提交的文本中未包含可供分析的原始高分辨率图像面板,无法进行常见的图片复用、PS 拼接痕迹及视觉异常等审查。
- 证据:基于现有纯文本与表格数据,仅有图目录而无图像像素信息。
- 严重程度:🟡(信息不全)
- 复核状态:✅ 成立
耿同学辣评
这篇论文的数据堪称“薛定谔的基线”!同一个模型跑同一个空白模板测试集,在第四章的表4.1里Gemma考了59.95分,翻一页到了表4.2,为了证明自己微调有效,硬生生把没微调的成绩“动动手指”改成了54.35分!原来微调后成绩下降的负面结果,经过这一番基线篡改的“数字游戏”,瞬间变成了“可接受的轻微下降”。为凑出“显著提升”的结论而随意篡改对照实验数据,这不仅是在侮辱大语言模型,更是在挑战学术诚信的底线!
建议后续行动
- 联系作者及导师要求提供原始实验日志(log文件)以核对表4.1与表4.2中基线数据的真实一致性
- 要求作者公开表5.2与表5.3的原始评测脚本与输出结果
- 向吉首大学学术委员会及研究生院举报涉嫌学位论文核心实验数据造假
- 建议答辩委员会重新审查该学生的实验记录本和底层代码
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。