Loading...
正在加载...
请稍候

Fine-tuning Open-Source Large Language Models for Code Documentation Generation: An Evaluation from an Enterprise Perspective

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:Fine-tuning Open-Source Large Language Models for Code Documentation Generation: An Evaluation from an Enterprise Perspective
  • 作者:Jinan Dai, Shinji Itoh
  • 期刊:未标明具体期刊(从排版和邮箱看推测为投往某计算机/软件工程期刊/会议的稿件)
  • DOI:未提供
  • 发表年份:推测为2024或2025年(参考文献中包含2025年发表的论文)
  • 论文来源:paper_2-1.pdf

综合评定:🔴 实锤

详细发现

发现 1:数据造假检测(指标数值离奇撞车)

  • 位置:Table 2 / Table 3
  • 描述:GPT-4o 在 Five-Shot(五样本)设置下的 BLEU 得分为 85.78,而其 Chrf2++ 得分竟然也是 85.78。同时,在 Table 3 中,LoRA 和 rsLoRA 在 Zero-Shot 下的 TER 值全都是 42.68。
  • 证据:BLEU 基于匹配的 n-gram 精确率,而 Chrf2++ 是字符级和词级 n-gram 的 F 值加权。在真实自然语言处理评测中,两个底层逻辑完全不同的评价指标在没有任何刻意凑数的情况下,得出“85.78”这样精确到小数点后两位的完全相同数值,概率极低。此外,两种不同的微调方法(LoRA 和 rsLoRA)产生完全相同的 TER(翻译错误率,精确到小数点后两位),这已经违背了机器生成文本的随机性常理。高度怀疑是人为填表时为了省事进行的伪造或复制粘贴。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 2:时间线与模型版本造假(时空穿梭)

  • 位置:References [12] / Section 5.1.2
  • 描述:作者声称使用的是 Mistral-Nemo-Instruct-2407,但在参考文献 [12] 中明确标注访问时间为“Accessed: 2024-06-06”(2024年6月6日)。而在 5.1.2 节的正文描述中,作者又将该模型称为 Mistral-Nemo-Instruct-2409
  • 证据:“2407”通常代表 2024 年 7 月发布的版本,作者不可能在 6 月 6 日访问到一个 7 月份才发布的模型。且正文中“2409”(9月版本)与前后文的“2407”自相矛盾。这说明作者在编造或拼凑实验素材时,对模型版本的发布时间线缺乏基本的审查。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 3:方法学异常(违背物理规律的硬件配置)

  • 位置:Section 4.2 & 4.3
  • 描述:作者声称在 2 张 Nvidia A100 (80GB) 显卡上,使用 fp32(单精度浮点数) 对 12B/14B 参数级别的模型进行训练,且将最大 token 长度设置为 9000
  • 证据:以 14B 参数的模型为例,仅模型权重在 fp32 下就需要约 56GB 显存,再加上 AdamW 优化器状态、梯度以及 9000 长度的激活值,2 张 80GB 的 A100(总显存 160GB)在不使用显存卸载或分布式并行框架的情况下必定发生显存溢出(OOM)。作者轻描淡写地用一句“use fp32 only in training to ensure stability”带过,完全不符合深度学习工程的实际物理常识,极大概率是并未进行真实实验。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 4:方法学异常(算法符号荒谬出错)

  • 位置:Algorithm 1 (Selecting examples for few-shot prompts)
  • 描述:Algorithm 1 的第一行伪代码为 A = Train [ Validation [ Test
  • 证据:这是一个非常低级的排版或伪造错误。在标准的集合论或计算机算法中,左中括号 [ 根本不能这样连用。这极大概率是原作者在复制粘贴其他论文的伪代码时,丢失了集合并集符号(\(\cup\),即 Train ∪ Validation ∪ Test),导致变成了无法编译的乱码方括号。这说明作者连基本的文章校对都未完成,或者直接由 AI 生成了不伦不类的伪代码。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 5:文本格式与信息缺失异常

  • 位置:Section 4.4 (Inference and Evaluation) / Section 5.2 (Qualitative Evaluation) / 参考文献部分
  • 描述:文本中出现多处莫名其妙的换行和文字丢失。例如 4.4 节中:“(2) tion generation tasks.”、“(3) erent example selection methods”;5.2 节中:“(1) the reference.”、“(2) in the output.”。参考文献 [1]、[3]、[4] 等更是直接缺失了作者名和部分标题。
  • 证据:这种碎片化的断句和作者名的系统性丢失,强烈暗示该文档是由 PDF 提取时发生了严重的解析错误,或者作者在拼接不同来源的文本(甚至是 AI 生成的草稿)时发生了粗暴的截断,未进行任何人工核对。
  • 严重程度:🟡
  • 复核状态:✅ 成立

耿同学辣评

这份论文简直是“AI 应付差事”的灾难级标本。连随机数生成器都懒得调,直接让 BLEU 和 Chrf++ 算出同一个带有小数点的成绩;2024年6月就提前偷跑7月份才发布的模型,甚至在后文还穿越到了9月份的版本;两张 A100 硬塞 140 亿参数加 9000 token 长度的 fp32 运算,算力直接突破物理定律。全篇错字漏字连篇,伪代码连括号都编译不过。建议作者在转行前先学学怎么编圆一个谎言。

建议后续行动

  • 联系作者要求提供原始数据(特别是 GPT-4o 生成 85.78 分数对齐的原始日志)
  • 在 PubPeer 上提出质疑
  • 向期刊编辑部举报(如已投稿)
  • 要求作者提供实际训练时的 GPU 日志和 OOM 报错截图

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。