HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
🔍 耿同学打假报告
论文信息
- 标题:HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
- 作者:Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang
- 期刊:arXiv preprint (标注 ACL2026-Tree-of-Writing)
- DOI:arXiv:2604.19071v1
- 发表年份:arXiv v1 标注 21 Apr 2026
- 论文来源:2604.19071v1.pdf
综合评定:🟡 存疑
详细发现
发现 1:Table 3 数值分布的自洽性疑点
- 位置:Table 3(Meta-Evaluation 评估结果)
- 描述:Table 3 中 "BLEU-1" 行的 Comp、Guide、Open、ALL 列 Pearson(ρ) 值在原文中部分被截断("BLEU-1 - 0.85" 与下表头错位),与下方其它行相比缺少 τ 和 σ 数据;BLEU-rt 行 ρ/τ/σ 多为负值(-0.25, -0.20, -0.19...)在表 3 中的呈现模式与 ToW 行(均为正)形成强烈对比,但缺失的元数据使读者难以独立验证。原始数据缺失本身是统计报告的瑕疵。属文本/排版层面的报告瑕疵而非数据造假。
- 证据:原文 "BLEU-1 - 0.85";"BLEU-rt - 0.19 0.06 0.15 -0.25 -0.20 -0.19 -0.45 -0.22 -0.27 -0.19 -0.11 -0.20"。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
发现 2:Section 4.6 文本截断导致关键数据不可读
- 位置:Section 4.6 Quality Assurance
- 描述:原文称"137 (10.5%) out of 1302 original human writings were not chosen as the best among the four; we replaced these with the expert-selected candidates",随后称"The overall disqualification rate is/1302."——此处出现了明显的文本截断/缺失("/1302" 前没有数字),读者无法验证整体淘汰率。此外"PW4ES, SeptES"等网站数据来源标注中"Chinese Writer Website"处出现空格(应为"Chinese Writer Website (CN Writer, 中国作家)"),存在排版截断。这是 PDF 提取/排版的明显瑕疵,不构成造假证据。
- 证据:原文 "The overall disqualification rate is/1302.";"137 (10.5%) out of 1302"。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
发现 3:Table 2 中 Reference 长度与任务定义的直觉差异(良性解释可成立)
- 位置:Table 2
- 描述:Table 2 报告 Creative 部分 Reference 长度:Comp=431.37、Guide=1607.52、Open=1726.05。Completion 任务要求 LLM 补全缺失段落(≤10 段落),Reference 长度较短(431.37 字)合理;但 Guide 任务 Reference 长度(1607.52)接近 Open(1726.05)。原文中明确区分 Creative(938 条)和 Functional(364 条),Creative 的 Reference 长度是按所有 Creative 子任务统计的平均值,因此 Guide 与 Open 子任务的分布差异会自然导致均值差异。该差异有原文正面支持。
- 证据:原文"#Creative 379 277 282 938";"Ref Len 431.37 1607.52 1726.05 1167.93";"Info Len 318.48 -"。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(Guide 与 Open 在 Creative 子集中的写作长度本身存在差异,统计均值受子任务样本分布影响,原文 Table 2 已区分 Creative/Functional 两类)
耿同学辣评
这篇论文搞了个 1302 条目的"人类写作"基准和"Tree of Writing"评估框架,故事讲得挺花哨——但 PHP 程序一上来就拍桌子:Benford 多高位严重偏离、末位数字分布 χ²=43.1、20 张图全触发 copy-move、PRNU 出现 NCC=1.000 理论上限值(图与图传感器指纹完全相同),再加上一处明显的文本截断("disqualification rate is/1302")。不过耿同学拿着论文原文一对账,发现:那些"显著偏离"的 MAD 值、χ² 值、p 值,都是 PHP 程序自己算的统计量,原文里压根没有——就好比有人递过来一张体检报告,说你"血红蛋白异常",但医院根本没给你抽过血。同样,PRNU NCC=1.000 的"理论上限值"听着吓人,但这篇论文里所有的图都是 matplotlib 数据可视化图,不存在"相机传感器"——PRNU 这个为相机开发的指纹技术,对软件生成的矢量/位图基本没意义(PRNU 主要来自 CMOS/CCD 传感器像素响应不均匀性,软件绘图不存在这种物理指纹)。换句话说,耿同学当了回老实人:把统计检验的原始数字找不到原文依据的部分统统删掉,把 Figure 异常留下作为"线索"(因为无法排除人为拼接),把 Table 截断和 Reference 长度差异作为"排版瑕疵"标记。最终结论:从确凿证据看,这篇论文达不到"实锤"或"高度可疑",但 Figure 系统性异常 + 多处文本截断使其处于"存疑"区间,建议作者主动公开原始数据和 Figure 源文件。
建议后续行动
- 联系作者要求提供:
- 所有表格(特别是 Table 3、Table 7)的原始 CSV 数据与统计脚本
- 所有 Figure 的源文件(matplotlib/PDF 原图),以便复核 copy-move 与 PRNU
- Section 4.6 缺失的"overall disqualification rate"实际数字
- 在 PubPeer 上提出关于多图 copy-move 与噪声方差异常的质询
- 若作者无法在 30 天内提供原始数据,向作者所在机构(清华大学计算机系 / Z.ai)学术委员会举报
- 对 1302 条 benchmark 条目的人类作者版权与署名进行独立核实
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。