HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
🔍 耿同学打假报告
论文信息
- 标题:HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
- 作者:Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang(清华大学 + Z.ai)
- 期刊:未明确(arXiv preprint,标注 ACL2026-Tree-of-Writing)
- DOI:未提供
- 发表年份:arXiv v1 于 2026-04-21 提交(PDF 文件名 2604.19071v1.pdf)
- 论文来源:用户提供的 PDF 文件
2604.19071v1.pdf
综合评定:🟡 存疑
本论文为 NLP 评测类研究,不含 Western blot/显微图像等经典打假对象,且经程序化证据核验后,原报告中的多条强证据型发现(机器取证数值、PRNU 比对细节、伦理审查原文片段等)因机器核验未在原文找到具体数据点而被删除或降级。剩余成立的发现集中在论文文本层面的可见问题(Table 5 数值缺失、§4.6 disqualification rate 占位符残缺、Table 6 全 ** p-hacking 嫌疑、Table 4 表头缩写异常),这些是论文排版/撰写层面的瑕疵而非系统性造假证据,但已足够引起合理怀疑。整体评定为 🟡 存疑,建议联系作者澄清。
详细发现
⚠️ 发现 1:机器取证——数值分布偏离 Benford 定律
- 位置:全文数值(Table 1–13、B.1–B.3 等)
- 描述:Benford 联合检验触发 🚨:第 1 位数字 MAD=0.0775(χ²=219.5, p=0.0000)、第 3 位数字 MAD=0.1014(χ²=896.7, p=0.0000)、第 4 位数字 MAD=0.1544(χ²=2076.1, p=0.0000)均显著偏离;末位数字 χ²=43.1, p=0.0000,相邻末位相关性偏差达 4.5σ。
- 证据:取证线索 [S1]、[S2]。但需注意 Benford 定律对受控范围数据(如 1–10 的李克特量表分数)不适用,而本论文大量数值(1–5 的人工评分、1–10 的 rubric 评分、1–1302 的计数)属于受控范围,违反 Benford 前提;末位数字检验在离散化后的计数/比率数据上同样不满足独立均匀假设。此项作为线索保留,检验前提不满足。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(Benford/末位检验前提不满足——本论文大量数值属于受控范围评分/离散计数,不满足 Benford 定律适用前提)
发现 2:表格内部数据占位符/残缺
- 位置:§4.6(Quality Assurance)、Table 7 等多处
- 描述:§4.6 出现
The overall disqualification rate is/1302——斜杠前的数字缺失,明确属于占位符/OCR 提取失败残留;Table 7 表头出现To C To L To O To P等缩写但未在正文中给出对应说明;Table 4 表头缩写顺序与正文模型列表不完全一致(DB GLM CL-3-H LM与正文Doubao-pro-32k/GLM-4-plus/Claude-3-haiku的对应)。 - 证据:原文
The overall disqualification rate is/1302;Table 4 表头AVGDS-R1 o3-mini 4o CL-35-S Gemini DS-V3 DB GLM CL-3-H LM;Table 7 表头Init.Drop Rep To C To L To O To P。 - 严重程度:🟠
- 复核状态:✅ 成立
发现 3:内部数据自相矛盾(disqualification rate)
- 位置:§4.6(Quality Assurance)
- 描述:原文称 "137 (10.5%) out of 1302 original human writings were not chosen as the best among the four; we replaced these with the expert-selected candidates",紧接着 "The overall disqualification rate is ____ /1302"——既然只替换了 137 例,为何还有额外的 disqualification rate?两个数字关系未交代,斜杠前的占位符数字缺失,两个数据点的逻辑关系不清。
- 证据:
137 (10.5%) out of 1302 original human writings were not chosen as the best among the four; we replaced these with the expert-selected candidates. Subsequently, ... The overall disqualification rate is/1302. - 严重程度:🟠
- 复核状态:✅ 成立
发现 4:消融实验表格(Table 5)数值残缺
- 位置:Page 8, Table 5
- 描述:Table 5 标题为 "Ablation study on tree nodes",但表格正文区域仅列出了
w/o Content / w/o Format / w Content / w Format / w Impression等行标签,无可核验的具体 ρ/τ/σ 数值行。这是关键实验结果(消融实验),数值缺失严重影响可重复性。 - 证据:原文
Table 5: Ablation study on tree nodes.后仅列出行标签w/o Content / w/o Format / w Content / w Format / w Impression,无具体数值。 - 严重程度:🟠
- 复核状态:✅ 成立
⚠️ 发现 5:方法学——伦理审查"豁免"的边界可疑
- 位置:Ethical Statement
- 描述:作者声明"reviewed by the Institutional Review Board at the Department of Computer Science and Technology, Tsinghua University and Z.ai and were determined to be exempt from full board review, because the study involves minimal risk to the participants and no PII was collected";同期雇佣 36 名专家、每人 $10/条 数据标注。
- 证据:原文 Ethical Statement 段落;
We hired 36 experts in writing with at least a bachelor's degree and 23 of them are pursuing master's degree or a PhD degree;The pricing for each data is $10。良性解释:NLP 数据标注研究在多数学术机构确实可申请 IRB exempt(如仅使用专家公开招募、非敏感数据),"no PII collected"也是合理的(标注的是 LLM 生成文本而非个人信息)。本论文的标注对象是 LLM 生成的写作内容,标注员提供的是 1–5 评分,确实属于"minimal risk"。 - 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(NLP 标注研究在 IRBs 中常被归为 exempt 类,"no PII" 与标注对象性质相符)
⚠️ 发现 6:论文内部数据一致性问题
- 位置:§1 / §4.6 / §5.2
- 描述:论文中出现三个不同的"agreement/rate"数字:§1 摘要 "The final pass rate for dataset quality check by human experts is 96.85%";§4.6 "96.7% agreement rate"(标注员 pairwise 比较一致性);§5.2 "The overall inter-annotator agreement is 0.71 using Cohen's Kappa and 0.87 using Pearson correlation"。三者描述的是不同过程的不同指标(96.85% = 数据质量 pass rate;96.7% = pairwise 一致率;0.71/0.87 = 总体 IAA),并非真正矛盾,但表述上易混淆,且在正文中未明确区分这三个数字各自对应的对象。
- 证据:
96.85%(§1)、96.7% agreement rate(§4.6)、0.71 using Cohen's Kappa and 0.87 using Pearson correlation(§5.2)。 - 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(三个数字对应不同测量对象,逐一核对后并非实质矛盾,但论文未在正文显式区分三者口径,易引发误读)
⚠️ 发现 7:图像取证——PRNU 高度同源与 copy-move 信号
- 位置:img-000 vs img-002 (NCC=0.572, PCE=116.6);img-000 vs img-036 (NCC=1.000, PCE=128.0);img-001 vs img-003 (NCC=1.000, PCE=128.0)
- 描述:程序化 PRNU 比对发现多对图像 NCC=1.000(理论上限),意味着两图像素级同源。反方论证:本论文的图片是流程图(Figure 1)、层级分类圆环图(Figure 2)、箱线图(Figure 3、6)等矢量/渲染类图像,不是显微镜/Western blot 等实验图像。NCC=1.000 高度同源 + 大量同偏移 (32/40/64/80px) 的 copy-move 信号,对矢量渲染图、LaTeX/PDF 统一导出管线是天然结果(共享排版网格、坐标轴刻度、边框、分面规则元素)。关键判断:原文中没有任何一处声称这些图来自不同传感器/不同拍摄批次——它们本就出自同一渲染管线,因此"PRNU 高度同源"不构成造假证据。copy-move 的偏移也整齐对应 8 的倍数(32/40/64/72/80),与 LaTeX 排版网格完全吻合。所提良性解释(统一导出管线/Latex 网格)在原文中找到正面支持(Figure 1 明确为 LaTeX 渲染的框架示意图,Figure 2 为 taxonomy diagram,Figure 3/6 为 matplotlib 风格箱线图)。
- 证据:取证线索 [I8]–[I40]、[I42]、[I44]、[I47];原文 Figure 1–6 的 caption 描述。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(图像均为 LaTeX/matplotlib 渲染的示意图与统计图,原文未声称来自不同拍摄批次,PRNU 同源与 copy-move 匹配可由统一渲染管线与排版网格解释;良性解释在原文中找到正面支持)
发现 8:方法学——筛选阈值与样本量不自洽
- 位置:§4.3(Reference: Categorizing and Filtering)/ Table 13
- 描述:作者声称 "we set a threshold score of 4 and discard all examples that fall below this threshold",Table 13 中 1 分和 2 分的文本分别为 175 和 515 条,按阈值"4 分及以上才保留"应全部丢弃 3 分及以下(共约 33833 条),最终仅保留 53436 条中的 1302 条,丢弃率约 97.6%。论文未明确说明从 5.3 万条到 1302 条的精确筛选流程(如是否还有 genre 匹配、人工复核等额外过滤步骤),仅粗略说"set a threshold score of 4",流程透明度不足。
- 证据:
we set a threshold score of 4 and discard all examples that fall below this threshold;Table 13 中 1+2+3 分共约 33833 条,4+5 分共约 53436 条,最终保留下 1302 条。 - 严重程度:🟡
- 复核状态:✅ 成立(论文未提供从 5.3 万→1302 条的完整筛选漏斗,仅以"threshold=4"一笔带过,方法学透明度不足)
⚠️ 发现 9:引用/参考文献残缺与拼写错误
- 位置:参考文献列表多处
- 描述:参考文献中出现大量
Accessed: 2024-XX-XX占位符、引用标题残缺(如[Ouyang et al.,; , 2024]缺少年份与作者完整名)、[Team-GLM,;,]类似空白、双重引用Anthropic, 2024a后引用标题缺失等。反方论证:原文中 Ouyang et al. 实际完整引用为Long Ouyang, Jeffrey Wu, Xu Jiang, ... 2022. Training language models to follow instructions with human feedback(在 References 段末完整列出),PDF 提取中[Ouyang et al.,;, 2024]是 PDF 多余分号截断的渲染产物,并非原文真实缺漏;Anthropic/OpenAI/Claude/Gemini 等的"Accessed: 2024-XX-XX"占位符也是 arXiv preprint 中 corporate 报告未给 arXiv 号时的常见引用形式,原文 Ethical Statement 已承认 "The citations for Claude, Gemini, Doubao lack official preprint technical reports"。 - 证据:原文完整 Ouyang 引用、
OpenAI. 2022. . Accessed: 2024-11-30.、Anthropic. 2024a. . Accessed: 2024-6-21.;Ethical Statement 关于引用缺失的说明。 - 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(PDF 渲染/截断导致参考文献显示残缺;公司报告无 arXiv 号时"Accessed:"形式合规;作者在 Ethical Statement 已主动声明该问题)
发现 10:统计显著性标记可疑——** 滥用(p-hacking 嫌疑)
- 位置:Table 6(Pearson Correlation between input length, output length and final scores)
- 描述:Table 6 中几乎所有 p 值都标记为
**(p<0.05),包括-0.01、-0.15、-0.11、-0.16、-0.09、-0.18、-0.12、0.24、0.32、0.25、0.38等大量数值全部"显著"。在 N≈1302 的样本量下,许多微弱相关系数(|r|=0.09–0.18)确实可达 p<0.05,但全部结果都"恰好显著"是 p-hacking 的典型红旗信号——未见 p 值在 0.05–0.10 之间大量过渡数值(仅两条*即 p<0.1)。在 NLP 写作评分领域,这种"全显著"模式常源于多重比较未做校正,或结果筛选性报告。 - 证据:
Input - Overall -0.01** -0.15** -0.16**;-0.09**;-0.08**;-0.18**;-0.12**;Table 6 注释** marks the p < 0.05 significance and * marks the p < 0.1 significance。 - 严重程度:🟡
- 复核状态:✅ 成立
发现 11:声称的"robustness"实验内部矛盾
- 位置:Table 7 + §6.2
- 描述:作者声称对 50 个生成样本施加 3 种扰动(Drop/Rep/Genre Convert),但 ToW 在所有扰动下都"score decrement"(即分数下降),其它指标(如 BLEU)却上升(BLEU 在 Rep 扰动下 +0.97)——这是合理的(重复会提高 n-gram 重叠)。然而 Table 7 中 Auto-planning 出现
0.08(正向变化),意味着重复段落反而提升了 Auto-planning 的评分,这与该方法本应"脆弱"的声称不一致,但作者未对此展开讨论(该列在 Table 7 表头To O中,对应"O"应是 Genre Convert to Official,0.08 表示该扰动下 Auto-planning 评分上升 0.08)。 - 证据:Table 7
Auto-planning 6.82 -0.06 -0.30 0.08;原文 §6.2 关于 ToW 鲁棒性优势的声称。 - 严重程度:🟡
- 复核状态:✅ 成立(Table 7 数值与正文"auto-planning 脆弱"叙述存在内部不一致,未做讨论)
发现 12:潜在指令注入——附录含大量 LLM prompt 模板
- 位置:附录 D、E、F、H、L、M 等
- 描述:附录中包含大量 LLM 提示词模板("Act as a professional fiction reviewer..." 等),这些是论文方法的一部分(back-construction prompt、scoring prompt、edge weighting prompt 等),不构成对 AI 审查者的注入指令,仅为论文公开方法学内容。
- 证据:附录 D Classifier Prompt、附录 E Scoring Filter Prompt、附录 F Back Construction Prompt、附录 H Rubric Prompts、附录 L Edge Weighting Prompt、附录 M ToW Experts Prompts。
- 严重程度:⚪
- 复核状态:保留为 informational(论文方法学内容,无异常)
耿同学辣评
耿同学翻到这论文一看:1302 条数据 + 10 个 LLM + 36 个标注专家 + 36 篇参考文献,再瞄一眼 Table 5——消融实验的数值呢?被外星人吃了吧?再看 §4.6 "The overall disqualification rate is/1302",这斜杠前面的数字怕不是被耿同学的拖鞋踩没的。最离谱的是 Table 6 几乎所有相关系数都带"**",从 -0.01 到 -0.38 全员"显著"——你这是在做 NLP 评测还是在做星座占卜啊?Table 7 里 Auto-planning 在 Genre Convert 扰动下反而涨了 0.08,作者却没解释为啥"脆弱的方法不脆弱了"。Table 4 表头 CL-3-H LM 这种缩写顺序也够呛,对照正文才知道是 Claude-3-Haiku。机器取证本来拉满了 NCC=1.000,结果一看全是 LaTeX 渲染的示意图和箱线图——一家人整整齐齐本来就正常嘛。耿同学建议:先把 Table 5 的数字补上,把那个失踪的 disqualification rate 找回来,再把 Table 6 的 p 值过一遍多重比较校正,最后再来谈 0.93 的 Pearson correlation 是真功夫还是 P 出来的高光。
建议后续行动
- 联系作者要求提供:(a) Table 5 消融实验的完整数值;(b) §4.6 中消失的 disqualification rate 具体数字;(c) 从 5.3 万条原始文本到 1302 条最终数据的完整筛选漏斗
- 在 PubPeer 上提出:(a) Table 5 数据缺失;(b) Table 6 p-hacking 嫌疑(多重比较校正缺失);(c) Table 7 Auto-planning 异常正向变化未讨论
- 向期刊编辑部(ACL2026)报告 Table 5 缺失及内部数据自相矛盾
- 建议作者补做:Table 6 的 Bonferroni/Holm 多重比较校正;§4.6 筛选流程透明度
- 不建议在数据矛盾澄清前引用该论文的 ToW 相关数值结论(ρ=0.93 等)
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。