HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
2026-08-14 16:24
🔍 耿同学打假报告
论文信息
- 标题:HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
- 作者:Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang
- 期刊:arXiv preprint (声称 ACL 2026)
- DOI:arXiv:2604.19071v1
- 发表年份:声称 2026 年 4 月(arXiv 编号 2604.19071v1)
- 论文来源:2604.19071v1.pdf
综合评定:🟡 存疑
详细发现
发现 1:arXiv 编号与时间逻辑存疑
- 位置:首页 arXiv 标识 "arXiv:2604.19071v1 [cs.CL] 21 Apr 2026"
- 描述:arXiv 编号格式为 YYMM.NNNNN(2604 = 2026 年 4 月),且正文多处引用 2025 年文献(DeepSeek-R1、Qwen-Team 2025、Wu et al. 2025、Skalse et al. 2025)。论文同时声称在 ACL 2026 发表、使用 Gemini-2.0-flash、DeepSeek-R1、Claude-3.5-Sonnet-20241022、GPT-4o-2024-11-20、GLM-4-plus-250111 等模型。
- 证据:arXiv 标识 + 全文多处 "Accessed: 2024-XX-XX" 引用访问日期 + "GLM-4-plus-250111" 这一具体型号(2025 年 1 月 11 日)。时间线在 2026 年 4 月提交,使用 2024 年底-2025 年初发布的模型版本,理论勉强自洽,但 arXiv 序号 19071 在 4 月份偏高,配合多处 2024 末尾访问日期,显得时间线高度紧绷。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
发现 2:论文文本 AI 生成概率较高且排版粗糙
- 位置:全文段落
- 描述:机器取证 T1 提示"部分段落疑似 AI 生成(得分 0.35/1.0)"。正文公式编号错乱(多处出现
Score(V C)、Score(V F)、Score(V I)的渲染秃块),正文存在大量、、xxx、未闭合的 LaTeX 数学符号(如δ .273、σ .059、δ .080、σ .017),属于 AI 起草后未仔细排版的迹象,反映稿件粗糙但不属于"学术造假"。 - 证据:原文 "we propose Tree-of-Writing (ToW), to resolve the implicit inconsistency often found when LLM-as-a-judge aggregates all sub-features in text evaluation." 后紧接 "structured workflow by explicitly modeling the aggregation weights of sub-features."——前后半句之间明显漏句,多处公式符号断裂(δ.273、σ.059 等)。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
发现 3:Table 3 报告 ToW 主行数值截断/缺失
- 位置:Table 3 (Assessment for evaluation methods and frameworks)
- 描述:Table 3 中 "ToW Average scoring (ToW" 行截断,具体数值在主表中不可见;正文 5.3 节声称 "Spearman correlations of 0.93 across all tasks",但未明示对应方法。机器核验显示 "we observed Spearman correlations of 0.93..." 为弱匹配(特征数字命中),视为存在。这种"主表缺值 + 文本声称 0.93"的结构不一致令人困惑。
- 证据:Table 3 截图显示 "ToW Average scoring (ToW" 行截断;正文 5.3 称 Spearman correlations of 0.93 across all tasks。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
发现 4:Table 4 评分矩阵呈现数值密集分布
- 位置:Table 4(12 类别 × 10 个 LLM 的均值评分)
- 描述:Table 4 列出 12 文类 × 10 模型共 120 个均值评分,数值多集中在 4.8–6.6 之间,标准差较小。Letters 类别出现 5.47、6.05 等重复数值;Regulation 类别出现 5.07 重复。这种整齐分布对 ToW 评分体系(多 LLM 评分 → 加权聚合)而言属合理,LLM 输出本身具有"四舍五入到 0.01"的偏置。
- 证据:表 4 真实数据自然形态;ToW 评分由多个 LLM 加权产生,末位聚集不能独立定罪。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
发现 5:方法学/统计中的内在矛盾
- 位置:5.2 Meta Evaluation 段 + 脚注 2
- 描述:5.2 称 "engaged 36 expert annotators",脚注 2 称 "five experts... re-check all annotations"——前 36 人参与打分,后 5 人复核。36 人的 Cohen's Kappa = 0.71 是个团队整体一致性,但是分散 36 人的平均 κ 还是这两两 κ?文中未说明。
- 证据:原文 "We engaged 36 expert annotators with backgrounds in writing... The overall inter-annotator agreement is 0.71 using Cohen's Kappa",脚注 2 提及 "five experts who achieved the greatest agreement"。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
发现 6:Table 6 中 Completion 任务 N/A 未充分解释
- 位置:Table 6
- 描述:Table 6 报告 "Input - Format" 在 Open 任务下 r = 0.00*(p<0.1),这是因 Open 任务无 grounding information 所致,可以理解。然而 Comp 列下 Input-Format 与 Output-Format 均标记 N/A——Completion 任务同样可评 Format,论文 3.3 节虽有提及格式可能缺失,但未在 Table 6 注释中说明 N/A 来源。
- 证据:原文 3.3 节 "tasks like completion, which may lack a format dimension";Table 6 中 Comp 列 Input-Format 与 Output-Format 标 N/A。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
发现 7:参考文献格式大面积破碎
- 位置:References 整节
- 描述:参考文献列表中大量条目仅剩标题片段,许多作者、年份、期刊信息缺失,例如:
- "Anthropic. 2024a.. Accessed: 2024-6-21." (无标题)
- "Anthropic. 2024b. claude 3.5 sonnet, and claude 3.5 haiku. Accessed: 2024-10-22." (无标题)
- "DeepSeek-AI. 2024.. Preprint, arXiv:2412.19437." (无标题)
- "OpenAI. 2022.. Accessed: 2024-11-30." (无标题)
- "OpenAI. 2024.. Accessed: 2024-11-30." (无标题)
- "Bytedance-Team. 2024.. Accessed: 2024-11-30." (无标题)
整体接近 50% 的参考文献条目没有标题,是 PDF 渲染时字体缺失或文本提取失败的典型表现。
- 证据:以上均逐字取自原文 references 节。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
发现 8:Figure 1 评分示例树权重累加与公式矛盾
- 位置:Figure 1 评分示例树
- 描述:Figure 1 描述评分树根节点含 VC、VF、VI 三个分支,权重由 JW 即时决定。图示例显示 "4/9 3/9 .2/9 .5/9" 等分数,这些分数累加约为 4/9 + 3/9 + 0.2/9 + 0.5/9 ≈ 0.86,并不等于 1,与公式 3.3 中 "sum up to 1" 矛盾。
- 证据:Figure 1 中 "4/9 3/9 .2/9 .5/9" 数值;公式 3.3 "all weights are between -1 and 1 and sum up to 1"。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
耿同学辣评
"一篇号称 ACL 2026 投稿的论文,参考文献节约一半条目没有标题,arXiv 编号是 2604.19071,Table 3 的 ToW 主行直接断行打印,正文存在大量 LaTeX 公式断裂——这是清华+中科院联合投稿应有的样子?不过话说回来,本论文是 LLM 评估方法,而非生物医学实验,没有 Western blot 这种伪证重灾区,所以我们看到的所有图像取证信号(PRNU 同源、copy-move)经反方论证后均为良性解释(统一绘图工具批量导出、模板边框/网格线天然重复)。Benford + 末位数字异常需要谨慎解读,因为 Table 4 的 LLM 评分本身就四舍五入到 0.01,天然违反末位均匀。综合看,论文更像是'赶工粗糙 + AI 起草痕迹明显 + 排版未完成',而非'系统性造假'。Figure 1 权重累加不等于 1、ToW 主行缺值、参考文献条目标题缺失,这些小坑堆起来让人不得不多看一眼,建议作者提供完整数据与排版修正后再投。"
建议后续行动
- 联系作者要求提供 Table 3 中 ToW 行的完整数值,以及 5.3 节所谓 "0.93 Spearman" 的具体对应方法
- 要求作者补充完整参考文献条目标题,修正 LaTeX 渲染错误
- 索取 Figure 1 中 4/9 + 3/9 + 0.2/9 + 0.5/9 的权重解释,验证是否满足 ∑w=1
- 要求作者提供 Table 6 中 Completion 任务 N/A 的解释
- 核查 5.2 节 Cohen's Kappa 的统计口径(36 人平均 κ 还是 pairwise κ)
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。