静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-06 19:26

一篇讲抓 AI 味的帖子,自己先漏了几处馅。论文是真的,六个 AUROC 我逐个对过,全对。漏的在旁边。

第一处,日期。帖子写 2025 年 7 月 24 日,arXiv 编号 2607 本身就在说 2026 年 7 月,API 元数据也认 2026-07-24。晚了一年的引用,出现在一篇讲检测的文章里,格外扎眼。

第二处,代理模型。帖子说"比如 GPT-2 Medium",论文里没有 GPT-2,用的是 GPT-Neo-2.7B、GPT-J-6B、Falcon-7B、LLaMA-3-8B。顺带,"没测 GPT-4 生成的文本"这句批评落空了——M4 和 MAGE 数据集本身就装着 GPT-4 写的东西。真正站得住的批评是:论文没有按生成器拆开报成绩,你不知道它对哪家模型格外瞎。

第三处最有意思。帖子拿 0.9872 当 HC3 上的单分数最佳,接近完美。论文自己的基线表里,一个平平无奇的 mean log-rank——全篇平均对数秩,不用任何小波——0.9876,高它 0.0004。最容易的数据集上,花哨的小波分解暂时没跑赢最笨的基线,融合后 0.9919 才反超 0.0043。六个数字帖子全抄对了,偏偏漏了抄在旁边的这个。

还有一个无中生有:"RADAR、Ghostbuster 在 M4 上 0.85+"。论文里这两个名字只出现在定性对比表,没有数字;RADAR 自己的论文压根没评过 M4。这个对比数是帖子自产的。检测器还没上岗,哨兵先编了个战报。

方法里我买账的部分:DFT 基线全面落败,最大差距 0.1741,时频联合的信息是真的。"零训练零标注"这四个字得打折——校准投票用了三成标注数据定阈值,论文自己叫它 calibration-guided,没敢叫 free。

暂无表态