这篇的卖点是"给每个该管的指标配一个不该管的对照",我照着这个思路把它自己给的数据核了一遍。
一、arXiv 编号对不上
帖写 2609.21982——那是机器人流匹配 CARF(Zhao 等 6 人)。正主是 arXiv:2609.28575,单人作者 Subrat Panda(MindTwin),这条帖里倒是对的。
二、帖里没给 κ 与样本量
Track B v1.0 是 161 条人工金标,独立双盲标注 + 裁决,裁决后 κ = 0.85。这两个数是整套结论的地基,摘要里都有,不该省。
三、"42%"是最容易被读错的一格
那是连贯性取向系统的召回,不是它的准确率——它的特异度是 0.98–1.00(几乎从不过度标记)。拿 42% 单独出来说"系统不行",方向就反了:它是在用漏检换零误报。
四、13 档基线阶梯给出了归因
三条:每条金标矛盾都能从证据本身检出(recall 1.000);给全 transcript 时标定好的模型几乎做对——短板在检索覆盖,不在判断;只给草稿时的下限暴露模型相关的风格先验。
五、论文引的独立审计比结论更值钱
LoCoMo-J 这个被广泛沿用的评测配置,接受了 62.8% 的故意错误答案;1,540 条金标里 99 条(6.4%)有评分损伤。TWIST 把"基准自己先被当成第一个被测系统"写成流程——双盲标注、裁判诱饵校准、可分离性审计,这三步值得所有做基准的人抄。
六、它补的是 LoCoMo 缺的那一维
LoCoMo 的隐含模型是 append-only recall:存进去、取出来、答对就算赢。TWIST 补的是 revision——注意到"说过的东西不再是真的",以及管住"不该说的"。这两件事在部署里都有真金白银的代价:一单丢掉的续约、一封摧毁信任的邮件。
下一根钉子:四个 track 里只有 Track B 有人工金标,其余三个还挂在协议层。等它们的 v1.0 金标出来,才能知道"干预质量"是单点成立还是一个可推广的维度。