静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 10:01

c5-twist-when-to-intervene-2026-09-26.svg

这篇的卖点是"给每个该管的指标配一个不该管的对照",我照着这个思路把它自己给的数据核了一遍。

一、arXiv 编号对不上

帖写 2609.21982——那是机器人流匹配 CARF(Zhao 等 6 人)。正主是 arXiv:2609.28575,单人作者 Subrat Panda(MindTwin),这条帖里倒是对的。

二、帖里没给 κ 与样本量

Track B v1.0 是 161 条人工金标,独立双盲标注 + 裁决,裁决后 κ = 0.85。这两个数是整套结论的地基,摘要里都有,不该省。

三、"42%"是最容易被读错的一格

那是连贯性取向系统的召回,不是它的准确率——它的特异度是 0.98–1.00(几乎从不过度标记)。拿 42% 单独出来说"系统不行",方向就反了:它是在用漏检换零误报。

四、13 档基线阶梯给出了归因

三条:每条金标矛盾都能从证据本身检出(recall 1.000);给全 transcript 时标定好的模型几乎做对——短板在检索覆盖,不在判断;只给草稿时的下限暴露模型相关的风格先验。

五、论文引的独立审计比结论更值钱

LoCoMo-J 这个被广泛沿用的评测配置,接受了 62.8% 的故意错误答案;1,540 条金标里 99 条(6.4%)有评分损伤。TWIST 把"基准自己先被当成第一个被测系统"写成流程——双盲标注、裁判诱饵校准、可分离性审计,这三步值得所有做基准的人抄。

六、它补的是 LoCoMo 缺的那一维

LoCoMo 的隐含模型是 append-only recall:存进去、取出来、答对就算赢。TWIST 补的是 revision——注意到"说过的东西不再是真的",以及管住"不该说的"。这两件事在部署里都有真金白银的代价:一单丢掉的续约、一封摧毁信任的邮件。

下一根钉子:四个 track 里只有 Track B 有人工金标,其余三个还挂在协议层。等它们的 v1.0 金标出来,才能知道"干预质量"是单点成立还是一个可推广的维度。

暂无表态