保险理赔系统里"是/否"两个字段,改成"否/是",赔付率能翻过来——2609.26758 这篇测的就是这件事,而它的主角不是帖子里写的那三个名字
这篇的核心实验干净利落:问题、状态、rubric 措辞、选项名集合全部逐字节不变,只把"哪个名字绑在哪条定义"换掉。1,200 个带任务特定 rubric 的工作流决策,把两个选项从 0/1 改名成 no/yes,每百答案多改变 70.4 个,AUC 从 0.94 跌到 0.23。
我去核了 v2 全文,作者名单、模型身份、还有几个数字的口径,跟帖里不一样。
一、v1 是两个人,v2 是四个
帖里作者栏写"Yu Sun, Junhao Xu"。arXiv 记录:
- v1(9-22 17:38):Yu Sun(新加坡国立)、Junhao Xu(复旦),两人共同一作
- v2(9-23 18:21):增补为 Yu Sun、Junhao Xu、Jiajia Shi、Zijin Yang 四人
【直引】这条本身有信息量:一个关于"第三方 VLM 裁判该信谁"的问题,作者阵容一天内从两个变成四个。
二、主角是 Laya,不是 Jev
帖里说"研究 Jev 及两个类 Jev 开权重模型"。全文 Table 6 的真实结构是:
- Laya(ModernBERT-large,开放权重)—— 主角
- Jev(闭源 API 模型)—— 对照
- Open-Jev(DeBERTa-v3-large,开放权重)—— 第二个开放权重
帖里那句"renaming the two options from 0/1 to no/yes changes 70.4 more answers per hundred ... and shifts AUC from .94 to .23",把两个模型的数缝在一句里了:
- 70.4 pp = Laya 76.92% 减 0/1 对照 6.50%
- AUC 0.94 → 0.23 = Laya 的 93.8% → 23.2%
- 而"AUC 从 0.8146 变为 0.5806"是 Jev 的
这个区别是实质性的:跌到 0.23 意味着调阈值救不回来,无论你把判定线放在哪里都错。Jev 掉到 0.58 还能救。所以"系统性反转"这个描述只对 Laya 成立。
三、Open-Jev 的 AUC 一个都没报
Table 4 里 60.1% / 59.8% / 63.9% / 60.6% 这些数是 balanced accuracy,不是 AUC。Open-Jev 的 AUC 在正文和附录里都没有报告。
【判断】不报不等于 0,但这是全篇唯一一个"三模型齐表"里的空格。读者要拿三个模型做对照的话,手里只有两个模型的 AUC。
四、还有一格是"训练中见过 / 未见过"——这条最有工程价值
论文把极性名称按 Laya 训练词表分成两类:
| 名称类别 | Laya flip rate |
|---|---|
| 训练中见过(yes/no、false/true) | 63.29% |
| 训练中未见过(absent/present、negative/positive、rejected/accepted) | 47.25% |
| 中性(0/1、A/B) | 6.25% |
| 随机字符串 | 6.86% |
"训练中见过"那三倍差距(63.29% vs 47.25%)才是记忆的贡献。换句话说:这个坑有一半是词频,一半是语义。
而随机字符串(6.86%)回到中性区间这个对照做得极干净——它把"改名操作"这个变量彻底排除了:不是改名这件事会坏,是名字的极性会坏。
五、type-error rate 恒为 0 这件事,是全篇最实用的一条
帖子把它放在末尾一句。它应该是放在最前面的那条。
因为它把"类型安全"这个卖点整个作废了:输出永远落在 schema 里,schema 检查永远通过,决策准确率可以从 93.8% 掉到 23.2%,而类型错误率始终是 0。
【判断】论文自己引了厂商的话,说得比谁都准:"schema matching is guaranteed, thus we can confidently add 0% into the plots" —— 那个 0% 是推导出来的,不是观测出来的。这一篇的价值就是证明了这个推导和"模型是否理解选项"完全无关。
六、还有一格论文自己标了 upper bound,得保留
附录 C 里被排除的 600 个 generic-definition 问题,reassigned AUC 掉到 yes/no 8.6%、false/true 3.0%。论文说这些问题的定义本身以 "yes" 和 "no" 开头,名字和定义混淆,所以只作为 upper bound 报告。
这个排除是对的。但它也说明一件事:effect size 高度依赖"名字"和"rubric 文本"是否真的解耦。真实系统里这两者经常缠在一起,76.92% 这个数在生产里能实现多少,取决于你的 rubric 写得多干净。
下一根钉子:第三方那篇质疑已经指了方向——用高频非极性词做对照,看 flip rate 跟的是"极性"还是"话题内容"。这一格如果做出来发现跟话题有关,那"semantic polarity"这个归因就得重写(而 AUC 跌到 0.23 这个核心现象不受影响)。另一根:把 Open-Jev 的 AUC 补上——三个模型只有一个模型跌到随机线以下,是这篇最该有的对照。