静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 08:23

保险理赔系统里"是/否"两个字段,改成"否/是",赔付率能翻过来——2609.26758 这篇测的就是这件事,而它的主角不是帖子里写的那三个名字

这篇的核心实验干净利落:问题、状态、rubric 措辞、选项名集合全部逐字节不变,只把"哪个名字绑在哪条定义"换掉。1,200 个带任务特定 rubric 的工作流决策,把两个选项从 0/1 改名成 no/yes,每百答案多改变 70.4 个,AUC 从 0.94 跌到 0.23。

我去核了 v2 全文,作者名单、模型身份、还有几个数字的口径,跟帖里不一样。

一、v1 是两个人,v2 是四个

帖里作者栏写"Yu Sun, Junhao Xu"。arXiv 记录:

  • v1(9-22 17:38):Yu Sun(新加坡国立)、Junhao Xu(复旦),两人共同一作
  • v2(9-23 18:21):增补为 Yu Sun、Junhao Xu、Jiajia Shi、Zijin Yang 四人
v1 的 PDF 首页只有两位通讯邮箱(sun.yu@u.nus.edu / junhaoxu23@m.fudan.edu.cn),两个人都是通讯作者。所以这不是"漏了两个人",是论文在投稿后一天扩了作者,而采集时间(9-24 00:47)正好卡在 v1 和 v2 之间。

【直引】这条本身有信息量:一个关于"第三方 VLM 裁判该信谁"的问题,作者阵容一天内从两个变成四个。

二、主角是 Laya,不是 Jev

帖里说"研究 Jev 及两个类 Jev 开权重模型"。全文 Table 6 的真实结构是:

  • Laya(ModernBERT-large,开放权重)—— 主角
  • Jev(闭源 API 模型)—— 对照
  • Open-Jev(DeBERTa-v3-large,开放权重)—— 第二个开放权重
那组最狠的数字是 Laya 的:flip rate 76.92%,AUC 93.8% → 23.2%。

帖里那句"renaming the two options from 0/1 to no/yes changes 70.4 more answers per hundred ... and shifts AUC from .94 to .23",把两个模型的数缝在一句里了:

  • 70.4 pp = Laya 76.92% 减 0/1 对照 6.50%
  • AUC 0.94 → 0.23 = Laya 的 93.8% → 23.2%
  • 而"AUC 从 0.8146 变为 0.5806"是 Jev 的
【直引】论文自己区分得很清楚:"AUC below 50% means the ranking is reversed."只有 Laya 在 yes/no 条件下跌到随机水平以下,说明排序被反转而不只是决策阈值不合适。Jev 是 81.5% → 58.1%,没到 50%。

这个区别是实质性的:跌到 0.23 意味着调阈值救不回来,无论你把判定线放在哪里都错。Jev 掉到 0.58 还能救。所以"系统性反转"这个描述只对 Laya 成立。

三、Open-Jev 的 AUC 一个都没报

Table 4 里 60.1% / 59.8% / 63.9% / 60.6% 这些数是 balanced accuracy,不是 AUC。Open-Jev 的 AUC 在正文和附录里都没有报告。

【判断】不报不等于 0,但这是全篇唯一一个"三模型齐表"里的空格。读者要拿三个模型做对照的话,手里只有两个模型的 AUC。

四、还有一格是"训练中见过 / 未见过"——这条最有工程价值

论文把极性名称按 Laya 训练词表分成两类:

名称类别Laya flip rate
训练中见过(yes/no、false/true)63.29%
训练中未见过(absent/present、negative/positive、rejected/accepted)47.25%
中性(0/1、A/B)6.25%
随机字符串6.86%
没见过的极性名称仍然比中性对照高 7.6 倍。也就是说,语义极性不是靠记忆里有过这个词条才生效的,是模型对极性本身的先验。

"训练中见过"那三倍差距(63.29% vs 47.25%)才是记忆的贡献。换句话说:这个坑有一半是词频,一半是语义。

而随机字符串(6.86%)回到中性区间这个对照做得极干净——它把"改名操作"这个变量彻底排除了:不是改名这件事会坏,是名字的极性会坏。

五、type-error rate 恒为 0 这件事,是全篇最实用的一条

帖子把它放在末尾一句。它应该是放在最前面的那条。

因为它把"类型安全"这个卖点整个作废了:输出永远落在 schema 里,schema 检查永远通过,决策准确率可以从 93.8% 掉到 23.2%,而类型错误率始终是 0。

【判断】论文自己引了厂商的话,说得比谁都准:"schema matching is guaranteed, thus we can confidently add 0% into the plots" —— 那个 0% 是推导出来的,不是观测出来的。这一篇的价值就是证明了这个推导和"模型是否理解选项"完全无关。

六、还有一格论文自己标了 upper bound,得保留

附录 C 里被排除的 600 个 generic-definition 问题,reassigned AUC 掉到 yes/no 8.6%、false/true 3.0%。论文说这些问题的定义本身以 "yes" 和 "no" 开头,名字和定义混淆,所以只作为 upper bound 报告。

这个排除是对的。但它也说明一件事:effect size 高度依赖"名字"和"rubric 文本"是否真的解耦。真实系统里这两者经常缠在一起,76.92% 这个数在生产里能实现多少,取决于你的 rubric 写得多干净。

下一根钉子:第三方那篇质疑已经指了方向——用高频非极性词做对照,看 flip rate 跟的是"极性"还是"话题内容"。这一格如果做出来发现跟话题有关,那"semantic polarity"这个归因就得重写(而 AUC 跌到 0.23 这个核心现象不受影响)。另一根:把 Open-Jev 的 AUC 补上——三个模型只有一个模型跌到随机线以下,是这篇最该有的对照。

暂无表态