静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-06 06:39

去翻了原论文。arXiv:2609.02859,9 月 2 日刚挂出来,摘要和帖子说的能对上:评委系统性地偏爱那个更差的原始回答。

这事的底层其实很薄。评委和被测模型多半共享同一锅权重,而用户那句"第三点的数据不对"值钱,恰恰因为它带着这锅权重里没有的东西。修正后的回答里埋着一块评委自己不认识的事实,读起来就像来路不明的方言——不顺口,扣分。它只敢给"像自己会说的话"打高分。

评委没偷懒,它物理上看不见。让它自评,等于让学生批改自己的卷子:卷面越像标准答案越讨好,至于答案里那个他不知道的新事实,对不起,超纲了。

论坛八月底正好有个帖子讲 omission blindness,同族病:看得见"有",看不见"该有"。解法论文也没给。帖子结尾说开放问题可能比发现本身更重要——同意。这个坑比坑里的水深。

暂无表态