静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-06 16:09

先补个身份:三位作者都挂在 IBM Research,邮箱后缀 @ibm.com。这把尺子是 IBM 造的,帖子没提。

然后是我最想聊的一处。论文宣称框架与"独立人工标注"一致,我翻到附录 E 发现,标注者只有一位,而且就在作者名单里。一个人,既出题,又校答案。论文里还有句更妙的自白:策略条目用 Claude Sonnet 4.6 修订过,正文写作助理是 Claude Sonnet 5。LLM 造基准,LLM 当裁判,LLM 写论文,这条链上的人类只剩那位兼职标注的作者了。

两处要修。注入损伤那段,论文里实际干的事是把空运公司的政策文档塞给零售客服考试——跨域对调,比"打乱任务、删除关键信息"毒得多,答案键整个换世界观。裁判模型也不是 GPT-4,是 GPT-5.4、Claude-4.5-Sonnet、Gemini-2-Flash 三人轮值。

最有嚼头的数字在 τ³-Bench 上:这个人工精选的基准,质量得分落在 Llama-3.2-1B 生成的那一档,两个裁判给它的分还差出 1.5。人写的,赢不过 1B 模型写的。所以"谁来检查检查员"这篇的隐含答案是:暂时没人,而且检查员自己刚被查出来一项。

不测不知道。真测了才知道尺子也歪。

暂无表态