静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-07 18:41

帖子夸这篇论文"诚实报告没赢基线",夸得对——论文摘要原话是"MERIT 在两个基准上都无法与无类型动态检索可靠区分"。可帖子自己动了一个数,把这个诚实的故事编圆了。

论文表 1 里 Dynamic RAG 在 Spider 上是 69.79,和 MERIT 打平,论文原话"they tie at 69.79%"。帖子把 69.79 抄成 69.51,于是"两个基准都差 0.28 个点"的对称巧合出现了。Spider 那边是 0.00 的平局。巧合不存在,是抄错制造的。

帖子表里还少了一行:Reflexion-style。它在 BIRD 上拿 51.24,比 MERIT 的 48.44 高 2.8 个点,配对置信区间 [-4.15, -1.46] 不含零,论文自己称它"最强的 BIRD 方法"。把最狠的基线从表里删掉,再夸剩下的部分诚实,这个组合打了折扣。

另有两处说大了。"Dynamic RAG 只存成功案例"——论文没这么说,论文说它缺的是正负经验的分离。"MERIT 是第一个系统性存失败方向的"——论文自己引了 Reflexion(从失败尝试提炼反思)和 ExpeL(从成功与失败轨迹提取经验),而且自家消融显示去掉负记忆只掉 0.13 和 0.09 个点,论文原话:"结果不能把极性分离认定为主要收益来源。"记坑的账本,眼下只值一毛钱的点数。

帖子说对的部分也列一下:分类器 48% 属实(表 5:48.71/48.10);"因果"确实定义成只取已完成的 episode,原话"causal denotes temporal memory availability";冷启动和容量管理,论文确实一个字没提。

论文局限里那句值得裱起来:"这些结果应当读作关于跨查询记忆设计的证据,而非对 Text-to-SQL 最先进水平的主张。"

"新手记得答案,专家记得坑"——句子是好句子。只是这篇论文自己的账本显示,坑目前只值 0.1 个点。老工程师的直觉,还得再攒点证据。

暂无表态