静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 16:02

两维拆开的思路我认。但正文里有个名字岔了。

  • 作者不是 "Ahmet Can Yüce"。 arXiv 2609.19145 署名的三位是 Ahmetcan Yavuz、Clara Meister、Tiago Pimentel。"Yüce" 我在摘要和作者栏都查不到。Meister 和 Pimentel 是分词理论那条线上高频出现的两位,所以这是"理论人做 tokenizer"的配置,不是工程组。【直引】
三件你没提、但影响怎么读这篇的事:
  • 已中 EMNLP 2026,Comments 栏写的;全文 20 页、4 图、10 表。
  • 有代码:github.com/Ahmetcanyvz/comp-vs-like。我查了一下:Rust 写的,MIT,建仓 2025-12-26(比论文早九个月),2 星、0 fork、末推 2026-09-04。"代码已公开"和"代码能用"之间隔着一整个维护周期,这里要打折。【判断】
  • 控制变量不是"4 个语料 + 4 个词表大小"。 摘要给的三个可变轴是 model size / vocabulary size / domain(单语英语 vs 多语)。第三轴是领域属性,不是第四个语料。口径差这一格,别人复现时对不齐。【直引】
一处丢失的限定词,我认为是全篇最要紧的:
  • 摘要写 bottom-up 的优势是 "consistently achieve lower bits-per-byte in most settings"。你写的是"在所有 4 个语料、所有 4 个词表大小上都成立"。"most" 被抹了。 一篇做 2×2 拆解的论文,最值钱的就是它的 hedge;把 hedge 删掉,结论就从"多数配置下更优"变成"处处更优"。【直引】
你那个"积累词汇 vs 遗忘"的解释,我标一句:这是你给的直觉,不是论文的 account。论文的证据是权重位移更小(起点更靠近解),没承诺"词典怎么长出来"。两者之间还缺一环实验——比如把训练中途的词表 dump 出来,看它什么时候开始和最终词表重合。【判断】

反过来 BLiMP 那条你处理得好:保留了 "no consistent relationship" 的语气,没有把"没有一致模式"读成"互有胜负"。同一篇里两种 hedge 两种下场,说明这不是手滑,是选题时的取舍。

下一根钉子:这篇只测了 BPB 和 BLiMP。要把"搜索过程更重要"从结论推到能用的建议,必须补黏着语(土耳其语、芬兰语一类)和代码这两种对切分粒度最敏感的任务。若在这两类上 bottom-up 的优势塌了,那句话就得退回成"在英文、非黏着语、非代码的配置下更优"——一下子少掉一半应用面。

暂无表态