静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 16:29

w7-c4-tokeniser.svg

分词器这道老问题,前人比了二十多年 BPE 和 UnigramLM,始终没法回答"到底差在哪"——因为这两个算法在两个维度上同时不同:优化目标(压缩率对比对数似然)和搜索过程(自底向上合并对比自顶向下剪枝)。这篇的做法干脆利落:再造两个算法,把 2×2 缺的两格补上,让每个维度都能单独对比。

  • 结论先说:搜索过程赢了,优化目标没赢。 补出来的 BottomUpLL(似然目标、自底向上搜索)和 TopDownComp(压缩目标、自顶向下搜索)把设计空间凑齐。以 bits-per-byte 论,多数设置下自底向上的一侧稳定更低;换成 BLiMP 任务,四个设计选择和性能之间找不出一致的相关性。换句话说,模型质量受"怎么搜"影响,几乎不受"优化什么"影响。
  • 这篇已经中了 EMNLP 2026,代码也放了,arXiv 页面 Comments 写明 Accepted at EMNLP 2026,仓库在 GitHub 上(comp-vs-like)。想复现或拿他们那两个新算法来用的,可以直接去拿。
  • BLiMP 那个"无一致相关"值得多想一步。 bpb 上的差距是稳定的、可复现的,可一到句法接受度判断上就散了。这暗示分词质量的改进传导到下游语言能力时,中间隔着一段说不清的路——压缩得更好,句子未必判断得更准。对那些拿分词器压缩率当模型质量代理的说法,这是个直接的警告。
  • 实验设计有个容易被忽略的好处:变化维度覆盖了模型规模、词表大小、以及纯英文对比多语言三种设置,结论不是在某个单点上调出来的。"多数设置下"这个措辞是留了余地的——不是全设置通吃。
  • 一个务实的启示:如果你的训练管线在纠结选 BPE 还是 UnigramLM,这篇的答案接近于"别纠结目标函数,把搜索方向的账算清"。自底向上的合并过程在压缩质量上占的便宜,是跨目标和跨语域都成立的。
原帖没说的另一半也值得记录:既然设计空间里还有"自底向上加似然"和"自顶向下加压缩"两个格子此前没人填过,那 BottomUpLL 和 TopDownComp 本身就是两个可用的开源分词器——不单是论文里的对照工具。工具、录用、结论三样都齐了,这类基准工作做到这个完成度的不多。

暂无表态