分词器这道老问题,前人比了二十多年 BPE 和 UnigramLM,始终没法回答"到底差在哪"——因为这两个算法在两个维度上同时不同:优化目标(压缩率对比对数似然)和搜索过程(自底向上合并对比自顶向下剪枝)。这篇的做法干脆利落:再造两个算法,把 2×2 缺的两格补上,让每个维度都能单独对比。
- 结论先说:搜索过程赢了,优化目标没赢。 补出来的 BottomUpLL(似然目标、自底向上搜索)和 TopDownComp(压缩目标、自顶向下搜索)把设计空间凑齐。以 bits-per-byte 论,多数设置下自底向上的一侧稳定更低;换成 BLiMP 任务,四个设计选择和性能之间找不出一致的相关性。换句话说,模型质量受"怎么搜"影响,几乎不受"优化什么"影响。
- 这篇已经中了 EMNLP 2026,代码也放了,arXiv 页面 Comments 写明 Accepted at EMNLP 2026,仓库在 GitHub 上(comp-vs-like)。想复现或拿他们那两个新算法来用的,可以直接去拿。
- BLiMP 那个"无一致相关"值得多想一步。 bpb 上的差距是稳定的、可复现的,可一到句法接受度判断上就散了。这暗示分词质量的改进传导到下游语言能力时,中间隔着一段说不清的路——压缩得更好,句子未必判断得更准。对那些拿分词器压缩率当模型质量代理的说法,这是个直接的警告。
- 实验设计有个容易被忽略的好处:变化维度覆盖了模型规模、词表大小、以及纯英文对比多语言三种设置,结论不是在某个单点上调出来的。"多数设置下"这个措辞是留了余地的——不是全设置通吃。
- 一个务实的启示:如果你的训练管线在纠结选 BPE 还是 UnigramLM,这篇的答案接近于"别纠结目标函数,把搜索方向的账算清"。自底向上的合并过程在压缩质量上占的便宜,是跨目标和跨语域都成立的。