压缩即正义?Latent Core Tokenizer:当分词器学会先理解再压缩
你看到的是"今天天气真好",它看到的是一串数字 token。把人类文字切成机器能消化的最小单位——这就是分词器(tokenizer)做的事。这个看似不起眼的预处理步骤,直接决定了一个语言模型能看到多少信息、学得好不好。
你有没有想过,GPT 跟你聊天时,它看到的文字和你的不一样?
你看到的是"今天天气真好",它看到的是一串数字 token。把人类文字切成机器能消化的最小单位——这就是分词器(tokenizer)做的事。这个看似不起眼的预处理步骤,直接决定了一个语言模型能看到多少信息、学得好不好。
最近一篇来自 104 种语言、20 万词表的大规模实验论文,提出了一个反直觉的结论:分词器不应该只追求压缩率,而应该先理解语言结构,再决定怎么压缩。 这就是 Latent Core Tokenizer(LCT)。
分词器的老问题:压缩 ≠ 公平
主流分词器 BPE(Byte Pair Encoding)的工作方式很直白:统计语料里哪两个字符最常一起出现,把它们合并成一个 token,重复这个过程直到词表填满。简单粗暴,压缩率很高。
但问题出在多语言场景。想象一个同时服务中文、英文、斯瓦希里语的词表:英文语料多,BPE 就会偏向英文的常见组合;斯瓦希里语因为语料少,被切得更碎,同样一句话要吃更多 token。这就像一个翻译公司只给英语部门配了完整字典,其他语言部门只能用拼音凑合——表面上一个公司,实际上不公平。
论文给出了具体数字:在 104 种语言、20 万词表的设定下,LCT 比 BPE、Unigram 和 Parity-Aware BPE 都实现了更低的 fertility(每种语言被切成的平均 token 数更少),同时 MorphScore 更高(词形结构保留更好)。在四个多语言下游任务上,LCT 比 BPE 高 1.48 分,比 Unigram 高 1.83 分,比 Parity-Aware BPE 高 2.00 分。
核心创新:把"发现结构"和"构建词表"拆开
LCT 最有意思的地方是它把分词器的工作分成了两个阶段:
第一阶段:发现潜在结构(Latent Discovery)。LCT 用三种信号来识别语言里"值得保留"的语言单元:
- 最小描述长度(MDL):一个语言片段如果反复出现,且每次出现都节省了编码长度,就值得保留。这就像你发现"ing"在英语里到处都是,每次单独编码都浪费,不如给它一个独立编号。
- 分支熵(Branching Entropy):如果某个位置后面可以接很多不同的字符,说明这里很可能是一个词素边界。比如"un-"后面可以接 happy、fair、likely,分支熵高,说明"un-"是一个有意义的语言单元。
- 词法约束(Morphotactic Constraints):不是所有拼接都有意义。英语里"-s"可以接在名词后面表复数,但不能随便接在动词后面。LCT 用语言特定的约束来过滤不合理的切分。
这个分离是关键:结构发现决定哪些构建块值得保留,表面打包决定哪些组合值得占一个 embedding 槽位。 一个有生产力的词根可以影响词表构建,即使最终它被包含在一个完整词的 token 里。
一个类比:图书馆编目
想象你要给一个多语言图书馆编目。BPE 的做法是:统计哪些书最常被一起借阅,就把它们放在同一个书架上。结果英语畅销区占了最好的位置,小语种的书被塞到角落。
LCT 的做法是:先请语言学家分析每种语言的内部结构——哪些是词根、哪些是词缀、哪些是常用搭配。然后根据这些结构信息,结合使用频率,来决定书架分配。结构信息指导分配,但不强制最终位置——一个常用词根即使被包含在某个完整词里,也能影响周围书架的安排。
为什么压缩率不等于表示质量
论文最深刻的发现是这一句:"压缩 alone does not predict representation quality"(压缩率本身不能预测表示质量)。
这听起来反直觉——压缩率越高,不是说明分词越好吗?但想想看:如果你把所有中文都切成单字,压缩率很高(每个字只需要一个 token),但"葡萄"和"葡"+"萄"的语义完全不同。一个把"葡萄"切成两个 token 的分词器,压缩率比切成一个 token 的高,但语义表示更差。
LCT 的实验验证了这一点:Parity-Aware BPE 在压缩率上做了优化(专门平衡不同语言的 token 效率),但下游任务表现不如 LCT。因为 LCT 不仅看压缩率,还看切出来的单元是否对应有意义的语言结构。
语言平衡:不是配额制,是加权制
LCT 处理多语言公平性的方式也值得注意。它不是给每种语言分配固定数量的词表条目(配额制),而是给每种语言的语料加权——小语种的语料被放大,大语种的被缩小,使得每种语言对结构发现的贡献大致相等。
这就像国际会议不是按国家大小分配发言时间,而是确保每种语言都有足够的机会被听到。最终的词表分配仍然基于频率和效率,但结构发现阶段已经不会被大语种主导了。
局限与诚实评价
论文也不是没有弱点。首先,LCT 的三个阶段(MDL、分支熵、词法约束)需要针对每种语言调参,虽然论文声称"language-agnostic",但实际上词法约束需要语言专家的先验知识。其次,20 万词表是一个相当大的预算,在更小的词表(比如 5 万)下 LCT 是否仍然优于 BPE,论文没有探讨。最后,1.48-2.00 分的提升虽然统计显著,但在实际应用中是否带来可感知的差异,还需要更多端到端评估。
但核心洞察是扎实的:分词器不应该只是一个压缩算法,它应该是一个语言理解系统。 在大模型时代,当所有人都盯着参数规模和训练数据时,分词器这个"底层基础设施"的优化往往被忽视。LCT 提醒我们:模型看到的世界,取决于你用什么镜片给它。
论文:Latent Core Tokenizer: Compress, but Meaningfully arXiv:2610.12376 作者:Felermino D. M. A. Ali, Millicent Ochieng, Ogbemi Ekwejunor-Etchie 等