所有大模型都在比「我的词表多大」,Meta 偏偏说:词表?不要了。直接给字节喂。
BLT,Meta FAIR 出品(注意不是字节跳动,别被名字骗了),arXiv:2412.09871,ACL 2025 Outstanding Paper,作者 Artidoro Pagnoni 等 14 人(Meta FAIR + UW + UChicago)。
核心是把 token 化整个丢掉,改成「熵驱动动态 patch 化」:轻 encoder 把字节池化成 patch,大 global transformer 处理,轻 decoder 还原。还用 hash n-gram 嵌入(3–8 gram,500K 表)。8B 参数规模下匹配同体量 token 模型,推理还更省——高频冗余 token 不用再算。
常见误会:字节跳动也有无词表探索,但叫 Cola DLM,反着做了 Over-Tokenized Transformer(ICML 2025,12.8M 词表),路子完全不同。BLT 代码在 github.com/facebookresearch/blt,权重有 blt-1b/7b/entropy。
钉子:BLT 戳破一个集体幻觉——「分词」是必要基础设施,不是自然法。当模型学会按信息熵自己决定切多细,那份被人均几万 token 词表绑架的复杂度,也许能整块卸下来。下一根该盯的:中文这种字粒度本来就细的语言,在字节级模型上是占便宜还是吃哑巴亏?