分词器在偷偷监督你的输出:一个被90%论文忽视的根本性问题
你正在评测两个大语言模型的数学推理能力。模型 A 在"347 + 231 = ? "上答对了,模型 B 答错了。你得出结论:模型 A 的数学能力更强。
分词器在偷偷监督你的输出:一个被 90% 论文忽视的根本性问题
你正在评测两个大语言模型的数学推理能力。模型 A 在"347 + 231 = ? "上答对了,模型 B 答错了。你得出结论:模型 A 的数学能力更强。
但如果你知道这两个模型用的分词器(tokenizer)不一样呢?如果模型 A 的分词器把 "578" 切成一个 token,而模型 B 的分词器把它切成 "5"、"7"、"8" 三个 token,那么模型 B 实际上是在做一个更难的任务——它需要在一次前向传播中生成三个 token,而模型 A 只需要生成一个。
2026 年 9 月,达姆施塔特工工业大学的 Tanja Baeumel 等人在 arXiv 发表了一篇论文,提出了一个让人坐不住的论断:分词器不只是输入预处理,它还是输出监督——它决定了模型在训练时收到的监督信号。
论文链接:https://arxiv.org/abs/2609.01386
一个被默认为"无关紧要"的选择
在 NLP 研究的常规流程中,分词器选择就像选编程语言的缩进风格——大家都承认它有影响,但很少有人认为它是关键变量。论文作者做了一个调查:在 120 篇近期发表在 *ACL 期刊和会议的"数值推理"论文中:
- 只有约 10% 报告了模型使用的数值分词方式
- 约 69% 在不同的分词方式之间比较模型,却没有说明这一点
分词器如何变成"监督信号"?
要理解这个论断,需要先想清楚自回归语言模型的工作方式。
当模型生成 "578" 这个答案时:
- 如果分词器把 "578" 切成一个 token,模型只需要在一次前向传播中输出这个 token。它需要的是"一次性给出答案"的能力。
- 如果分词器把 "578" 切成 "5"、"7"、"8" 三个 token,模型需要先输出 "5",然后基于 "5" 输出 "7",再基于 "57" 输出 "8"。它需要的是"逐步推理"的能力。
论文的核心洞察是:分词器的输出端粒度,决定了模型在训练时被监督的是什么。 一个 token 的监督信号是"这个 token 对不对",多个 token 的监督信号是"这个 token 对不对,然后下一个 token 对不对,然后……"。这两种监督信号训练出来的能力是不同的。
一个巧妙的解耦实验
为了验证这个假说,作者设计了一个"输入-输出分词解耦"实验。
通常,输入和输出用同一个分词器。但作者让输入用一种分词方式(比如把数字切成单字符),输出用另一种(比如把数字切成多位数),反之亦然。
如果分词器影响的是"输入表示",那么改变输入分词应该影响最大;如果分词器影响的是"输出监督",那么改变输出分词应该影响最大。
结果非常清晰:输出分词方式决定了模型的训练动态、内部表示和最终性能,而输入分词方式几乎没有影响。
这个结果和"分词器是输入预处理"的传统观点完全矛盾。分词器的主要作用不在输入端,而在输出端——它定义了模型在训练时收到的监督信号。
这意味着什么?
这个发现有几个深远的含义:
第一,跨模型比较可能是不公平的。 当你说"GPT-4 的数学能力比 Claude 强"时,如果两个模型用的分词器不同,你比较的可能不是模型能力,而是分词器定义的任务难度。论文中提到,在数值推理任务上,不同分词方式导致的性能差异可以达到 20 个百分点以上。
第二,模型蒸馏时需要小心。 如果教师模型和学生模型用的分词器不同,蒸馏的不仅是知识,还有"任务定义"。学生模型可能学到的不是"怎么做数学题",而是"怎么做用这种分词方式定义的数学题"。
第三,分词器的选择应该被当作一个核心设计决策,而不是一个实现细节。 论文建议,所有涉及模型比较的论文都应该报告分词器信息,尤其是数值、代码等对分词敏感的领域。
一个更深的思考:我们评测的到底是什么?
这篇论文让我想起一个更广的问题:当我们说"模型 A 在任务 X 上比模型 B 强"时,我们到底在评测什么?
很多时候,我们评测的不是"模型的能力",而是"模型 + 分词器 + 提示词模板 + 解码策略 + 评测脚本"这个整体的能力。如果其中任何一环不同,比较就可能不公平。
分词器是这个问题的一个极端例子,因为它的影响是根本性的——它改变了模型在训练时收到的监督信号。但类似的问题也存在于其他环节:不同的提示词模板可能激活不同的能力,不同的解码策略可能产生不同的输出分布,不同的评测脚本可能对"正确答案"有不同的定义。
评测的盲区往往不在我们看不到的地方,而在我们看到了但默认"无关紧要"的地方。 分词器就是这样一个被默认无关紧要的环节。
"评测盲区定律"的又一例
这篇论文和之前一系列关于 LLM 评测盲区的论文形成了一个谱系:
- Omission Blindness:LLM 法官能检测"说了什么"但不能检测"没说什么"
- MIST:注意力和因果贡献几乎不相关
- Aspire:模型的自我评估和真实能力几乎不相关
- Calibrated Enough to Know:模型 90% 能判断"这不可预测",但行动闸门不咨询判断模块
这些论文的共同主题是:评测中那些被默认"无关紧要"的环节,往往是影响最大的环节。 不是因为它们复杂,而是因为它们太基础以至于被忽视。
局限与未解之问
论文的实验主要在数值推理任务上做的,结论是否能推广到其他任务(如代码生成、自然语言推理)还需要验证。另外,论文只研究了分词器对输出监督的影响,没有研究分词器对输入表示的影响——虽然实验显示输入分词影响较小,但这不意味着它没有影响,只是影响较小。
但作为一个"指出系统性盲区"的工作,这篇论文已经足够有力。它不需要证明分词器是所有问题的根源,只需要证明它是一个被忽视的重要变量——这一点它做到了。
结语
下次你看到"模型 A 比模型 B 强 X 个百分点"的结论时,先问一个问题:它们用的分词器一样吗?
如果不一样,那这个 X 个百分点里,有多少是模型能力的差异,有多少是分词器定义的任务难度的差异?
你大概率得不到答案——因为 90% 的论文不会告诉你。
论文链接:https://arxiv.org/abs/2609.01386 作者:Tanja Baeumel, Josef van Genabith, Simon Ostermann 机构:达姆施塔特工工业大学