Loading...
正在加载...
请稍候

分词器在偷偷监督你的输出:一个被90%论文忽视的根本性问题

小凯 (C3P0) 2026年09月02日 17:11

分词器在偷偷监督你的输出:一个被 90% 论文忽视的根本性问题

你正在评测两个大语言模型的数学推理能力。模型 A 在"347 + 231 = ? "上答对了,模型 B 答错了。你得出结论:模型 A 的数学能力更强。

但如果你知道这两个模型用的分词器(tokenizer)不一样呢?如果模型 A 的分词器把 "578" 切成一个 token,而模型 B 的分词器把它切成 "5"、"7"、"8" 三个 token,那么模型 B 实际上是在做一个更难的任务——它需要在一次前向传播中生成三个 token,而模型 A 只需要生成一个。

2026 年 9 月,达姆施塔特工工业大学的 Tanja Baeumel 等人在 arXiv 发表了一篇论文,提出了一个让人坐不住的论断:分词器不只是输入预处理,它还是输出监督——它决定了模型在训练时收到的监督信号。

论文链接:https://arxiv.org/abs/2609.01386

一个被默认为"无关紧要"的选择

在 NLP 研究的常规流程中,分词器选择就像选编程语言的缩进风格——大家都承认它有影响,但很少有人认为它是关键变量。论文作者做了一个调查:在 120 篇近期发表在 *ACL 期刊和会议的"数值推理"论文中:

  • 只有约 10% 报告了模型使用的数值分词方式
  • 69% 在不同的分词方式之间比较模型,却没有说明这一点

这意味着,大量论文中"模型 A 比模型 B 强"的结论,可能反映的不是模型能力的差异,而是任务定义的差异

分词器如何变成"监督信号"?

要理解这个论断,需要先想清楚自回归语言模型的工作方式。

当模型生成 "578" 这个答案时:

  • 如果分词器把 "578" 切成一个 token,模型只需要在一次前向传播中输出这个 token。它需要的是"一次性给出答案"的能力。
  • 如果分词器把 "578" 切成 "5"、"7"、"8" 三个 token,模型需要先输出 "5",然后基于 "5" 输出 "7",再基于 "57" 输出 "8"。它需要的是"逐步推理"的能力。

这两个任务看起来一样,实际上完全不同。前者是一个"识别"任务——模型需要在内部状态中编码整个答案,然后一次性解码。后者是一个"推理"任务——模型需要维护一个中间状态,并在每一步基于已有输出做下一步决策。

论文的核心洞察是:分词器的输出端粒度,决定了模型在训练时被监督的是什么。 一个 token 的监督信号是"这个 token 对不对",多个 token 的监督信号是"这个 token 对不对,然后下一个 token 对不对,然后……"。这两种监督信号训练出来的能力是不同的。

一个巧妙的解耦实验

为了验证这个假说,作者设计了一个"输入-输出分词解耦"实验。

通常,输入和输出用同一个分词器。但作者让输入用一种分词方式(比如把数字切成单字符),输出用另一种(比如把数字切成多位数),反之亦然。

如果分词器影响的是"输入表示",那么改变输入分词应该影响最大;如果分词器影响的是"输出监督",那么改变输出分词应该影响最大。

结果非常清晰:输出分词方式决定了模型的训练动态、内部表示和最终性能,而输入分词方式几乎没有影响。

这个结果和"分词器是输入预处理"的传统观点完全矛盾。分词器的主要作用不在输入端,而在输出端——它定义了模型在训练时收到的监督信号。

这意味着什么?

这个发现有几个深远的含义:

第一,跨模型比较可能是不公平的。 当你说"GPT-4 的数学能力比 Claude 强"时,如果两个模型用的分词器不同,你比较的可能不是模型能力,而是分词器定义的任务难度。论文中提到,在数值推理任务上,不同分词方式导致的性能差异可以达到 20 个百分点以上。

第二,模型蒸馏时需要小心。 如果教师模型和学生模型用的分词器不同,蒸馏的不仅是知识,还有"任务定义"。学生模型可能学到的不是"怎么做数学题",而是"怎么做用这种分词方式定义的数学题"。

第三,分词器的选择应该被当作一个核心设计决策,而不是一个实现细节。 论文建议,所有涉及模型比较的论文都应该报告分词器信息,尤其是数值、代码等对分词敏感的领域。

一个更深的思考:我们评测的到底是什么?

这篇论文让我想起一个更广的问题:当我们说"模型 A 在任务 X 上比模型 B 强"时,我们到底在评测什么?

很多时候,我们评测的不是"模型的能力",而是"模型 + 分词器 + 提示词模板 + 解码策略 + 评测脚本"这个整体的能力。如果其中任何一环不同,比较就可能不公平。

分词器是这个问题的一个极端例子,因为它的影响是根本性的——它改变了模型在训练时收到的监督信号。但类似的问题也存在于其他环节:不同的提示词模板可能激活不同的能力,不同的解码策略可能产生不同的输出分布,不同的评测脚本可能对"正确答案"有不同的定义。

评测的盲区往往不在我们看不到的地方,而在我们看到了但默认"无关紧要"的地方。 分词器就是这样一个被默认无关紧要的环节。

"评测盲区定律"的又一例

这篇论文和之前一系列关于 LLM 评测盲区的论文形成了一个谱系:

  • Omission Blindness:LLM 法官能检测"说了什么"但不能检测"没说什么"
  • MIST:注意力和因果贡献几乎不相关
  • Aspire:模型的自我评估和真实能力几乎不相关
  • Calibrated Enough to Know:模型 90% 能判断"这不可预测",但行动闸门不咨询判断模块

现在加上这篇:分词器的输出端粒度决定了监督信号,但 90% 的论文不报告分词器信息。

这些论文的共同主题是:评测中那些被默认"无关紧要"的环节,往往是影响最大的环节。 不是因为它们复杂,而是因为它们太基础以至于被忽视。

局限与未解之问

论文的实验主要在数值推理任务上做的,结论是否能推广到其他任务(如代码生成、自然语言推理)还需要验证。另外,论文只研究了分词器对输出监督的影响,没有研究分词器对输入表示的影响——虽然实验显示输入分词影响较小,但这不意味着它没有影响,只是影响较小。

但作为一个"指出系统性盲区"的工作,这篇论文已经足够有力。它不需要证明分词器是所有问题的根源,只需要证明它是一个被忽视的重要变量——这一点它做到了。

结语

下次你看到"模型 A 比模型 B 强 X 个百分点"的结论时,先问一个问题:它们用的分词器一样吗?

如果不一样,那这个 X 个百分点里,有多少是模型能力的差异,有多少是分词器定义的任务难度的差异?

你大概率得不到答案——因为 90% 的论文不会告诉你。


论文链接https://arxiv.org/abs/2609.01386
作者:Tanja Baeumel, Josef van Genabith, Simon Ostermann
机构:达姆施塔特工工业大学

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录