Tokenization 的边界测绘:预测码长当货币,可逆不等于无损(清华单作者 / Fact–Token 与 Token–State 双边界 / BPE 载体短 56.8% 码长反升)
素材是作者本人的视频文案加论文代码双链接,自述起点是"十五天音乐 GPT Demo"。这次海关轻松:转述层就是作者,引导词直接命中论文主论点——"Tokenization 不只是切 token,而是在决定哪些计算应当提前完成,哪些关系应当留给模型根据上下文判断"。一个背景信息:arXiv v1 标题还是《Why GP…
素材是作者本人的视频文案加论文代码双链接,自述起点是"十五天音乐 GPT Demo"。这次海关轻松:转述层就是作者,引导词直接命中论文主论点——"Tokenization 不只是切 token,而是在决定哪些计算应当提前完成,哪些关系应当留给模型根据上下文判断"。一个背景信息:arXiv v1 标题还是《Why GPT-Style Models Do Not Directly Transfer to Symbolic Music: Compression in the Wrong Coordinate System》,v2 已升格为《How Far Should Tokenization Go?》——作者自己完成了从"音乐域批评"到"一般理论"的改写。
框架:两条边界,一张分工图
论文《How Far Should Tokenization Go? Predictive Effectiveness and Relational Losslessness》(arXiv 2608.18025,Yi Wang,清华电子系硕士生,导师戴凌龙;sole author,under review ICLR 2027)的全部野心可以压成一句:tokenization 是对预测计算的模型相对分配,边界可以用一把尺子画出来。尺子就是 predictive codelength(预测码长)——模型在该表示下为每个事实付出的比特数。
Fact–Token Boundary(起点):观察决定的结构(比如把音符的绝对时刻改写成拍/小节坐标)应该进 token 接口,判据是"暴露它是否降低预测码长"。核心洞察一句话:信息保持不等于计算等价——两种表示可以保留完全相同的事实,却对有界学习器施加不同的近似负担。可逆性不足以证明坐标有用。
Token–State Boundary(终点):如果一个关系的有用形式依赖于上下文(同一对音在不同调性里功能不同),把它提前烧进静态接口就是"关系承诺",会加码长。全文最重的一拳是公式(8):R⁻¹(R(x))=x 推不出 E_rel≤0——可逆不等于关系无损。完全无损的表示仍然可能伤预测。
三个干预家族的裁决(Pop1K7,三预注册 seed,bits/fact)
| 干预 | 操作 | 码长变化 | 裁决 |
|---|---|---|---|
| 时间坐标 A→D | 绝对时刻→拍/小节坐标,分三阶段 | −0.848(−11.92%) | ✅ 暴露观察确定的结构,全 seed 一致收益 |
| 固定五度圈几何 I vs 关系开放 H | 把音高距离烧进坐标 | +0.098 | ❌ 关系承诺,三 seed 全退步 |
| 可逆 BPE J→K | 载体重编码,序列短 56.8% | +0.811 | ❌ 载体压缩≠预测压缩,每 seed 反升 |
时间显式化的增益有三分之二不在时间上。 0.848 bits 里只有 0.287 来自 Time 预测本身,其余主要落在 Pitch 和 Duration——暴露一个正交坐标重组了整个联合条件分布,而不只是让时间戳更好猜。结构放对位置,红利在别的维度涌现。ComMU 独立语料复现了方向(−0.111,未收敛复制,论文自己标注了这一区分)。
BPE 是全场最疼的实证。 载体从每事实 3.563 个 target 缩到 1.538(−56.8%),预测码长却每个 seed 都涨 0.811 bits。"压缩给模型看的数据"和"模型能便宜地预测"是两件事——LLM 的 BPE 恰恰就是可逆载体编码,这个反例的对话对象远不止音乐。
回接主线:第十六验证,以及从案例学到判定框架的升格
这个系列追了十五个"接口丢结构"的案例(Qwen3.8 管线、FreeToken KV、Synapse 检索、Cordis 重启、MKB 文本化……到 Luna-TTS 的解码拓扑层)。这篇论文的分量在于:把案例学升格成了判定框架。"丢结构会坏"是十五次观察,"什么该进接口、什么该留给模型"第一次有了可计算的判据——预测码长就是接口税的 bit 级记账货币。与 MKB 的"接口税常参数定价"(7:17/20)合流:MKB 在任务级定价,这篇在比特级定价,接口选择从事后评测变成事前记账。
三个旧主题在这张框架图里各就各位:
五度圈反例是 ADMET 标量死亡的音乐版。 五度圈是音乐理论里"最正确"的音高拓扑,ADMET 是药物化学里最权威的性质标签——把它们提前烧进表示都加了码长。专家先验的关系是上下文的函数,提前固定就是把"当前最常用的组织"冒充"事实"。对照 Luna-TTS 的 block-causal:恢复的是数据天然的二维网格拓扑,不是任何理论偏好的几何。正确方向浮出:暴露观察确定的坐标,烧掉专家先验的关系。
时间外溢红利与 infilling 红利同构。 Luna 把 RVQ 网格拓扑还给模型,声音克隆和语音编辑"原生就是 infilling";这里把时间坐标给对,三分之二增益涌现 Pitch 和 Duration 上——结构幸存后的红利自由涌现,是同一现象在两个模态的独立验证。
独立观察:通信工程的还乡与个人诚实包
作者画像是这条线最意外的结构信号。 清华电子系、导师是无线物理层大牛戴凌龙——一个通信背景的硕士做 tokenization 理论,看似跨界,实则同根:predictive codelength 就是信源编码的比特,这套框架本质是把 tokenization 当信源编码问题重述。率失真理论的语言正在回流到表示学习,这比论文本身更值得追踪——通信学科一百年积累的"如何分配比特"的数学,找到了新宿主。
复现包是 rigour as code 的个人版。 仓库四级证据分层(Level 0 无数据验证哈希账本→Level 1 CPU 合成冒烟→checkpoint→重训),账本显式到"G 操作每窗口收取 4-bit 逆码、J/K 乘数 244248/242269",三 seed 预注册,Limitations 自认"不意味着所有固定关系或 BPE 方案有害、ComMU 是方向性而非收敛复制、不建立感知质量与渐近 scaling"。单作者、0 star、公开 CV、ORCID——ARS 之后个人研究诚实配置的又一套全集。
README 里的四阶段研究轨迹(Representation → Predictive State → Recursive Memory → Revisable Intelligence)等于自觉把这篇定位成"表示层拼图"——与六层自改进栈(权重→经验→代码→harness→知识→方向感)的地图兼容,且预告了后两块 manuscript 的位置。
观察点
① ICLR 2027 评审结果:独立研究者单作者理论论文的接收实验,本身是学术评审系统的一个探针;② 后两阶段 manuscript(Recursive Memory / Revisable Intelligence)是否兑现轨迹;③ 有人把 \(G_carrier\) 实验搬到 LLM 域做 byte-level vs BPE 的码长对比吗——那是这条线真正的大考;④ 视频本身用 Qwen3-TTS 克隆作者声音、Manim 程序化动画——研究生用自己研究的同代工具讲自己的论文,这个自指值得记一笔。
信源:arXiv 2608.18025 v2(2026-08-18 提交,08-28 修订,全文 HTML 逐节核对,公式 8/表 2/图 2/附录 G-J 引用自原文);GitHub kinssion/effectiveness-losslessness(2026-08-28 建,README 冻结结果表+REPRODUCING.md 四级复现+公开 CV);moonlight.io 论文评述页(v1 标题确认)。所有数字回查至论文正文,五度圈 +0.09831、BPE +0.81061、时间 −0.84809 bits/fact 均为三 seed 均值。