✨步子哥
@steper · 2026年08月23日 06:08 · 5 浏览

无词表(Tokenizer-Free)LLM 架构 Byte Latent Transformer(BLT)

无词表 LLM 深度研究:BLT 字节潜在 Transformer Deep Research · 深度研究报告 无词表(Tokenizer-Free)LLM 架构Byte Latent Transformer(BLT) 不立词表、直餐字节——熵驱动动态补丁化如何革 tokenizer 之命?一份覆盖机制、实测、争议与产业前景的完整研究。 日期 2026-08-23 模式 full · 6 阶段流水线 检索 4 路并行 证据分级 已执行 三审 主编 / 魔鬼代言人 / 伦理 §0摘要(TL;DR) BLT(Byte Latent Transformer,字节潜在 Transformer)是 Meta FAIR 于 2024 年 12 月提出的无词表大语言模型架构——不依赖分词器与固定词表,直接以 UTF-8 原始字节为输入,通过「熵驱动动态补丁化(entropy-based dynamic patching)」把字节聚合成变长 patch 作为计算单元。核心论断:Patches Scale Better Than Tokens。 关键数字8B / 4T 首次完成字节级模型 8B 参数 / 4T 训练字节 的 FLOP 受控缩放研究(论文口径,GitHub 载 8T)。 存疑推理省 ~50% 推理 FLOPs 最多可省 ~50%,但未计入熵模型成本——第三方审稿质疑后或接近持平(见 §5)。 白赚鲁棒性 +8 点 噪声 HellaSwag 较同数据 Llama 3 高 8 点,与多训 16 倍数据的 Llama 3.1 持平;CUTE 字符级 +26.6 点。 考据非字节跳动 BLT 出自 Meta FAIR(ACL 2025 Outstanding Paper)。「字节」指 byte,非 ByteDance。字节的 Seed 团队未做 BLT。 ⚠️ 首要考据更正:BLT 论文出自 Meta FAIR(facebookresearch/blt 官方开源,2.1k★),并非字节跳动。「字节」乃计算机 byte(字节级建模)之意,非 ByteDance 之「字节」。四重验证见 §1。 目录 考据:BLT 之「字节」何指 核心机制:无词表如何运作 性能实测:与 Llama 3 正面交锋 关键数据速查 争议与批评:魔鬼代言人的三问 无词表路线谱系:从 ByT 到 BLT 产业前景与后继工作 结论与启示 来源清单 §1考据:BLT 之「字节」何指 1.1 论文出处:Meta FAIR,非字节跳动 项目内容 论文Byte Latent Transformer: Patches Scale Better Than Tokens · arXiv:2412.09871 作者Artidoro Pagnoni 等 14 人(Meta FAIR + UW + UChicago) 提交 / 荣誉2024-12-13 · ACL 2025 Outstanding Paper 官方代码github.com/facebookresearch/blt(2.1k★ · CC-BY-NC-4.0) 权重发布facebook/blt-1b · blt-7b · blt-entropy(2025-04-18,门控,FAIR 非商用许可;无 8B checkpoint) 生态接入HuggingFace Transformers 2025-09-19 原生支持(BltModel) 训练字节数口径不一arXiv 摘要 4T,GitHub README/模型卡 8T 1.2 字节跳动与 BLT:查无实据(四重验证) 验证途径结果 github.com/ByteDance-Seed/BLT404 不存在 GitHub org 检索(org:ByteDance-Seed)仅 3 仓库,无一与 BLT 相关 HF ByteDance-Seed 组织(59 模型)无 BLT;Seed-OSS / Seed-Coder 皆 Qwen2 架构传统词表模型 seed.bytedance.com 站内检索零 BLT 内容 ByteDance Seed 的无词表探索实为 Cola DLM(连续潜空间扩散)——与 BLT 的离散字节 patch 路线异路;更反讽的是,字节在词表方向的真实研究走完全相反的路——Over-Tokenized Transformer(ICML 2025)把输入词表扩至 12.8M 条目(过分词化),而非去词表化。 「字节的 BLT」当解为「字节级(byte-level)的 BLT」——BLT 之 Byte 是计算机字节,非 ByteDance 之「字节」。字节不仅没做 BLT,其词表研究反而背道而驰。 §2核心机制:无词表如何运作 2.1 为什么不要 tokenizer? 缺陷具体表现影响 跨语言不公平英语 1 token ≈ 4 字节,中文/日语每词 2-3 token语言间「token 税」差异巨大 固定词表刚性OOV、新词、罕见拼写无法处理长尾泛化差 字符级盲区拼写、回文、字母计数、错别字任务劣势字符级理解近零 噪声脆弱大小写翻转、字符删改即超出词表分布鲁棒性差 多模态障碍图像/音频/代码各需专属词表统一建模困难 压缩偏见词表由训练语料统计决定隐性语种/地域偏见 BLT 的回答:全部去掉——直接吃 UTF-8 字节,一切由模型自己学。 2.2 Patchification:按「难度」聚块 核心洞见:并非所有字节都同样难预测。「the 」几乎可确定,乱码/专名则难以预测。BLT 用一个 100M 参数的小型熵模型(patcher)逐字节预测下一字节熵:低熵(可预测)→ 长 patch 省算力;高熵(难预测)→ 短 patch 多给算力。 费曼式类比:「聪明的读者跳着读,生词才停下来查字典——BLT 让模型自己决定哪里该慢下来。」 2.3 三层架构:局部-全局-局部 原始字节流 b b b … ! b b b … ? b b b … b 熵模型 / Patcher(~100M) 逐字节预测熵 → 决定 patch 边界(低熵长块 · 高熵短块) patch(低熵·长) patch(高熵·短) patch(低熵·长) 局部编码器 ε 字节→patch 表征(轻量) 局部编码器 ε 字节→patch 表征(轻量) 局部编码器 ε 字节→patch 表征(轻量) 全局 Transformer G(主力算力) patch 序列自回归 · 块因果注意力 BLT 前向流程:字节 → 熵模型切块 → 局部编码器池化 → 全局 Transformer 在 patch 序列上自回归(解码端对称,局部解码器逐字节展开预测) 组件职责参数量级特点 熵模型 / patcher预测字节熵,决定 patch 边界~100M独立小模型,推理时逐字节运行 局部编码器 ε字节 → patch 表征轻量(1-2 层)交叉注意力池化 + 哈希 n-gram 嵌入 全局 Transformer Gpatch 序列自回归主力(数百 M~数 B)块因果注意力 局部解码器 Dpatch 表征 → 字节预测轻量(1-2 层)交叉注意力展开回字节级 2.4 「无词表」怎么实现? 输入侧:文本 → UTF-8 → 每字节映射 260 维 ID(0-255 + 特殊符)——无学习词表; 计算侧:字节经局部编码器聚成 patch,全局模型只处理 patch 序列(长度约为字节的 1/4~1/8); 输出侧:逐字节自回归生成。 由此「双模型架构」成立:熵模型负责切块,主模型负责生成,二者独立训练(端到端联合训练为论文所列未来工作)。 §3性能实测:与 Llama 3 正面交锋 3.1 主评测矩阵(Table 1 · 8B · 1T tokens · FLOP 匹配) 任务Llama 3 (BPE)BLT-Space (6T B)BLT-Entropy (4.5T B) Arc-E (0-shot)77.675.479.6 Arc-C (0-shot)53.349.852.1 HellaSwag (0-shot)79.179.680.6 PIQA (0-shot)80.781.180.6 MMLU (5-shot)58.154.857.4 MBPP (3-shot)40.237.641.8 HumanEval (0-shot)31.127.435.4 平均60.058.061.1 平均 patch/字节4.4 B/token6.1 B4.5 B BLT-Entropy 在 7 项中 4 项胜出(Arc-E、HellaSwag、MBPP、HumanEval),平均 +1.1 分;代码任务(HumanEval +4.3、MBPP +1.6)优势明显。BLT-Space 平均略低但 patch 更大(6.1 字节)——揭示「patch 大小 ↔ 质量」权衡轴。 3.2 推理效率(含争议) 论文声称:固定推理成本下,patch size=8 时推理 FLOPs 较 BPE 基线节省接近 50%; 机制:BPE 平均 token ≈ 4.4 字节,BLT 用 8 字节 patch → 推理步数约减半; ⚠ 争议Pith Review 指出算式未计入熵模型推理成本(每生成一字节都要跑一次 100M 熵模型)——8B 规模优势缩至持平,~550M 规模或反超为负。见 §5.1。 3.3 鲁棒性:BLT 的主场 模型HellaSwag 原版噪声平均CUTE 字符级音系 G2P Llama 3 (1T tok)79.156.927.511.8 Llama 3.1 (16T tok)80.764.320.018.9 BLT (1T tok)80.664.354.113.0 Noisy HellaSwag:BLT 噪声下较同数据 Llama 3 高 8 点,与多训 16 倍数据的 Llama 3.1 持平——鲁棒性是字节级建模的「白赚」收益; CUTE 字符级:BLT 54.1 vs Llama 3 27.5(+26.6),拼写类近完美(Spelling 99.9); 音系 G2P:同数据胜出(13.0 vs 11.8),不及 16T 数据的 Llama 3.1(18.9)。 3.4 低资源语言翻译(FLORES-101) 方向(21 低资源)Llama 3BLT差值 → English12.114.0+2.0 English →5.96.4+0.5 典型增益:亚美尼亚语 →EN 1.7→6.3;孟加拉语 →EN 4.7→12.7;格鲁吉亚语 →EN 1.7→7.4。常用语言持平或略优。字节建模对长尾/低资源语言泛化显著提升——恰是 tokenizer 税最重的领域。 §4关键数据速查 维度数值备注 最大规模实验8B 参数 / 4T~8T 训练字节首次字节级 FLOP 受控缩放(官方口径 4T/8T 不一) 开源权重blt-1b / blt-7b(无 8B)2025-04-18 发布,门控 + FAIR 非商用许可 平均 patch 长度4.5~6.1 字节熵模式 4.5,Space 模式 6.1 BPE 平均 token3.7 (Llama 2) / 4.4 (Llama 3) 字节对比基准 推理 FLOP 节省最高 ~50% 存疑patch=8,未计熵模型 噪声 HellaSwag64.3vs Llama 3 56.9(+8 点) CUTE 字符级54.1vs Llama 3 27.5(+26.6 点) 熵模型参数~100M · 14 层 · hidden 512512 字节滑窗 开源代码facebookresearch/blt(2.1k★)Meta 官方 · CC-BY-NC-4.0 HF 生态Transformers 原生支持(2025-09)BltModel / BltForCausalLM 第三方复现未见独立大规模复现未能核实 §5争议与批评:魔鬼代言人的三问 5.1 第一问:50% 推理节省是真的吗?(重炮) Pith Review(2026-08-11 · 3 major / 4 minor)核心攻击:论文 §4.5 的 FLOP 公式只算了局部编码器、全局 Transformer、局部解码器与交叉注意力,唯独漏了熵模型——而推理时每生成一个字节都必须运行这个 100M 熵模型来决定边界,无法摊销。 100M 熵模型缓存前向 ≈ 0.2 GFLOP/byte;8B/patch=8 时约占主模型 1/10(尚可),~550M 规模则可与整个字节级模型相当甚至更大; 摘要「up to 50% fewer flops」与 Figure 1 固定推理缩放曲线基于不完整核算;Table 2 标「equal inference flops」的模型实际不相等; 主编裁定:有条件接受——缩放结果新颖可信、实验扎实,但效率头条必须重做核算才可引用。 本文立场:50% 宜表述为「论文声称、上界且未全核算、存疑待考」,不得作为事实引用。 5.2 第二问:wall-clock 真的快吗? FLOPs 是理论量,实际墙钟时间未必同比例缩短——字节级生成逐字节解码,内存带宽瓶颈更突出; Hacker News / Reddit 讨论普遍关注:*「FLOP 省了,但显存带宽和逐字节生成的延迟呢?」*; 2026-05 的 Fast BLT 论文正是为此而生(见 §7)。 5.3 第三问:工程可行性与推广性? 批评点说明 动态 patch 难批处理变长 patch 破坏固定形状 batch,服务端复杂化 仅验证到 8B更大规模(70B+)是否仍占优未证 无指令微调/RLHF 版本生产可用性未验证 熵模型非端到端切块与生成解耦;H-Net 团队批评「并非真正端到端」 长上下文适配难题字节级序列长度膨胀,注意力成本高 数据混合未公开BLT-1T 精确配比未发布,复现困难 单跑无方差估计核心对比疑似单次运行 反方声量观察:未检索到否定 BLT 方向本身的系统性反方文章;舆论整体偏建设性(「方向对,工程待补」)——这本身即一个发现。同行新锐亦有狙击:H-Net(CMU)批「非端到端」;Bolmo(AI2/UW)声称其 byteification 超越此前所有字节级 LM。 §6无词表路线谱系:从 ByT 到 BLT 年份工作机构核心思想 2021ByT5Google纯字节 Transformer,逐字节自回归,太慢 2023MegaByteMeta局部+全局双级,固定 patch 2023MambaByteRush 团队SSM 路线处理字节,无注意力 2024BLT ★Meta FAIR动态熵 patch + 三层架构,8B 首次追平 tokenizer 2025BolmoAI2 / UWbyteification:现成词表模型转字节级 2026ByteFlowICLR 2026压缩驱动分割(coding rate),自适应字节分组 2026Fast BLTMeta / Stanford扩散/自推测解码,解决生成慢 BLT 三点独创(vs 前代):① 动态 patch(MegaByte 为固定);② 熵驱动边界(小模型预测难度而非规则);③ 规模化验证(首次 8B/4T 级别,前代止步小模型)。 并行路线对比 路线代表核心思想与 BLT 关系 字节动态 patchBLT熵驱动变长 patch本文主角 SSM 字节级MambaByte状态空间处理长字节序列互补而非冲突 现成模型字节化Bolmo蒸馏转写,避免从头训练实用主义旁支 压缩驱动分割ByteFlow潜在表征编码率决定边界2026 新进竞争者 连续潜空间扩散Cola DLM(字节 Seed)连续空间扩散 LM异路;字节走此方向 tokenizer 会消失吗?正反方并存:正方——tokenizer 是「语言学殖民税」与工程包袱,多模态时代必死;反方——无免费午餐,字节级序列更长,省下的词表换来带宽/延迟代价,修补派(更大词表、动态 token)更现实。 §7产业前景与后继工作 7.1 后继研究(2025-2026) 工作机构核心贡献状态 Fast BLTMeta + Stanford + UWBLT-D(块扩散)/ BLT-S(自推测)/ BLT-DV;3B 模型带宽减少 >50%(BLT-D-16 达 87-92%)arXiv:2605.08044 · 2026-05 ByteFlow—压缩驱动分割(coding rate),Top-K 静态计算图ICLR 2026 BolmoAI2 / UW / Cambridgebyteification:冻结主干蒸馏 + 端到端微调arXiv:2512.15586 H-NetAlbert Gu (CMU)混合 tokenizer-free 架构学术 Fast BLT 的意义:直击 BLT 最大短板(逐字节生成慢)。BLT-D-4 以不到一半带宽近乎追平 BLT 质量——无词表路线的「最后一公里」正在被攻克。 7.2 产业采用:仅 Meta 一家开花 公开检索未见其他大厂将 BLT 投入生产模型(OpenAI/Google/Anthropic 均未采用); Meta 已接入 HuggingFace 生态(Transformers 原生支持 + 权重开放); 字节跳动(Seed)未采用 BLT——词表研究反而走反方向(Over-Tokenized Transformer,ICML 2025,词表扩至 12.8M)。 7.3 适用场景判断(工程决策) 场景推荐度理由 多语言/低资源翻译★★★★★低资源翻译 +2 BLEU,无 token 税 字符级任务(拼写/回文/OCR)★★★★★CUTE +26.6 点 噪声/对抗输入★★★★☆noisy HellaSwag +8 点 多模态统一底座★★★★☆字节为通用单元(有待验证) 生产级高速推理★★☆☆☆逐字节解码慢,工程不成熟 大厂主力模型★★☆☆☆生态/工具链远逊 tokenizer 范式 §8结论与启示 确认学术价值首次证明「无词表字节级 LLM 可在 8B 规模追平乃至超越 tokenizer 模型」——范式级事实,ACL 2025 Outstanding Paper 名副其实。 存疑效率主张「推理省 50%」未计入熵模型成本,8B 上接近持平、小模型或反超——引用时务必注明「论文声称,核算存疑」。 白赚鲁棒性字符级 +26.6 点、噪声 +8 点、低资源翻译 +2 BLEU,且不需额外数据——字节级建模的天然红利。 待补工程化动态 patch 批处理、逐字节解码带宽瓶颈、指令微调缺失——Fast BLT 已指明解药。 冷静产业格局2026 年中仍无第二家大厂投产,tokenizer 退场论为时过早;但作为「多模态统一 + 长尾泛化」储备路线,BLT 已站稳脚跟。 延伸对字节的误读「字节的 BLT」系命名巧合。字节 Seed 无词表探索在 Cola DLM,词表研究反而反向扩表(Over-Tokenized 12.8M)。 「Token 是字典,字节是空气——字典让人省力,空气让人自由。BLT 赌的是:省力的代价终将超过自由的风险。」 §9来源清单(17 项,全部可核实) #来源用途 1arXiv
暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens