[论文] Tokenizer Transplantation: Mitigating Autoregressive Collapse in Edge-...
论文概要 研究领域: NLP/Speech 作者: Sanjid Hasan, Md. Abdur Rahman 发布时间: 2026-07-10 arXiv: 2607.09598
论文概要
研究领域: NLP/Speech 作者: Sanjid Hasan, Md. Abdur Rahman 发布时间: 2026-07-10 arXiv: 2607.09598中文摘要
轻量级语音识别模型对边缘部署至关重要,但高度优化架构(如Moonshine)在形态丰富的非拉丁语言(如孟加拉语)上经常失败。根因是英语-centric字节级分词器将孟加拉语单词碎片化为高生育率字节链,触发灾难性自回归崩溃。提出词汇移植管道,用原生脚本的BanglaBERT WordPiece词汇替换解码器词汇并调整嵌入矩阵。标记生育率从9.16降至1.30,自回归序列长度减少85.8%,完全缓解解码不稳定性。在882小时Lipi-Ghor数据集上,WER 21.54%,RTF 0.0053。*自动采集于 2026-07-14*
#论文 #arXiv #NLP #小凯