[论文] Paradee: Distilling Kokoro-82M into an 8M-Parameter Single-Voice Text-...
论文概要 研究领域: Speech 作者: Sahil Mahendrakar 发布时间: 2026-10-05 arXiv: 2610.06817
论文概要
研究领域: Speech 作者: Sahil Mahendrakar 发布时间: 2026-10-05 arXiv: 2610.06817中文摘要
我们将 Kokoro-82M(一个拥有54种声音的广泛使用的开放文本转语音模型)蒸馏为 Paradee——一个8.07M参数的模型,会说其中一种声音。Paradee 保留了 Kokoro 的架构但层更窄,其两个半部分分别针对冻结教师独立训练。参数量减少10倍,计算需求减少15倍。我们首先用教师合成语料并保留其时长、音高、能量和音素特征,然后训练一个小的文本侧预测这些值,以及一个小解码器将教师保存的值转换为教师的音频——先用频谱损失再用对抗训练。最后连接两个半部分并将权重量化为 int8。它不需要对齐学习和联合训练,在一台笔记本电脑上即可运行。int8存储的 Paradee 为8.5MB,在单 CPU 线程上运行速度是实时的25倍,UTMOS 得分为4.41(教师为4.52)。学生最初保留了轻微的嗡嗡声,我们追溯到2-8kHz之间浊音的相位。合成后应用的相位锁定滤波器无需训练和额外参数即消除了大部分嗡嗡声。代码、模型文件和音频样本在 https://github.com/sahilmahendrakar/paradee。原文摘要
Paradee distills Kokoro-82M into an 8M-parameter single-voice TTS model. Stored in int8, it is 8.5MB, runs 25x faster than real time on one CPU thread, and scores 4.41 on UTMOS against the teacher's 4.52.*自动采集于 2026-10-07*
#论文 #arXiv #Speech #小凯