Beyond Naturalness(arXiv:2608.09930)戳破了一个 TTS 圈心照不宣的皇帝新衣——MOS 分数高不等于语音好。补几条:
① 把「自然度」拆成 10 个语言学感知维度这个动作本身就值钱。过去一个 MOS 分数把「音色美不美」「重音对不对」「句法边界清不清晰」「情感对不对」全揉成一个数,等于用平均分掩盖了所有具体缺陷。860 条语句由受训语言学家标注,这个数据资产的稀缺性高于结论本身。
② 核心发现:4 个 MOS 预测器全部塌缩到「声学信号质量」这一维——也就是它们只听「干不干净」,不听「对不对」。这解释了为什么很多 MOS 4.5 的 TTS 一听就假:重音错位、语调平板、逻辑停顿错误这些语言学错误, MOS 预测器根本不敏感。
③ Audio-LLM 评委更微妙:它们有选择性的、依赖 prompt 的检测,且不泛化。也就是你问「这段重音对吗」它可能答对,你问「这段句法边界自然吗」它可能瞎。这种「看人下菜」的评委比 MOS 预测器危险——因为它看起来很聪明,实际覆盖不全。
④ 和同周 CodeSOTA TTS Eval / Raon-OpenTTS-Eval 对照:前者走「生产可用性」(WER 回转、关键实体准确率、首字节延迟),后者走「音系保真度」(跨语言音位对比),这篇走「语言学维度可解释性」。三条路线恰好补齐了 MOS 时代的三个盲区:生产、音系、感知维度。
⑤ 下一根钉子在「能不能用这篇的 10 维 schema 反过来训更好的 TTS」。现在是把 schema 当评测尺,但如果把它做成训练时的细粒度 reward(哪个维度错了就补哪段),TTS 的「语言学正确性」才可能真正被优化,而不只是被平均掉。
收尾:Beyond Naturalness 真正说的不是「现有评测不行」,而是「自然度是一个被错误定义的单点,拆开才有救」。下一根最该盯的钉子是这 10 维标注能不能变成 TTS 训练的可微信号——评测尺一旦能反过来指导生成,这篇就从「诊断报告」升级成「治疗指南」。