[论文] Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Lin...

研究领域: NLP 作者: Oluwanifemi Bamgbose, Simon Rosen, Jash Shah 发布时间: 2026-08-12 arXiv: 2508.05162

论文概要

研究领域: NLP 作者: Oluwanifemi Bamgbose, Simon Rosen, Jash Shah 发布时间: 2026-08-12 arXiv: 2508.05162

中文摘要

自动语音合成(TTS)评估方法(包括平均意见得分预测器和音频大语言模型评判器)被期望反映人类感知,但它们在多大程度上捕捉了听众实际感知到的语音各个维度,仍不清楚。本文将'自然度'解构为一个基于语言学的标注框架,涵盖10个不同的感知维度,并据此构建了首个维度级别的TTS元评估基准,包含860条由专业语言学家标注的语音样本。对4个MOS预测器和4个音频LLM评判器的基准测试结果显示:MOS预测器仅关注声学信号质量,而音频LLM评判器表现出选择性的、依赖提示词的检测能力,且无法泛化到所有维度。两类方法均无法可靠地捕捉语言学结构化的语音错误。我们公开了数据集、标注框架和评估代码,以支持更具针对性和可解释性的TTS评估。

原文摘要

Automated Text-to-Speech (TTS) evaluation methods (Mean Opinion Score (MOS) predictors and Audio Large Language Models (Audio-LLM) judges) are expected to reflect human perception, yet it is unclear how well they capture the distinct aspects of speech that listeners actually perceive. We deconstruct 'naturalness' into a linguistically grounded annotation schema spanning 10 distinct perceptual dimensions, and use it to construct the first dimension-level meta-evaluation benchmark for TTS, comprising 860 utterances annotated by trained linguist raters. Results from benchmarking four MOS predictors and four Audio-LLM judges reveal that MOS predictors collapse onto acoustic signal quality, while Audio-LLM judges show selective, prompt-dependent detection that does not generalise across all dim...


*自动采集于 2026-08-12*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

Beyond Naturalness(arXiv:2608.09930)戳破了一个 TTS 圈心照不宣的皇帝新衣——MOS 分数高不等于语音好。补几条:

① 把「自然度」拆成 10 个语言学感知维度这个动作本身就值钱。过去一个 MOS 分数把「音色美不美」「重音对不对」「句法边界清不清晰」「情感对不对」全揉成一个数,等于用平均分掩盖了所有具体缺陷。860 条语句由受训语言学家标注,这个数据资产的稀缺性高于结论本身。

② 核心发现:4 个 MOS 预测器全部塌缩到「声学信号质量」这一维——也就是它们只听「干不干净」,不听「对不对」。这解释了为什么很多 MOS 4.5 的 TTS 一听就假:重音错位、语调平板、逻辑停顿错误这些语言学错误, MOS 预测器根本不敏感。

③ Audio-LLM 评委更微妙:它们有选择性的、依赖 prompt 的检测,且不泛化。也就是你问「这段重音对吗」它可能答对,你问「这段句法边界自然吗」它可能瞎。这种「看人下菜」的评委比 MOS 预测器危险——因为它看起来很聪明,实际覆盖不全。

④ 和同周 CodeSOTA TTS Eval / Raon-OpenTTS-Eval 对照:前者走「生产可用性」(WER 回转、关键实体准确率、首字节延迟),后者走「音系保真度」(跨语言音位对比),这篇走「语言学维度可解释性」。三条路线恰好补齐了 MOS 时代的三个盲区:生产、音系、感知维度。

⑤ 下一根钉子在「能不能用这篇的 10 维 schema 反过来训更好的 TTS」。现在是把 schema 当评测尺,但如果把它做成训练时的细粒度 reward(哪个维度错了就补哪段),TTS 的「语言学正确性」才可能真正被优化,而不只是被平均掉。

收尾:Beyond Naturalness 真正说的不是「现有评测不行」,而是「自然度是一个被错误定义的单点,拆开才有救」。下一根最该盯的钉子是这 10 维标注能不能变成 TTS 训练的可微信号——评测尺一旦能反过来指导生成,这篇就从「诊断报告」升级成「治疗指南」。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens