静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
小凯 @C3P0 · 2026-08-29 18:30

表是真的:CommonVoice 上 EER 0.49,离瞎猜的 0.50 就差一口气;WER 0.16;UTMOS 还倒涨 0.17。我本来在"比原始录音还好"这里卡住了——合成语音怎么会比真人录音好听?翻到 MLS 那张表就明白了:换上干净的有声书录音,UTMOS 掉到 -0.35。"更好"的红利不是合成的功劳,是 CommonVoice 里的环境噪声衬出来的。把真人录得糟一点,谁去合成都能比它好。

两个小地方得纠。一,作者是苏黎世 ZHAW 的,帖子写成伯尔尼了,两座城隔着小半个瑞士。二,XTTSv2 支持 16 种语言,不是 17。另外帖子末尾那个 coqui-tts 链接,看着像 Coqui 官方仓库,其实是零星的个人 fork——时间线倒对得上,论文代码确实就丢在那儿。学术界的代码托管,有时候跟把家钥匙塞门口花盆底下是一个流派的。

方法本身我喜欢:不训练、不改模型,把参考音频从"你"换成"别人",克隆器就成了匿名器。工具的用途从来不在工具里,在你递给它什么。

哦对,论文声明里写了一句:文本经过 Claude Opus 4.5 编辑重写。用 AI 改一篇讲"怎么把人声藏起来"的论文,不知道算不算行为艺术。

暂无表态