四个相对增益我逐个复算,全部对上。但 118.8% 的分母是 22.00 ± 4.83。
先把它做对的说清。情感向量能被劈成"把语音推离中性的共享分量"和"指向所求情感的残差分量",这个分解本身是干净发现;λc=λr=1 时恰好退化成 CoCoEmo——有退化点、有对照,不是硬凑。IEMOCAP 上两个骨干的四项指标全部优于 CoCoEmo:IndexTTS-2 上 E-SIM 65.32→67.67、TEP 36.22→41.11、ρ 22.00→48.13、H-Rate 64.34→77.29;CosyVoice2 上是 63.43→65.34、37.44→40.12、39.13→52.10、70.90→77.82。全胜,无例外。
四个百分比也对得上,我一个一个算过: 26.13/22.00=118.8% ✓、12.97/39.13=33.1% ✓、12.95/64.34=20.1% ✓、6.92/70.90=9.8% ✓。基线值 22.0/39.1/64.3/70.9 都实存于表 1。人类评估 19.17/54.72=35.0% ✓、8.80/50.80=17.3% ✓ 也对。这笔账是干净的。
但要看到分母。
- ρ 的基线是 22.00 ± 4.83(5 次重复),EmoRES 是 48.13 ± 2.44。118.8% 这个漂亮的相对数,架在一个又低又抖的基线上。要引用就引用 +26.13pp 这个绝对值。
- "高达 17.3%"藏了低的那一项。 Fidelity 在 IndexTTS-2 上只有 60.05→66.32,+6.27pp,相对 +10.4%;17.3% 是 CosyVoice2 那一个。自然度同理,另一个骨干只有 60.32%。
- "最多 63.8% 偏好"是平票调整后的分数(§4.3.2 式 17,平票记 0.5)。表 2(b) 原始三选一里,IndexTTS-2 只有 50.83% 的听者明确选 EmoRES、25.93% 说差不多;CosyVoice2 只有 41.78% 选 EmoRES、37.07% 说差不多。第二个骨干上,明确偏好的不到一半。
样本量上有一处硬缺口:IEMOCAP 用了多少条 utterance 全文未找到(表 1 只给百分比);主观评测的听者总数 K 也没给(§B.2 只用符号 K),只写了 IndexTTS-2 360 条、CosyVoice2 330 条、每条 ≥9 个标注。另外调参用的是 3 类 CREMA-D,测试是 4 类 IEMOCAP。
两条帖子漏报的加分项,比那个百分比硬得多:附录 D 把残差换成等范数高斯方向,ρ 从 45.87 掉到 0.58(IndexTTS-2)/4.12(CosyVoice2)——收益确实来自方向而不是幅度;附录 G 换三个不同的情感识别器,18 项比较全胜。
一句话:分解是真的,四项全胜是真的,四个百分比也算得对;但 118.8% 请连同 22.00±4.83 一起引用,63.8% 请注明是平票调整后的口径。