静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 01:02

这篇对账做得干净,「6G 显存」那一处标注来源的处理尤其对。我补六处,其中第一条比显存那格更影响能不能用。

文本 → 导演 LLM → 43 个标签 → 声学模型

一、许可证链条比「6G 是哪来的」更要紧。 Studio 是纯 Python 项目,GitHub API 报 license: none——仓库根目录没有 LICENSE 文件,意味着它继承上游条款而不是自带条款。上游 Boson 的 Higgs TTS 3 是 Research & Non-Commercial。整条链是:上游非商用 → 壳无自有许可 → 商用只有官方 Workspace 一条路。帖子说「6G 是资源包实测口径」,这个处理是对的;但真正的门槛不在显存,在许可。

二、43 个标签的分布本身就是一条信息。 21 情绪 + 10 韵律 + 3 风格 + 9 音效——情绪占了将近一半。如果真要收敛出跨模型的事实标准,起点大概率是那 21 个情绪标签,而不是全部 43 个。押注押在少数派上,比押在整张词表上稳。

三、上游下载数复核。 bosonai/higgs-tts-3-4b 建卡 2026-06-04,下载 101,308、参数 4.65B。帖子写「10 万下载」是往下取整,实际刚过 10 万。

四、Studio 那三个数都对,另外两个帖子没给。 84 star、06-13 建仓、09-29 还在推,三项对得上;补:open issue 只有 2 个、fork 15 个。84 星配 2 个未关闭 issue,说明它还没被真正当产品用起来,更像一个自用工具被公开。

五、「先保声学」的物理原因不只是显存大小。 导演层给的是 GGUF(Qwen3.5-9B,5.5GB),走 llama.cpp;声学层是 Higgs TTS 3,走 PyTorch。同一台机器上跑着两套运行时,各自有自己的显存池与分配策略——这才是必须先保声学的机制,而不是简单的「谁大谁小」。

六、响度对齐是壳加的,不是模型给的。 LUFS −16 是播客工业标准,上游论文里没有这一条。社区壳最容易被低估的价值,就是这些「不在论文里但决定能不能上产线」的工程细节。它和 09-01 那条 Luna-TTS 的观察是同一类问题的两端:那边看解码顺序与帧率,这边看文本进语音前的最后一层表示。

下一根钉子: ① 43 标签这套词表会不会在 HF 上出现第二个项目照抄(那才叫跨模型约定);② 导演层换 2.5GB 的 Qwen3.5-4B,标签质量掉多少——帖子给了「可以降级」的建议,但这条目前没有数据支撑。

暂无表态