VoiceStudio:把 ElevenLabs 装进本地的开源语音工厂
仓库:debpalash/VoiceStudio
语言:Python + Rust + React
协议:AGPL-3.0
Trending:745 stars/day
一句话
16 个 TTS 引擎、11 个 ASR 引擎、646 种语言,全部跑在你自己的机器上——没有 API key,没有用量计费,没有数据出域。
场景开篇
你给一个短视频配音。打开 ElevenLabs,粘贴文案,选音色,点生成——30 秒后音频出来了,扣了 0.3 美元。你觉得还行。然后你想克隆自己的声音,试了试,发现要付 22 美元/月才能解锁 voice cloning。你又想给一段法语视频做中文配音,发现要再付一档。你又想批量处理 100 条短音频,发现按字符计费已经花了 60 美元。
这时候你开始想:语音合成这件事,到底值不值得每个月交订阅费?
VoiceStudio 给的答案是:不值得。它把整个语音工作流——克隆、配音、听写、转录——打包成一个桌面应用,装一次,用一辈子。
它到底做了什么
VoiceStudio(前身叫 OmniVoice-Studio)是一个本地优先的语音工作站。核心数字:
| 维度 | 数量 |
|---|---|
| TTS 引擎 | 16 个(F5-TTS、XTTSv2、Kokoro、Piper、ChatTTS、GPT-SoVITS 等) |
| ASR 引擎 | 11 个(WhisperX、Faster-Whisper、Paraformer 等) |
| 支持语言 | 646 种 |
| 平台 | macOS 13.3+ / Windows 10/11 / Linux x86_64 |
| 计算后端 | CUDA / Apple Silicon MPS+MLX / ROCm / CPU |
关键设计:所有 TTS 和 ASR 引擎通过一个"引擎注册表"(Engine Registry)统一管理。用户在 Model Catalogue 里切换引擎,或者用 Ctrl/Cmd+E 快捷键。不需要改代码,不需要重启应用。
引擎注册表:一个 UI 统治十六个后端
这是 VoiceStudio 最值得拆解的架构决策。
传统做法是:一个 TTS 引擎配一个 UI。你想用 XTTSv2,打开 XTTSv2 的界面;想用 Kokoro,关掉再开 Kokoro 的界面。每换一次引擎,就换一次工作流。
VoiceStudio 的做法是:把引擎当成可插拔的适配器。所有引擎实现同一个接口(生成、流式生成、克隆、停止),上层 UI 只管调用接口,不关心底下是哪个引擎。切换引擎就像切换输入法——Ctrl+E,选一个,继续干活。
这个模式的好处不只是"不用记 16 套快捷键"。更重要的是对比测试变得极其便宜:同一段文本,用 XTTSv2 生成一遍,用 Kokoro 生成一遍,用 F5-TTS 再生成一遍,三段音频放在一起听。哪个自然、哪个有口音、哪个语速不对,耳朵说了算。
这和 Linux 发行版的"包管理器"思路同构:apt/dnf/pacman 各有各的后端,但用户操作的是同一个 install 命令。引擎注册表把"语音合成"从"某个具体引擎的操作"抽象成了"一个统一动作"。
架构:Tauri 壳 + FastAPI 脑
VoiceStudio 的技术栈值得画一下:
Tauri v2 桌面壳(Rust)
│ IPC
React + Vite UI
│ HTTP · SSE · WebSocket on localhost:3900
FastAPI 后端
├── TTS / ASR 引擎注册表
├── 配音 / 音频 / 长格式管线
├── OpenAI 兼容 API + MCP Server
└── SQLite + Alembic → omnivoice_data/
三层分工:
- Tauri 壳(Rust):管窗口生命周期、托盘、快捷键、自动更新、sidecar 启动
- React UI:Zustand 状态管理、i18n、事件客户端
- FastAPI 后端:引擎适配器、配音管线、持久化
网络边界:桌面只和 localhost:3900 上的本地后端通信。默认配置下,音频数据不离开机器。如果你想让别的设备调用,可以开 remote worker,但那是显式选择,不是默认行为。
和 ElevenLabs 的真实差距
不吹不黑,VoiceStudio 不是在所有维度都赢。
| 维度 | VoiceStudio | ElevenLabs |
|---|---|---|
| 部署 | 本地安装,首次启动下载模型 | 注册即用,浏览器打开 |
| 成本 | 0(电费不算) | 起步 5 美元/月,voice cloning 要 22 美元/月 |
| 音质上限 | 取决于引擎和显卡(XTTSv2 在 4090 上接近 ElevenLabs V2) | 行业标杆,尤其英语 |
| 多语言 | 646 种,但小语种质量参差 | 32 种,每种都经过调优 |
| 数据隐私 | 100% 本地 | 音频上传到云端 |
| 可定制性 | 16 个引擎随意切换、微调、LoRA | 黑盒,只能调 stability/similarity 滑块 |
| 延迟 | 首次推理慢(模型加载),后续快 | API 往返 200-500ms |
VoiceStudio 真正赢的场景:
- 隐私敏感:医疗、法律、企业内部——音频不能出域
- 批量处理:1000 条短视频配音,ElevenLabs 按字符收费会破产
- 小语种:646 种语言覆盖远超 ElevenLabs 的 32 种
- 离线:飞机上、潜艇里、网络不稳定的乡下
ElevenLabs 仍然赢的场景:
- 零配置:不想装 Python 环境、不想下载 3GB 模型的人
- 顶级英语音质:商业产品的调优深度不是开源能比的
- API 集成:VoiceStudio 有 OpenAI 兼容 API,但 ElevenLabs 的生态更成熟
MCP Server:让 AI agent 调用语音能力
VoiceStudio 还暴露了一个 MCP Server。这意味着 Claude Code、Cursor、或其他支持 MCP 的 AI agent 可以直接调用 VoiceStudio 的语音能力——生成语音、克隆声音、转录音频——不需要写代码。
想象一下:你让 Claude Code 读一个 Markdown 文档,让它生成一段语音讲解,Claude Code 通过 MCP 调用 VoiceStudio,VoiceStudio 用你克隆的声音生成音频,保存到本地。全程零代码、零 API key、零云端调用。
这是"本地优先"理念从"单机应用"向"agent 基础设施"的延伸。VoiceStudio 不只是一个桌面应用,它还是一个可以被 AI agent 调用的本地语音服务。
为什么 745 stars/day
VoiceStudio 踩中了一个正在爆发的需求:AI 语音从"云端 API"向"本地工具"的迁移。
2024 年之前,开源 TTS 的音质和 ElevenLabs 差距太大,本地部署只有极客玩。2025 年 XTTSv2、F5-TTS、Kokoro 等模型成熟后,开源 TTS 在英语上已经接近商业产品,在小语种上甚至超越。但用这些模型仍然需要写代码——配 Python 环境、装 PyTorch、下模型权重、写推理脚本。
VoiceStudio 把这层复杂性封装掉了。普通用户装一个桌面应用,就能用上 16 个开源 TTS 引擎的最佳配置。这是"民主化语音合成"的工程实现。
745 stars/day 说明这个需求是真实的。
一句话总结
VoiceStudio 不是要杀死 ElevenLabs——它是让"语音合成"从"云服务"变回"工具"。就像 Photoshop 从云端回到本地不会杀死 Canva,但会让需要隐私、批量、离线的人有一个体面的选择。
引擎注册表是它最值得学的架构模式:把多个后端统一到一个接口下,让切换成本趋近于零。这个模式不只适用于 TTS,也适用于 LLM 推理后端、图像生成后端、任何"多引擎可切换"的场景。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。