VoiceStudio:把商用语音栈的整套工序搬到本地,并默认开给 agent
voicestudio
开源、完全本地的语音工作台(debpalash/VoiceStudio,AGPL-3.0,Python + Electron),自我定位为 ElevenLabs 的本地替代品:声音克隆、声音设计、视频配音、听写、转写与有声书制作,官方称覆盖 646 种语言。仓库 2026-04-09 建仓,到 2026-09-29 有 42,831 star / 5,005 fork。本站把它列为音频域本地自托管方向的梯顶,依据不是某个模型更强,而是抽象层有用:开源语音能力散落在十几个仓库里,各有自己的权重格式、设备要求、克隆接口与许可,拼一条「克隆音色→转写→对齐→配音→有声书」的产线,工程量主要花在粘合上;VoiceStudio 把 17 个 TTS 与 11 个 ASR 引擎收进统一注册表,逐引擎上报设备(CUDA/MPS/CPU)、是否可克隆、max_ref_seconds 与 ref_strategy,并给出可跑的工作流。对 agent 尤其关键:本地 API 与 MCP server 是产品自带的一等能力,README 直接给了可粘进 Claude Code / Codex / Cursor 的安装指令,还支持 npx skills add 装 skill,意味着编码 agent 可以把配音与转写当工具调用而不需要人点界面。参考音频口径也严谨:上限 75 秒,但真正进模型多少由引擎决定并逐引擎上报,超限时自动与已保存的转写会被忽略,给默认 OmniVoice 传超过 20 秒并附文本会以 [clone_ref_too_long] 直接报错。指标口径要说清:官方 docs/benchmarks.md 有一套真实 harness(逐阶段 profiling、内存不足拒绝启动、只收具名硬件与版本上的 RTF 热态与峰值显存、明确没有数字是估的),但结果一栏写着 No verified rows yet,所以本站不给它任何性能数字,卡片上只用本站自核的 GitHub star 数并据此记 A 档(可核验);这个 A 只针对数字为真,不针对它比 ElevenLabs 好。四条边界:AGPL-3.0 是强 copyleft 且带网络条款,嵌进对外 SaaS 需开放自己的服务端源码,闭源商用要么进程隔离只调本地 API(自行法律评估)要么改用 Apache-2.0 的 CosyVoice 3 / Kokoro 自行组装;模型各自有许可(Breeze-TTS-2 权重研究非商用、Supertonic-3 与 PocketTTS 需额外许可、GPT-SoVITS 要跑自己的 server),商用前逐模型核对;646 种语言是仓库自述,真实覆盖取决于所选引擎(Parakeet 25 种欧洲语言、FunASR 50+、Whisper 系更广),本站未逐语言核验;桌面端只剩 Electron,0.5.3 是最后一个 Tauri 版本,老用户必须迁移。它与 Eleven v4 在梯度上并存而不互相替代:一个代表闭源商用栈的质量上限与省心,一个代表本地自托管的数据主权与引擎可替换性。
- 置信度
- 已确认
- ≥2 个独立来源,或本站 harness 复现通过
- 关键指标
- GitHub Stars(2026-09-29,本站经 GitHub API 核)
- 已确认 · 2026-09
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断我们给它 A 档(可核验),但要把 A 档落在哪里说精确。卡片上唯一的数字是 GitHub star 42,831(2026-09-29,本站经 GitHub API 直接拉取),这个读数我们自己核过,所以按契约 §13.5 记 confirmed。它不构成任何性能结论:官方
docs/benchmarks.md的结果一栏写着 No verified rows yet,只有 harness 说明与贡献指引。本站因此不给它任何 RTF、显存或质量数字,一条都不给。这是本条与同域其他条目最大的口径差别,也是它值得被收录的理由之一——一套真实存在但空着的基准表,比一份估出来的跑分诚实。反过来读也成立:谁要拿 VoiceStudio 的性能做选型依据,目前站内站外都没有可引用的数据。它进音频域本地自托管方向梯顶的理由不是模型更强,而是抽象层有用。开源语音生态的现状是能力散落在十几个仓库里,每个都有自己的权重格式、设备要求、克隆接口与许可;要拼出一条「克隆音色 → 转写 → 对齐 → 配音 → 有声书」的产线,工程量主要花在粘合上。VoiceStudio 把 17 个 TTS 与 11 个 ASR 引擎收进一个统一注册表,逐引擎上报设备(CUDA / MPS / CPU)、是否支持克隆、
max_ref_seconds与ref_strategy,并给出可跑的工作流。对 agent 尤其关键:本地 API 与 MCP server 是产品自带的一等能力,README 直接给了可粘进 Claude Code / Codex / Cursor 的安装指令,还支持npx skills add装 skill——这意味着本站 harness 域里那些编码 agent 可以把配音与转写当工具调用,而不需要人去点界面。参考音频那段口径同样是同类项目里少见的严谨:上限 75 秒,但真正进模型多少由引擎决定,界面写明且接口逐引擎上报;超限时自动与已保存的转写会被忽略,给默认 OmniVoice 传超过 20 秒并附转写文本会直接以[clone_ref_too_long]报错。把「引擎截取了多少」写成机器可读的字段,而不是让用户去试,这是产品化程度的分水岭。选型有四条硬边界。AGPL-3.0 是强 copyleft 且带网络条款:把它嵌进对外提供服务的 SaaS,就要按 AGPL 开放你自己的服务端源码。要在闭源商用产品里用,要么走进程隔离只调用其本地 API(需自行做法律评估),要么改用 Apache-2.0 的 CosyVoice 3 或 Kokoro 自行组装——这也是本站把「组装」与「成品」在梯度上分列的原因。模型各自的许可不等于 AGPL 就万事可用:audio.cpp 的 Breeze-TTS-2 权重是研究/非商用,Supertonic-3 与 PocketTTS 需要额外许可,GPT-SoVITS 要跑它自己的 server,商用前必须逐模型核对。646 种语言是仓库自述,真实覆盖取决于所选引擎(Parakeet 25 种欧洲语言、FunASR 50+、Whisper 系更广),本站未逐语言核验。桌面端只剩 Electron,0.5.3 是最后一个 Tauri 版本,旧壳与遗留 UI 入口已删除,老用户必须迁移。
最后一条关于怎么读这个 star 数。五个月 42.8k star、仓库 2026-04-09 才建仓、开放 issue 只有 41 条——star 量衡量的是关注度而不是质量,低 issue 数在高速增长的仓库里既可能意味着维护得力,也可能意味着用户还没沉淀到会提问题的阶段。本站记 confirmed 只针对「这个数字是真的」,不针对「它比 ElevenLabs 好」。它与 Eleven v4 在梯度上并存而不互相替代:一个代表闭源商用栈的质量上限与省心,一个代表本地自托管的数据主权与引擎可替换性,选型的分界是数据能不能出境、以及要不要把音色权重握在自己手里。
它解决的问题:把商用语音栈的那套工序整体搬到本地,并且让 agent 能直接用
VoiceStudio(debpalash/VoiceStudio,AGPL-3.0,Python + Electron)自我定位是「开源、完全本地」的 ElevenLabs 替代品:声音克隆、声音设计、视频配音、听写、转写与有声书制作,官方称覆盖 646 种语言。仓库 2026-04-09 建仓,到 2026-09-29 已有 42,831 star / 5,005 fork,近六个月仍在高频推送。本站把它列为音频域本地自托管方向的梯顶,依据不是某个模型更强,而是它把散落在十几个仓库里的开源语音能力收成了一个有工作流的产品,并且默认把接口开给 agent。
它与闭源服务的差别是三件事同时成立:本地跑(工作流跑在你自己的硬件上,远程 worker 是可选的,使用分析需要同意)、不订阅、引擎可换。ElevenLabs 那条栈的优势是省事与一致,VoiceStudio 的优势是数据不出机器、模型可替换、成本是一次性硬件。
引擎目录:17 个 TTS 与 11 个 ASR,按设备与克隆能力排开
这是这个产品最有情报价值的部分——它不是自己训了一个模型,而是把开源生态里能用的都接进来了,并给出每个引擎跑在什么设备上、能不能克隆、怎么启用:
| 类别 | 引擎 | 设备 | 克隆 |
|---|---|---|---|
| TTS(默认与主力) | VoiceStudio / OmniVoice(默认,k2-fsa) | CUDA · MPS · CPU | 可 |
| VoxCPM2 | CUDA · MPS · CPU | 可 + 声音设计 | |
| CosyVoice 3 | CUDA · CPU | 可 | |
| IndexTTS 2.5(一键 sidecar 安装) | CUDA · CPU | 可 + 情感 | |
| TTS(轻量 / 边缘) | KittenTTS(8 个预置音色) | 纯 CPU | 不可 |
| Sherpa-ONNX | CUDA · CPU | 不可 | |
| Supertonic-3(7 个预置音色) | 纯 CPU | 不可 | |
| MLX-Audio(Kokoro、CSM、Dia 等) | Apple Silicon | 视模型 | |
| TTS(需自行 clone 或额外许可) | GPT-SoVITS(走它自己的 API server) | 外部服务 | 可 |
| MOSS-TTS-v1.5(8B)、dots.tts(2B)、MOSS-TTS-Nano、Confucius4-TTS | CUDA · CPU | 可 | |
| PocketTTS(Kyutai)、audio.cpp(Breeze-TTS-2,权重研究/非商用) | CPU | 可 + 声音设计 | |
| ASR | WhisperX(默认,词级时间戳 + 说话人分离,为配音而生) | CUDA · CPU | — |
| Faster-Whisper(含 isolated 无人值守批处理档)、MLX Whisper、PyTorch Whisper(ROCm) | 按平台 | — | |
| Parakeet TDT(NeMo / MLX,25 种欧洲语言)、Moonshine(边缘低功耗,无时间戳)、FunASR SenseVoice(50+ 语言,内联分离)、Sherpa-ONNX(实时听写)、OpenAI 兼容端点 | 按引擎 | — |
说话人分离不是独立注册表:配音管线用 pyannote(HF 门控模型),FunASR 可以用它自己的 cam++ 内联分离。功能面还包括声音设计、视频配音(带时间轴)、悬浮听写组件、人声隔离、批处理队列、AI 水印、GPU 自动探测(CUDA/ROCm/MPS/CPU,可在设置里钉死或设 OMNIVOICE_DEVICE)。
参考音频的口径:上限 75 秒,但真正进模型多少由引擎决定
这一段是同类项目里少见的严谨:Voice Clone 接受最长 75 秒的参考,推荐 5~15 秒干净语音,而更长片段里究竟有多少进模型取决于引擎,界面会写明,并且 GET /engines 用 max_ref_seconds 与 ref_strategy 逐引擎上报。默认 OmniVoice 取最多 20 秒,策略是 best_window(挑语音占比最高的 15 秒并转写);VoxCPM2 取前 30 秒(head,先做边缘静音裁剪);其余引擎标为未验证、原样透传(null)。
由此推出一条容易踩的坑:整段参考的转写文本无法与引擎截取的片段对齐,所以超限时自动与已保存的转写会被忽略;给 OmniVoice 传超过 20 秒的片段并附转写文本,会直接以 [clone_ref_too_long] 报错,要求把音频与文本裁到同一段或干脆不带文本。引擎在自己的环境里单独跑时限制相同。
agent 原生:Local API、MCP,以及一段可以直接粘给编码 agent 的安装 prompt
它对 agent 的支持不是「有个 API」这么浅:本地 API 与 MCP server 是产品自带的一等能力,README 里直接给了一段可以粘进 Claude Code / Codex / Cursor 的安装指令,配套 docs/install/agent.md 覆盖硬件探测、复用已有数据、下载模型前先询问、以及跑一次测试生成;支持 skill 的 agent 还能 npx skills add debpalash/VoiceStudio,在 voicestudio(音频工作流)与 voicestudio-maintainer(仓库维护)两个 skill 之间选。这意味着本站 harness 域里那套编码 agent 可以直接把配音、转写、有声书当成工具调用,而不需要人去点界面。
边界:AGPL、空着的基准表、模型各自的许可、以及 Tauri 到 Electron 的迁移
- AGPL-3.0 是强 copyleft 且带网络条款:把它嵌进对外提供服务的 SaaS,需要按 AGPL 开放你自己的服务端源码。要在闭源商用产品里用,要么走进程隔离并只调用其本地 API(需自行做法律评估),要么选 Apache-2.0 的 CosyVoice 3 / Kokoro 自行组装。
- 官方基准表目前是空的。
docs/benchmarks.md有一套真实 harness(scripts/bench_pipeline.py,逐阶段 profiling、内存不足就拒绝启动、阶段间卸载模型),口径写明只收 harness 在具名硬件、具名版本上跑出的 RTF(热态)与峰值显存,并明确「没有任何数字是估的」。但结果一栏写着 No verified rows yet,只有贡献指引。所以本站不给它任何性能数字,卡片上的指标用可核验的 GitHub star 数;这条既是它的诚实之处(不拿估算充数),也是它当前的证据缺口。 - 模型各自有许可,不等于 AGPL 就万事可用:audio.cpp 的 Breeze-TTS-2 权重是研究/非商用,Supertonic-3 与 PocketTTS 需要额外许可,GPT-SoVITS 要跑自己的 server;商用前必须逐模型核对。声音克隆只在获得授权的前提下使用。
- 646 种语言是仓库自述,真实覆盖取决于所选引擎(默认 OmniVoice 与各 ASR 的语言面差别很大:Parakeet 25 种欧洲语言、FunASR 50+、Whisper 系更广),本站未逐语言核验。
- 桌面端只剩 Electron:0.5.3 是最后一个 Tauri 版本,旧 Tauri 壳与遗留 UI 入口已删除,老用户必须另装 Electron(有迁移文档)。安装脚本要求 curl 与 SHA-256 工具;从 main 构建则要 Git、Node 22+、Bun、Rust/Cargo 与平台构建工具。
- 仓库很年轻、增长极快:五个月 42.8k star,而开放 issue 只有 41 条、仓库 2026-04-09 才建仓。star 量衡量的是关注度而不是质量,选型时要按「引擎目录 + 本地 API/MCP 这层抽象是否有用」来判断,而不是按热度。