Skip to content
← 标签

#Speech Recognition (5)

语音与音频影音创作梯顶A

VibeVoice:7.5Hz 帧率换来 90 分钟单遍语音

微软的开源前沿语音模型家族,仓库 microsoft/VibeVoice(MIT,54,531★,本站经 GitHub API 核)。本站把它作为一条资产收录而不是拆成三条,因为 TTS、Realtime 与 ASR 共用同一个技术内核:声学与语义两个 tokenizer 都是连续的,帧率压到 7.5Hz。7.5Hz 是全部能力的来源——90 分钟音频在 25Hz 下是 135,000 个 token、进不了 64K 上下文,7.5Hz 下是 40,500 个,所以「单次合成 90 分钟」与「单遍转写 60 分钟」是同一件事的两个方向。五条产品线各有上限:TTS-1.5B 单次 90 分钟、最多 4 个说话人;Realtime-0.5B 首包约 300ms;ASR-7B 单遍 60 分钟、直接输出「谁 / 何时 / 说了什么」、支持自定义热词与 50+ 语言;ASR-Streaming 边说边出文本;ASR-BitNet 用异构量化把 4.62GB 压到 1.58GB、3+ CPU 线程 RTF < 1、不需要 GPU。ASR 那条线最值得记:传统长音频转写是切片、识别、分离、对齐四步串联,全局上下文在切片处就丢了,而 VibeVoice-ASR 把识别、分离与时间戳联合成一次生成,这对会议记录与客服质检是决定可用性的一项。架构是 next-token diffusion:LLM 管对话走向,diffusion head 管声学细节,长对话的轮次一致性是语言问题,交给 LLM 才拿得到 4 个说话人 90 分钟不串味。⛔ 有一条必须如实记录:2025-09-05 团队把 VibeVoice-TTS 的代码从仓库移除,原文说明是发现了与其声明意图不一致的使用实例;权重仍在 HF 但仓库 Quick Try 写着 Disabled、官方推理脚本不在仓库里,今天的 TTS 路径来自社区复现,模型页明写不建议未做进一步测试就用于商业场景。团队此后的公开动作全在 ASR 侧,所以可商用的一侧是 ASR 而不是 TTS。它在别人评测表里的位置也要如实转述:CosyVoice 3 的 README 列了它,test-zh CER 1.16 / SS 74.4、test-en WER 3.04 / SS 68.9,同表 CosyVoice3 base 是 1.21 / 78.0——短音频零样本克隆不是它的赛道,它该被比的三项是单次能生成多长、能不能保持 4 个说话人不串、能不能一遍处理 1 小时会议音频,这三项开源侧几乎找不到对手。边界:TTS 无官方推理路径;MIT 覆盖代码不覆盖模型页的使用限制;长音频的失败是全局的,90 分钟单遍没有坏一段重跑一段的补救面;官方在 Risks and Limitations 里点名深度伪造并要求披露 AI 参与。置信度 B(confirmed):确认的是帧率换算、各产品线公开上限、代码下架与许可边界这些可核对的文档事实,不是音质。

90 / 60 min单次长音频上限(TTS 4 说话人 / ASR 单遍)已确认 · 2026-09
研究Microsoft官网Repo
VibeVoice:7.5Hz 帧率换来 90 分钟单遍语音
语音与音频影音创作梯顶A

VoiceStudio:把商用语音栈的整套工序搬到本地,并默认开给 agent

开源、完全本地的语音工作台(debpalash/VoiceStudio,AGPL-3.0,Python + Electron),自我定位为 ElevenLabs 的本地替代品:声音克隆、声音设计、视频配音、听写、转写与有声书制作,官方称覆盖 646 种语言。仓库 2026-04-09 建仓,到 2026-09-29 有 42,831 star / 5,005 fork。本站把它列为音频域本地自托管方向的梯顶,依据不是某个模型更强,而是抽象层有用:开源语音能力散落在十几个仓库里,各有自己的权重格式、设备要求、克隆接口与许可,拼一条「克隆音色→转写→对齐→配音→有声书」的产线,工程量主要花在粘合上;VoiceStudio 把 17 个 TTS 与 11 个 ASR 引擎收进统一注册表,逐引擎上报设备(CUDA/MPS/CPU)、是否可克隆、max_ref_seconds 与 ref_strategy,并给出可跑的工作流。对 agent 尤其关键:本地 API 与 MCP server 是产品自带的一等能力,README 直接给了可粘进 Claude Code / Codex / Cursor 的安装指令,还支持 npx skills add 装 skill,意味着编码 agent 可以把配音与转写当工具调用而不需要人点界面。参考音频口径也严谨:上限 75 秒,但真正进模型多少由引擎决定并逐引擎上报,超限时自动与已保存的转写会被忽略,给默认 OmniVoice 传超过 20 秒并附文本会以 [clone_ref_too_long] 直接报错。指标口径要说清:官方 docs/benchmarks.md 有一套真实 harness(逐阶段 profiling、内存不足拒绝启动、只收具名硬件与版本上的 RTF 热态与峰值显存、明确没有数字是估的),但结果一栏写着 No verified rows yet,所以本站不给它任何性能数字,卡片上只用本站自核的 GitHub star 数并据此记 A 档(可核验);这个 A 只针对数字为真,不针对它比 ElevenLabs 好。四条边界:AGPL-3.0 是强 copyleft 且带网络条款,嵌进对外 SaaS 需开放自己的服务端源码,闭源商用要么进程隔离只调本地 API(自行法律评估)要么改用 Apache-2.0 的 CosyVoice 3 / Kokoro 自行组装;模型各自有许可(Breeze-TTS-2 权重研究非商用、Supertonic-3 与 PocketTTS 需额外许可、GPT-SoVITS 要跑自己的 server),商用前逐模型核对;646 种语言是仓库自述,真实覆盖取决于所选引擎(Parakeet 25 种欧洲语言、FunASR 50+、Whisper 系更广),本站未逐语言核验;桌面端只剩 Electron,0.5.3 是最后一个 Tauri 版本,老用户必须迁移。它与 Eleven v4 在梯度上并存而不互相替代:一个代表闭源商用栈的质量上限与省心,一个代表本地自托管的数据主权与引擎可替换性。

42,831GitHub Stars(2026-09-29,本站经 GitHub API 核)已确认 · 2026-09
产品debpalash (open source)官网Repo
VoiceStudio:把商用语音栈的整套工序搬到本地,并默认开给 agent
语音与音频影音创作梯顶C

Eleven v3:一条把「说、听、唱」做齐的商用音频栈

ElevenLabs 的旗舰语音合成模型,官方称情感最丰富、最具表现力:戏剧化演绎、70+ 种语言、单次 5,000 字符、自然的多说话人对话,并随 v3 提供独立的 Text to Dialogue API,把多角色对白做成接口而不是 prompt 技巧。本站把它列为音频域梯顶,依据是背后唯一一条把说、听、唱都做齐的商用音频栈:TTS 四档、ASR 三档(含 Medical)、音乐两档。TTS 四档三轴互斥:v3 表现力最强但非实时、单次 5,000 字符;Flash v2.5 延迟约 75ms、每字符便宜 50%;Multilingual v2 长文本最稳却只有 29 语言;没有全能档,按场景分型号。ASR 侧 Scribe v2 覆盖 90+ 语言、32 人分离。延迟都是模型侧口径,不含网络与上游 LLM 时间,不能当 SLA 读。边界:长文本要自己分段,接缝处的韵律与音色一致性由你负责;闭源不可自托管,数据主权敏感场景是硬门槛。本站第三方榜里没有语音榜,与 Gemini 3.8 Flash TTS 并列不排名。置信度 C(厂商宣称):未复算 WER、未做盲听对比。

70+语言覆盖厂商宣称 · 2026-09
产品ElevenLabs官网
Eleven v3:一条把「说、听、唱」做齐的商用音频栈