Skip to content
← 标签

#Long-form Audio (1)

语音与音频影音创作梯顶A

VibeVoice:7.5Hz 帧率换来 90 分钟单遍语音

微软的开源前沿语音模型家族,仓库 microsoft/VibeVoice(MIT,54,531★,本站经 GitHub API 核)。本站把它作为一条资产收录而不是拆成三条,因为 TTS、Realtime 与 ASR 共用同一个技术内核:声学与语义两个 tokenizer 都是连续的,帧率压到 7.5Hz。7.5Hz 是全部能力的来源——90 分钟音频在 25Hz 下是 135,000 个 token、进不了 64K 上下文,7.5Hz 下是 40,500 个,所以「单次合成 90 分钟」与「单遍转写 60 分钟」是同一件事的两个方向。五条产品线各有上限:TTS-1.5B 单次 90 分钟、最多 4 个说话人;Realtime-0.5B 首包约 300ms;ASR-7B 单遍 60 分钟、直接输出「谁 / 何时 / 说了什么」、支持自定义热词与 50+ 语言;ASR-Streaming 边说边出文本;ASR-BitNet 用异构量化把 4.62GB 压到 1.58GB、3+ CPU 线程 RTF < 1、不需要 GPU。ASR 那条线最值得记:传统长音频转写是切片、识别、分离、对齐四步串联,全局上下文在切片处就丢了,而 VibeVoice-ASR 把识别、分离与时间戳联合成一次生成,这对会议记录与客服质检是决定可用性的一项。架构是 next-token diffusion:LLM 管对话走向,diffusion head 管声学细节,长对话的轮次一致性是语言问题,交给 LLM 才拿得到 4 个说话人 90 分钟不串味。⛔ 有一条必须如实记录:2025-09-05 团队把 VibeVoice-TTS 的代码从仓库移除,原文说明是发现了与其声明意图不一致的使用实例;权重仍在 HF 但仓库 Quick Try 写着 Disabled、官方推理脚本不在仓库里,今天的 TTS 路径来自社区复现,模型页明写不建议未做进一步测试就用于商业场景。团队此后的公开动作全在 ASR 侧,所以可商用的一侧是 ASR 而不是 TTS。它在别人评测表里的位置也要如实转述:CosyVoice 3 的 README 列了它,test-zh CER 1.16 / SS 74.4、test-en WER 3.04 / SS 68.9,同表 CosyVoice3 base 是 1.21 / 78.0——短音频零样本克隆不是它的赛道,它该被比的三项是单次能生成多长、能不能保持 4 个说话人不串、能不能一遍处理 1 小时会议音频,这三项开源侧几乎找不到对手。边界:TTS 无官方推理路径;MIT 覆盖代码不覆盖模型页的使用限制;长音频的失败是全局的,90 分钟单遍没有坏一段重跑一段的补救面;官方在 Risks and Limitations 里点名深度伪造并要求披露 AI 参与。置信度 B(confirmed):确认的是帧率换算、各产品线公开上限、代码下架与许可边界这些可核对的文档事实,不是音质。

90 / 60 min单次长音频上限(TTS 4 说话人 / ASR 单遍)已确认 · 2026-09
研究Microsoft官网Repo
VibeVoice:7.5Hz 帧率换来 90 分钟单遍语音