Skip to content
← 标签

#语音合成 (4)

语音与音频影音创作梯顶C

Eleven v4:把克隆保真度推到会反噬训练数据的一代

ElevenLabs 新一代语音合成模型,分 Eleven v4(最高质量档)与 Eleven v4 Turbo(实时档,中位推理延迟约 100ms,官方脚注明确不含应用与网络延迟)两个型号,官方口径是在输出质量、音色准确度、一致性、情感、演绎、audio tags 与语言覆盖上全面优于 v3 并建议迁移。本站把它列为音频域闭源语音方向的梯顶,依据是这一代把优化目标从「更好听」换成了「更像」:参考音色的音色、节奏、演绎与其他习惯一并复刻,官方自己承认准确度与个人偏好不总是同一件事、你可能仍更喜欢它在 v3 里的声音。配套的工程含义很硬——数据清洗的责任被推回使用方,官方把展示样例明确标注为未做任何后期(无 EQ、压缩、归一化、去齿音、去喷麦),并直说听到削波与喷麦大概率是训练数据里的、模型只是准确捕捉了下来。可交付面是三个数:Turbo 约 100ms、单次 10,000 字符约 10 分钟音频(v3 为 5,000,长文本分段接缝多一倍)、官方称 90+ 语言而 FAQ 逐条列出 87 种,这个差我们照原样并列不替它抹平。四条边界必须认清:跨语言口音是默认行为变更而非开关(生成语言与参考语言不一致时出目标语言的地道发音,做成 toggle 官方称仍是研究项目、无时间表),依赖「带母语口音说外语」的人设要先实测;控制面收窄,只剩 Stability 与 Similarity,Style 与 Speed 滑块取消、SSML 不支持,细粒度演绎改用 audio tags 且官方坦承还不完美;模型持续演化是官方明写的,发布后仍会继续训练、行为可能随时间变化,把音色当品牌资产的团队要周期性重测;Voice Design 生成的音色在 v4 上可能不那么有表现力。闭源不可自托管,数据必须过 ElevenLabs,克隆合规责任在使用方;可自托管对照是 CosyVoice 3、VibeVoice、Kokoro(语音)与 YuE2(音乐,非商业许可)。与本站已收的 Eleven v3 是同一商用栈上的两代,不是替代关系。置信度 C(厂商宣称):无第三方可核验基准,本站未做盲听。

~100msv4 Turbo 中位推理延迟(模型侧,不含应用与网络)厂商宣称 · 2026-09
生产ElevenLabs官网
Eleven v4:把克隆保真度推到会反噬训练数据的一代
语音与音频影音创作梯顶C

Eleven v3:一条把「说、听、唱」做齐的商用音频栈

ElevenLabs 的旗舰语音合成模型,官方称情感最丰富、最具表现力:戏剧化演绎、70+ 种语言、单次 5,000 字符、自然的多说话人对话,并随 v3 提供独立的 Text to Dialogue API,把多角色对白做成接口而不是 prompt 技巧。本站把它列为音频域梯顶,依据是背后唯一一条把说、听、唱都做齐的商用音频栈:TTS 四档、ASR 三档(含 Medical)、音乐两档。TTS 四档三轴互斥:v3 表现力最强但非实时、单次 5,000 字符;Flash v2.5 延迟约 75ms、每字符便宜 50%;Multilingual v2 长文本最稳却只有 29 语言;没有全能档,按场景分型号。ASR 侧 Scribe v2 覆盖 90+ 语言、32 人分离。延迟都是模型侧口径,不含网络与上游 LLM 时间,不能当 SLA 读。边界:长文本要自己分段,接缝处的韵律与音色一致性由你负责;闭源不可自托管,数据主权敏感场景是硬门槛。本站第三方榜里没有语音榜,与 Gemini 3.8 Flash TTS 并列不排名。置信度 C(厂商宣称):未复算 WER、未做盲听对比。

70+语言覆盖厂商宣称 · 2026-09
产品ElevenLabs官网
Eleven v3:一条把「说、听、唱」做齐的商用音频栈
语音与音频影音创作梯顶C

Gemini 3.8 Flash TTS:把导演级语音指导做成 API 参数

Google 的语音生成模型(gemini-3.8-flash-tts),官方定位 studio-grade voice fidelity、expressive acting 与 long-form stability,有声书翻车不是单句难听,是念到第三小时音色漂了。设计把作用域切开:文本字段严格当逐字稿,表演指令走另一条通道不会被念出来,修掉「(叹气)」被念出来的老问题;整轮风格走 speech_metadata.style,词级情感用竖线标签只影响那一个词。音色四类:预置、扩展库、语音设计 ID(自然语言造音色后复用)、克隆 ID,设计与克隆是 3.8 才补齐。规格:130 语言、自动检测输入语言,默认 WAV 24 kHz,单请求最多 2 个说话人且只能用预置音色。计费按音频 token、25 tokens 一秒,付费层每百万 tokens $0.50 输入 / $9.00 输出(至 2026-12-31,之后 $1.00/$18.00)。边界:24 kHz 非母带级;克隆合规责任在使用方。本站 12 个榜无语音榜,与 ElevenLabs v3 并列不排名。置信度 C(厂商宣称):未做可懂度测量与盲听对比。

全支持语音设计+克隆+多说话人厂商宣称 · 2026-09
产品Google官网
Gemini 3.8 Flash TTS:把导演级语音指导做成 API 参数