Eleven v4:把克隆保真度推到会反噬训练数据的一代
elevenlabs-v4
ElevenLabs 新一代语音合成模型,分 Eleven v4(最高质量档)与 Eleven v4 Turbo(实时档,中位推理延迟约 100ms,官方脚注明确不含应用与网络延迟)两个型号,官方口径是在输出质量、音色准确度、一致性、情感、演绎、audio tags 与语言覆盖上全面优于 v3 并建议迁移。本站把它列为音频域闭源语音方向的梯顶,依据是这一代把优化目标从「更好听」换成了「更像」:参考音色的音色、节奏、演绎与其他习惯一并复刻,官方自己承认准确度与个人偏好不总是同一件事、你可能仍更喜欢它在 v3 里的声音。配套的工程含义很硬——数据清洗的责任被推回使用方,官方把展示样例明确标注为未做任何后期(无 EQ、压缩、归一化、去齿音、去喷麦),并直说听到削波与喷麦大概率是训练数据里的、模型只是准确捕捉了下来。可交付面是三个数:Turbo 约 100ms、单次 10,000 字符约 10 分钟音频(v3 为 5,000,长文本分段接缝多一倍)、官方称 90+ 语言而 FAQ 逐条列出 87 种,这个差我们照原样并列不替它抹平。四条边界必须认清:跨语言口音是默认行为变更而非开关(生成语言与参考语言不一致时出目标语言的地道发音,做成 toggle 官方称仍是研究项目、无时间表),依赖「带母语口音说外语」的人设要先实测;控制面收窄,只剩 Stability 与 Similarity,Style 与 Speed 滑块取消、SSML 不支持,细粒度演绎改用 audio tags 且官方坦承还不完美;模型持续演化是官方明写的,发布后仍会继续训练、行为可能随时间变化,把音色当品牌资产的团队要周期性重测;Voice Design 生成的音色在 v4 上可能不那么有表现力。闭源不可自托管,数据必须过 ElevenLabs,克隆合规责任在使用方;可自托管对照是 CosyVoice 3、VibeVoice、Kokoro(语音)与 YuE2(音乐,非商业许可)。与本站已收的 Eleven v3 是同一商用栈上的两代,不是替代关系。置信度 C(厂商宣称):无第三方可核验基准,本站未做盲听。
- 置信度
- 厂商宣称
- 只有官方模型卡/发布会,无独立复测
- 关键指标
- v4 Turbo 中位推理延迟(模型侧,不含应用与网络)
- 厂商宣称 · 2026-09
- 成熟度
- 生产
- 研究 → 演示 → 产品 → 生产
我们的判断我们给它 C 档(厂商宣称)。ElevenLabs 没有公布任何可核验的第三方基准:MOS、说话人相似度、WER 一个数都拿不到,能引用的只有它自己的代际比较陈述与一段展示音频,本站也没有做过盲听。按契约 §13.5 这一条不能升 A。它在这一档里的可信度来自另一件事——官方把展示样例明确标注为「未做任何后期」(无 EQ、压缩、归一化、去齿音、去喷麦),并直接写明「如果你听到削波、喷麦、EQ 不均或音量跳变,那大概率在训练数据里,v4 只是把它准确地捕捉了下来」。厂商主动把产出瑕疵摊开给用户听,这在音频模型发布里是少见的,也是本站按「闭源语音梯顶」收录它、而不是只转述宣传口径的理由。
它进梯顶的依据是克隆保真度这条轴上的代际跃迁,加上同质量档里少见的实时延迟。v4 相对 v3 的核心变化不是「更好听」而是「更像」:参考音色的音色、节奏、演绎与其他习惯一并复刻,官方自己承认「准确度与个人偏好不总是同一件事,你可能仍然更喜欢它在 v3 里的声音」——这句话等于承认了这一代的优化目标是保真而非讨好耳朵。配套的工程含义很硬:数据清洗的责任被推回使用方,参考音频质量现在直接决定产出质量,不再被模型的美化掩盖,官方也因此在训练数据建议上改口(建议单一说话风格,并承认指导可能随测试变化)。真正可交付的那一面是三个数:Turbo 档中位推理延迟 ~100ms(官方脚注明确「不含应用与网络延迟」)、单次 10,000 字符约 10 分钟音频、官方称 90+ 语言而 FAQ 逐条列出 87 种。对照上一代:v3 单次 5,000 字符,长文本的分段接缝多一倍;Flash v2.5 延迟更低(~75ms)但只有 32 种语言且默认关闭文本归一化。「90+」与「87」这个差我们照原样并列,不替厂商抹平——语言覆盖的宣称口径与可枚举清单本来就是两个数。
迁移前必须认清四条边界。跨语言口音是默认行为变更,不是开关:生成语言与参考音色语言不一致时,v4 出的是目标语言的地道发音而不是带原口音的目标语言;官方说做成 toggle「仍是研究项目,没有时间表」。产品人设如果恰恰依赖「带母语口音说外语」(角色配音、访谈还原),这条升级会静默改变产出,必须实测或留在 v3。控制面收窄:只剩 Stability 与 Similarity 两个旋钮,Style 与 Speed 滑块不再提供,SSML 不受支持,细粒度演绎改用 audio tags 内联标记,而官方同时坦承 tags「还不完美,仍在持续投入」。对已有 SSML 或依赖 Style 滑块的产线,这是迁移成本而不是升级红利。模型持续演化是官方明写的:发布后仍会继续训练,行为可能随时间变化,建议周期性重测——把音色当品牌资产的产品要把这条写进运维日历,因为产出的可复现性不由你控制。另外 Voice Design 生成的音色在 v4 上可能不那么有表现力(官方原话),用 Voice Design 的项目要两代对比后再迁。
最后是那条绕不过去的:闭源、不可自托管,数据必须过 ElevenLabs,声音克隆的合规责任在使用方(能力不等于授权)。对数据不能出境、或要把音色权重握在自己手里的团队,本站音频域里可自托管的对照是 CosyVoice 3、VibeVoice 与 Kokoro(语音),音乐方向是 YuE2(注意权重 CC-BY-NC-4.0,非商业)。还要提醒一句选型口径:v4 与本站已收的 Eleven v3 是同一条商用栈上的两代,不是替代关系——官方既推荐迁移,也承认少数边缘场景 v3 更合适,所以梯度上两行并存是正确的读法。
它解决的问题:把「克隆得像不像」这条轴推到会反噬训练数据的程度
Eleven v4(eleven_v4)与 Eleven v4 Turbo(eleven_v4_turbo)是 ElevenLabs 新一代语音合成模型,官方口径是在输出质量、音色准确度、一致性、情感、演绎、audio tags 与语言覆盖上全面优于 v3,并明确建议迁移。它与本站已收的 Eleven v3 是同一条商用音频栈上的两代,不是替代关系:v3 单次 5,000 字符,v4 单次 10,000 字符(约 10 分钟音频),长文本少一半分段接缝。
这一代最值得读的变化是克隆精度的取向。官方把话说到很少见的直白程度:v4 会连参考录音里的 EQ、音量、喷麦、齿音与音量起伏一起复刻,展示页上的样例是完全未做后期的(没有 EQ、压缩、归一化、去齿音、去喷麦),官方提醒「如果你听到削波、喷麦、EQ 不均或音量跳变,那大概率在训练数据里,v4 只是把它准确地捕捉了下来」。工程含义很硬:v4 把数据清洗的责任推回给使用方,参考音频质量现在直接决定产出质量,而不再被模型的「美化」掩盖。配套的建议也随之改变:训练数据尽量保持单一说话风格(官方仍在测试多样化数据,承认指导可能变化)。
跨语言口音:一次刻意的设计变更,迁移前必须实测
v4 相对所有旧模型最大的一处行为变更:生成语言与参考音色语言一致时,口音照旧保留;不一致时,v4 出的是目标语言的地道发音,而不是带着原口音的目标语言。克隆一个韩语说话人再生成英文,得到的是流利英文而不是韩式英文。这让同一个音色可以直接服务多语言配音与多语言语音 agent,是这一代对 dubbing 场景最实的提升。
但这是默认行为而不是可选项:官方说正在研究做成开关,属于研究项目,没有时间表。所以如果产品恰恰依赖「带着母语口音说外语」这个人设(角色配音、访谈还原),迁移到 v4 前必须实测,必要时留在 v3。本站把这一条单独列出来,是因为它属于「升级会静默改变产出」的那类变更,而不是纯增益。
两档型号与控制面:少了一半旋钮
| 型号 | 定位 | 延迟(模型侧) | 单次字符 | 语言 |
|---|---|---|---|---|
| Eleven v4 | 最高质量:内容创作、有声书、角色配音 | 非实时档 | 10,000(约 10 分钟) | 官方称 90+,FAQ 逐条列出 87 种 |
| Eleven v4 Turbo | 实时:对话 agent、交互式语音体验 | 中位 ~100ms | — | 同上 |
| Eleven Flash v2.5(上一代实时档) | 极致低延迟与低价 | ~75ms | 40,000 | 32 |
| Eleven v3 Conversational | 上一代实时表现力档 | ~280ms | — | 70+ |
控制面这一代收窄了:只剩 Stability(演绎稳定性,低值更有变化)与 Similarity(贴合参考音色的程度,调高会以自然度为代价)两个旋钮,Style 与 Speed 滑块不再提供,SSML 不受支持。取而代之的是 audio tags([whispering]、[shouting]、[laughing] 这类方括号指令),官方称 v4 对 tags 的 nuance 处理超过以往任何模型,同时坦承「还不完美,仍在持续投入」。这是一次范式切换:从连续滑块到文本内标记。对已有 SSML 或依赖 Style 滑块的产线,这是迁移成本,不是升级红利。
~100ms 与 ~75ms 都带官方脚注:不含应用与网络延迟。真实语音 agent 的端到端延迟里,上游 LLM 出字那一段通常远大于 TTS,不能把这些数字当 SLA 读。另外 Flash v2.5 默认关闭文本归一化以保住低延迟(企业版可用 apply_text_normalization 打开),所以低延迟档的正确做法是让上游 LLM 先把数字与符号规范化。
边界:模型仍在变、Voice Design 反而变弱、闭源不可自托管
- 官方明确写「模型会持续演化」:发布后仍会继续训练,行为可能随时间变化,建议周期性重测自己的用例。对把音色当品牌资产的产品,这是一条需要写进运维日历的风险 —— 产出的可复现性不由你控制。
- Voice Design 生成的音色在 v4 上表现力可能不如旧模型(官方原话),即 v4 对「克隆真实音色」的优化并不等于对「凭空设计音色」的优化。用 Voice Design 的项目要两代对比后再迁。
- IVC 与 PVC 两条克隆路径:Instant Voice Clone 上传 1~2 分钟样本、几秒可用、无独立训练步骤;Professional Voice Clone 用更长录音训练专属模型,v4 完全支持,已有的 PVC 可在 Voice Lab 里点加号针对 v4 微调。
- 闭源、不可自托管,数据必须过 ElevenLabs;声音克隆的合规责任在使用方(能力不等于授权)。本站音频域里可自托管的对照是 CosyVoice 3、VibeVoice 与 Kokoro(语音)、YuE2(音乐,非商业许可)。