Skip to content
← 标签

#ElevenLabs (3)

语音与音频影音创作梯顶C

Eleven Music v2.5:把音乐生成拆成可编程产线的闭源梯顶

ElevenLabs 的音乐生成模型,当前版本 v2.5,2026-09-11 发布。本站把它列为音频域音乐方向的工程面梯顶,与已收的 Suno 形成对照而不是重复:Suno 的价值集中在产品内部的工序(Studio 多轨时间线、Custom Models、最多 12 轨 stem 与 MIDI 导出),Eleven Music 把同类能力拆成了端点——生成、流式生成、结构化编曲计划、给视频配乐、上传既有音频、分轨、微调、片段级 inpainting,外加一个让创作者互相授权的 Marketplace。所以判断该用哪一条不需要比音质,只要问一句:这段音乐是人坐着调出来的,还是被一条流水线批量要出来的。API 面是九个端点而不是一个生成接口,其中两处对企业采购关键:compose 与 stem-separation 都有 sign_with_c2pa 开关(仅对 mp3 生效),出站文件可以带内容凭证;输出格式与订阅档位绑定,stem-separation 与 video-to-music 上 mp3_44100_192 需 Creator 及以上、pcm_44100 需 Pro 及以上,compose 侧最高 mp3_48000_320,「拿到无损」的门槛按端点不同。⛔ 最容易踩的坑:产品界面里 v2.5 已是默认,但 API 的 model_id 枚举(music_v1/music_v2/music_v2_5)默认值仍是 music_v1,而 output_format=auto 按模型选最优(v1 系给 mp3_44100_128、v2 系给 mp3_48000_192),两件事叠起来就是一个不显式传 model_id 的最小调用会拿到最老那代模型加更低码率,且响应里看不出异常——生产代码里 model id 与 output format 都要写死。⛔ 两套 plan schema 互不通用:music_v1 吃 MusicPrompt,music_v2 与 music_v2_5 吃 CompositionPlan(chunks 的 text 里写方括号段名、歌词行与花括号内联指示),用错直接报错。版权与商用是这条线最结构化的部分:与环球音乐(UMG)的多年期协议在 v2.5 同期宣布且官方注明与 Music 2.5 独立;每个档位(含 Free)生成的曲子归你,Free 可商用但要署名,lossless 下载 Free 每天 5 次、Pro 每月 400 次;基于他人歌曲做出的曲子禁止下载;Marketplace 按 usage type 卖许可,创作者分成从 25% 起;任何许可下都禁止分发到 Spotify 这类流媒体。v2.5 的官方证据是一次自评盲听:47,885 对里多数胜出,差距最大在人声主导与声学密集类型。边界:API 只对付费订阅开放;人声只列英、西、德、日,中文歌更实际的是 YuE2 或 Suno;seed 不保证可复现;闭源无权重不可自托管。置信度 C(厂商宣称):音质未复算、未盲听,但 API 契约逐条可核对,本站把它们全列进正文。

10 minAPI 单曲时长上限(music_length_ms 3000-600000)厂商宣称 · 2026-09
生产ElevenLabs官网
Eleven Music v2.5:把音乐生成拆成可编程产线的闭源梯顶
语音与音频影音创作梯顶C

Eleven v4:把克隆保真度推到会反噬训练数据的一代

ElevenLabs 新一代语音合成模型,分 Eleven v4(最高质量档)与 Eleven v4 Turbo(实时档,中位推理延迟约 100ms,官方脚注明确不含应用与网络延迟)两个型号,官方口径是在输出质量、音色准确度、一致性、情感、演绎、audio tags 与语言覆盖上全面优于 v3 并建议迁移。本站把它列为音频域闭源语音方向的梯顶,依据是这一代把优化目标从「更好听」换成了「更像」:参考音色的音色、节奏、演绎与其他习惯一并复刻,官方自己承认准确度与个人偏好不总是同一件事、你可能仍更喜欢它在 v3 里的声音。配套的工程含义很硬——数据清洗的责任被推回使用方,官方把展示样例明确标注为未做任何后期(无 EQ、压缩、归一化、去齿音、去喷麦),并直说听到削波与喷麦大概率是训练数据里的、模型只是准确捕捉了下来。可交付面是三个数:Turbo 约 100ms、单次 10,000 字符约 10 分钟音频(v3 为 5,000,长文本分段接缝多一倍)、官方称 90+ 语言而 FAQ 逐条列出 87 种,这个差我们照原样并列不替它抹平。四条边界必须认清:跨语言口音是默认行为变更而非开关(生成语言与参考语言不一致时出目标语言的地道发音,做成 toggle 官方称仍是研究项目、无时间表),依赖「带母语口音说外语」的人设要先实测;控制面收窄,只剩 Stability 与 Similarity,Style 与 Speed 滑块取消、SSML 不支持,细粒度演绎改用 audio tags 且官方坦承还不完美;模型持续演化是官方明写的,发布后仍会继续训练、行为可能随时间变化,把音色当品牌资产的团队要周期性重测;Voice Design 生成的音色在 v4 上可能不那么有表现力。闭源不可自托管,数据必须过 ElevenLabs,克隆合规责任在使用方;可自托管对照是 CosyVoice 3、VibeVoice、Kokoro(语音)与 YuE2(音乐,非商业许可)。与本站已收的 Eleven v3 是同一商用栈上的两代,不是替代关系。置信度 C(厂商宣称):无第三方可核验基准,本站未做盲听。

~100msv4 Turbo 中位推理延迟(模型侧,不含应用与网络)厂商宣称 · 2026-09
生产ElevenLabs官网
Eleven v4:把克隆保真度推到会反噬训练数据的一代
语音与音频影音创作梯顶C

Eleven v3:一条把「说、听、唱」做齐的商用音频栈

ElevenLabs 的旗舰语音合成模型,官方称情感最丰富、最具表现力:戏剧化演绎、70+ 种语言、单次 5,000 字符、自然的多说话人对话,并随 v3 提供独立的 Text to Dialogue API,把多角色对白做成接口而不是 prompt 技巧。本站把它列为音频域梯顶,依据是背后唯一一条把说、听、唱都做齐的商用音频栈:TTS 四档、ASR 三档(含 Medical)、音乐两档。TTS 四档三轴互斥:v3 表现力最强但非实时、单次 5,000 字符;Flash v2.5 延迟约 75ms、每字符便宜 50%;Multilingual v2 长文本最稳却只有 29 语言;没有全能档,按场景分型号。ASR 侧 Scribe v2 覆盖 90+ 语言、32 人分离。延迟都是模型侧口径,不含网络与上游 LLM 时间,不能当 SLA 读。边界:长文本要自己分段,接缝处的韵律与音色一致性由你负责;闭源不可自托管,数据主权敏感场景是硬门槛。本站第三方榜里没有语音榜,与 Gemini 3.8 Flash TTS 并列不排名。置信度 C(厂商宣称):未复算 WER、未做盲听对比。

70+语言覆盖厂商宣称 · 2026-09
产品ElevenLabs官网
Eleven v3:一条把「说、听、唱」做齐的商用音频栈