Skip to content
← 标签

#Music Generation (4)

语音与音频影音创作梯顶C

Eleven Music v2.5:把音乐生成拆成可编程产线的闭源梯顶

ElevenLabs 的音乐生成模型,当前版本 v2.5,2026-09-11 发布。本站把它列为音频域音乐方向的工程面梯顶,与已收的 Suno 形成对照而不是重复:Suno 的价值集中在产品内部的工序(Studio 多轨时间线、Custom Models、最多 12 轨 stem 与 MIDI 导出),Eleven Music 把同类能力拆成了端点——生成、流式生成、结构化编曲计划、给视频配乐、上传既有音频、分轨、微调、片段级 inpainting,外加一个让创作者互相授权的 Marketplace。所以判断该用哪一条不需要比音质,只要问一句:这段音乐是人坐着调出来的,还是被一条流水线批量要出来的。API 面是九个端点而不是一个生成接口,其中两处对企业采购关键:compose 与 stem-separation 都有 sign_with_c2pa 开关(仅对 mp3 生效),出站文件可以带内容凭证;输出格式与订阅档位绑定,stem-separation 与 video-to-music 上 mp3_44100_192 需 Creator 及以上、pcm_44100 需 Pro 及以上,compose 侧最高 mp3_48000_320,「拿到无损」的门槛按端点不同。⛔ 最容易踩的坑:产品界面里 v2.5 已是默认,但 API 的 model_id 枚举(music_v1/music_v2/music_v2_5)默认值仍是 music_v1,而 output_format=auto 按模型选最优(v1 系给 mp3_44100_128、v2 系给 mp3_48000_192),两件事叠起来就是一个不显式传 model_id 的最小调用会拿到最老那代模型加更低码率,且响应里看不出异常——生产代码里 model id 与 output format 都要写死。⛔ 两套 plan schema 互不通用:music_v1 吃 MusicPrompt,music_v2 与 music_v2_5 吃 CompositionPlan(chunks 的 text 里写方括号段名、歌词行与花括号内联指示),用错直接报错。版权与商用是这条线最结构化的部分:与环球音乐(UMG)的多年期协议在 v2.5 同期宣布且官方注明与 Music 2.5 独立;每个档位(含 Free)生成的曲子归你,Free 可商用但要署名,lossless 下载 Free 每天 5 次、Pro 每月 400 次;基于他人歌曲做出的曲子禁止下载;Marketplace 按 usage type 卖许可,创作者分成从 25% 起;任何许可下都禁止分发到 Spotify 这类流媒体。v2.5 的官方证据是一次自评盲听:47,885 对里多数胜出,差距最大在人声主导与声学密集类型。边界:API 只对付费订阅开放;人声只列英、西、德、日,中文歌更实际的是 YuE2 或 Suno;seed 不保证可复现;闭源无权重不可自托管。置信度 C(厂商宣称):音质未复算、未盲听,但 API 契约逐条可核对,本站把它们全列进正文。

10 minAPI 单曲时长上限(music_length_ms 3000-600000)厂商宣称 · 2026-09
生产ElevenLabs官网
Eleven Music v2.5:把音乐生成拆成可编程产线的闭源梯顶
语音与音频影音创作梯顶C

Suno:把音乐生产后半段工序全部收进一个产品

文生歌这条路做得最完整的商业平台:一句风格描述、自己的歌词、一段哼唱或一段 riff 都能起步,几秒出带人声与配器的完整歌曲,然后在同一产品里延伸、改段、换风格、抽分轨、做母带。本站把它列为音频域音乐方向的闭源梯顶,依据是工序完整度而不是单点音质——绝大多数生成式音乐产品只覆盖出草稿与选一版两步,Suno 用 Stem 分离(最多 12 轨)、MIDI 导出与 Suno Studio 把改段、重编、母带接上了,Studio 给的是传统 DAW 语义(多轨时间线、take lanes、comping、手动 BPM 治速度漂移、逐 clip 变速变调),不是又一个 prompt 框;Custom Models 用 6 首以上自有作品训练最多 3 个私有风格变体,Voices(前身 Personas)用自己的演唱样本出歌并带本人验证步骤。档位切分很关键:免费档能做完创作(生成、歌词、Cover、裁剪淡入淡出、音频上传),Stem、Add Vocals、Voices、Custom Models 都在 Pro 或 Premier,Studio 仅 Premier 且仅桌面网页,所以实际选型要按 Premier 算成本。第三方基准里版本号并不等于质量:WildSongBench 上 v5 得 6.8721,高于 v6 的 6.5562 与 v6 Wild 的 6.4195,v4.5 6.6995、v5.5 6.7150,官方也明确要求按能力而非版本号描述。边界:闭源不可自托管,未发布的旋律与歌词必须上传;无稳定版本语义,同一首歌重生成会随模型更新而变;商用权利随订阅档位;控制粒度落在段落与风格上,没有可编辑的和弦轨,需要乐理级修改要么靠 Studio 多轨重编,要么选 YuE2 那种暴露 ABC 乐谱的开放模型。置信度 C(厂商宣称),基准由 m-a-p 提交,本站未复算。

6.8721WildSongBench SongBench 均分(v5,第三方测)厂商宣称 · 2026-09
生产Suno官网
Suno:把音乐生产后半段工序全部收进一个产品
语音与音频影音创作梯顶C

YuE2-3B:把乐谱做成接口的开源歌曲生成模型

m-a-p 的开源歌曲生成模型,3B 参数,权重 CC-BY-NC-4.0,歌词加风格 prompt 直出带人声与伴奏的 48kHz 立体声完整歌曲。本站把它列为音频域音乐方向的开放权重梯顶,依据是同代开源模型里几乎唯一的组合:开放权重加可编辑的中间表示。一条 AR-NAR Mixture-of-Transformers 主干先写 ABC 记谱(旋律与和弦)与语义 token,再用 flow matching 生成声学 latent、VAE 解码,所以乐谱是能被人和 agent 读改的产物,而不是只能重抽的黑箱;三档 cot(full / melody / off)分别对应作曲、翻唱与直出,官方 agent 编辑 demo 是 9 步 14 版把中文流行改成英文爵士。跑分口径要读准:WildSongBench 192 条 prompt 上 best-of-8 的 SongBench 均分 6.9632 高于 Suno v5 的 6.8721 与 v6 的 6.5562,但那是 8 候选选优对单次交付;MuLan 与 AllMusicCaps 两项风格文本对齐仍输给 Suno v5,PER 8.44% 也落后于 Suno v6 Wild 的 7.45% 与 MiniMax Music 3 的 6.27%。成本是它最实的优势:RTX 4090 24GB 上一首 3.6 分钟的歌 71 秒生成、峰值 11.18GiB,H800 加 vLLM 并发 32 达 373 首每小时。边界:非商业许可;翻唱的身份保持几乎全靠外部乐谱(不给谱 CLEWS mAP 塌到 0.006);跑分用 legacy VAE 而默认发的是新 VAE;技术报告未出、盲听榜尚无结果。置信度 C(厂商宣称),本站未复算。

6.9632WildSongBench SongBench 均分(best-of-8)厂商宣称 · 2026-09
研究Multimodal Art Projects (m-a-p)官网Repo
YuE2-3B:把乐谱做成接口的开源歌曲生成模型
语音与音频影音创作梯顶C

Eleven v3:一条把「说、听、唱」做齐的商用音频栈

ElevenLabs 的旗舰语音合成模型,官方称情感最丰富、最具表现力:戏剧化演绎、70+ 种语言、单次 5,000 字符、自然的多说话人对话,并随 v3 提供独立的 Text to Dialogue API,把多角色对白做成接口而不是 prompt 技巧。本站把它列为音频域梯顶,依据是背后唯一一条把说、听、唱都做齐的商用音频栈:TTS 四档、ASR 三档(含 Medical)、音乐两档。TTS 四档三轴互斥:v3 表现力最强但非实时、单次 5,000 字符;Flash v2.5 延迟约 75ms、每字符便宜 50%;Multilingual v2 长文本最稳却只有 29 语言;没有全能档,按场景分型号。ASR 侧 Scribe v2 覆盖 90+ 语言、32 人分离。延迟都是模型侧口径,不含网络与上游 LLM 时间,不能当 SLA 读。边界:长文本要自己分段,接缝处的韵律与音色一致性由你负责;闭源不可自托管,数据主权敏感场景是硬门槛。本站第三方榜里没有语音榜,与 Gemini 3.8 Flash TTS 并列不排名。置信度 C(厂商宣称):未复算 WER、未做盲听对比。

70+语言覆盖厂商宣称 · 2026-09
产品ElevenLabs官网
Eleven v3:一条把「说、听、唱」做齐的商用音频栈