Skip to content
←返回领域赋能

能力资产

语音与音频影音创作梯顶

Suno:把音乐生产后半段工序全部收进一个产品

suno

文生歌这条路做得最完整的商业平台:一句风格描述、自己的歌词、一段哼唱或一段 riff 都能起步,几秒出带人声与配器的完整歌曲,然后在同一产品里延伸、改段、换风格、抽分轨、做母带。本站把它列为音频域音乐方向的闭源梯顶,依据是工序完整度而不是单点音质——绝大多数生成式音乐产品只覆盖出草稿与选一版两步,Suno 用 Stem 分离(最多 12 轨)、MIDI 导出与 Suno Studio 把改段、重编、母带接上了,Studio 给的是传统 DAW 语义(多轨时间线、take lanes、comping、手动 BPM 治速度漂移、逐 clip 变速变调),不是又一个 prompt 框;Custom Models 用 6 首以上自有作品训练最多 3 个私有风格变体,Voices(前身 Personas)用自己的演唱样本出歌并带本人验证步骤。档位切分很关键:免费档能做完创作(生成、歌词、Cover、裁剪淡入淡出、音频上传),Stem、Add Vocals、Voices、Custom Models 都在 Pro 或 Premier,Studio 仅 Premier 且仅桌面网页,所以实际选型要按 Premier 算成本。第三方基准里版本号并不等于质量:WildSongBench 上 v5 得 6.8721,高于 v6 的 6.5562 与 v6 Wild 的 6.4195,v4.5 6.6995、v5.5 6.7150,官方也明确要求按能力而非版本号描述。边界:闭源不可自托管,未发布的旋律与歌词必须上传;无稳定版本语义,同一首歌重生成会随模型更新而变;商用权利随订阅档位;控制粒度落在段落与风格上,没有可编辑的和弦轨,需要乐理级修改要么靠 Studio 多轨重编,要么选 YuE2 那种暴露 ABC 乐谱的开放模型。置信度 C(厂商宣称),基准由 m-a-p 提交,本站未复算。

C
置信度
厂商宣称
只有官方模型卡/发布会,无独立复测
6.8721
关键指标
WildSongBench SongBench 均分(v5,第三方测)
厂商宣称 · 2026-09
成熟度
生产
研究 → 演示 → 产品 → 生产
我们的判断

我们给它 C 档(厂商宣称)。功能清单、档位划分、Stem 数量、导出格式这些规格类事实来自官方 llms.txt(2026-05-29 版),可核验但仍是单方陈述;WildSongBench 那组分数来自第三方(m-a-p)的公开基准,本站没有复算,也没有做过盲听。所以整条资产按 C 标,不因为它是最出名的音乐产品就升档。

它值得进梯顶的理由是工序完整度,而不是单点音质。音乐生产真实的样子是:出草稿 → 选中一版 → 改段 → 抽分轨 → 在自己的 DAW 里重编 → 母带。绝大多数生成式音乐产品只覆盖前两步,于是产出停在「一段不能用的音频」;Suno 用 Stem 分离(12 轨)+ MIDI 导出 + Suno Studio 把后三步接上了,而且 Studio 给的是传统 DAW 语义(多轨时间线、take lanes、comping、手动 BPM),不是又一个 prompt 框。手动 BPM 那一条尤其能说明它做过真实编曲:速度漂移正是 AI 素材进不了正规工程的头号原因。Custom Models(≥6 首自有作品训 3 个私有变体)则解决了另一个真问题——风格一致性不能靠每次重写 prompt。

选型时三条要写清。一,「最新即最强」在这一域不成立:第三方基准里 v5(6.8721)仍高于 v6(6.5562)与 v6 Wild(6.4195),官方也明确要求按能力而非版本号描述产品,所以别把版本号当质量承诺,要按用途试听。二,控制粒度落在段落与风格上,不在乐理上:没有可编辑的和弦轨、没有小节级精修,需要乐理级修改的团队要么靠 Studio 的多轨重编绕过去,要么选 YuE2 那种把 ABC 乐谱暴露成产物的开放模型。三,闭源不可自托管 + 商用权利随档位:未发布的旋律与歌词必须上传到 Suno,数据主权敏感场景是硬门槛;付费档才拿得到 Stem、Voices、Custom Models 与 Studio,而这几样恰恰是它区别于普通生成器的全部价值,所以实际选型应按 Premier 档算成本,而不是按免费档试用。与本站已收的 Eleven Music v2.5 相比,Suno 的差异化在工作站与私有风格模型,Eleven Music 的差异化在与 ElevenLabs 那条说、听、唱同栈的 API 集成。

Music GenerationText-to-MusicGenerative Audio WorkstationStems
Suno官网1 min read3

它解决的问题:把「一句想法」到「可交付母带」之间的那段工序全部产品化

Suno 是文生歌这条路做得最完整的商业平台:一句风格描述、自己的歌词、一段哼唱或一段吉他 riff 都能起步,几秒内出带人声与配器的完整歌曲,然后在同一个产品里延伸、改段、换风格、抽分轨、做母带。它的意义不在「能生成歌」——开源与闭源都能生成——而在把音乐生产的后半段工序全部收进了一个产品:这正是本站把它列为音频域音乐方向梯顶闭源条目的理由。

官方口径刻意不给版本号(「模型与功能频繁升级,按能力描述而不是按版本描述」),但第三方基准把版本量化了:WildSongBench 上 v5 SongBench 均分 6.8721、v4.5 6.6995、v5.5 6.7150、v6 6.5562、v6 Wild 6.4195。这组数字值得单独读一眼:版本号变新不等于基准分变高,v5 在这套尺子上仍是 Suno 家族的最高分,v6 与 v6 Wild 反而更低。厂商的新版本通常优化的是官方没量到的维度(音质、动态、可控性),所以「最新即最强」在音乐这一域并不成立,选型要按自己的用途试听。

功能分层:免费档能做完创作,付费档才拿得到生产工序

能力档位说明
生成 / 歌词 / Cover / 裁剪淡入淡出 / 音频上传免费档核心创作免费,Remaster 可对任何模型生成的歌重做混音
Stem 分离(最多 12 轨)Pro / Premier人声、鼓、贝斯等分轨可 solo / mute / 下载,导出 MP3、WAV、tempo-locked WAV、MIDI
Add Vocals / Add InstrumentalPro / Premier给纯伴奏按你的歌词加人声,或给一段人声想法配器
Voices(前身 Personas,beta)Pro / Premier录或上传一小段自己的演唱,用自己的音色出歌,带「确认是你本人」的验证步骤
Custom ModelsPro / Premier上传 ≥6 首你拥有版权的原创作品,训练最多 3 个私有风格变体
Suno Studio(GAW)仅 Premier,仅桌面网页生成式音频工作站:多轨时间线、AI 生成 stem 直接落进既有编曲、麦克风录音变形、Loop Recording / Take Lanes / Comping、手动 BPM 治速度漂移、EQ 与逐 clip 变速变调、多轨 bounce 导出

这张表里最该读的是最后两行。Custom Models 与 Studio 把 Suno 从「生成器」变成「工作站」:前者让风格可控且私有(不再靠 prompt 反复描述同一种音色),后者给了传统 DAW 的多轨与 comping 语义,同时让「AI 生成的 stem」能像采样一样被排进时间线。手动 BPM 那一条尤其实在——生成式音乐的速度漂移是它进不了正规编曲的头号原因,Studio 把项目锁到恒定速度再导出,才算把 AI 素材接回了 DAW 工作流。

控制面:三个滑块与一次 prompt 扩写

Creative Sliders 给的是三个连续量:Weirdness(Safe → Chaos)、Style Influence(Loose → Strong)、以及基于上传音频时的 Audio Influence。配合一键 prompt enhancement 把粗糙想法扩写成完整风格描述。Extend 支持在开头、中间、结尾续写,Quick Extend 后 Get Whole Song 合成整曲;Song Editor 免费档就能裁剪与淡入淡出,而「替换或新增高亮区域里的某一段」属于付费的高级编辑。这套控制面的特点是粒度落在段落与风格上,而不是乐理上:你没有一个能改的和弦轨。

边界:不可自托管、版本号不稳定、许可随档位走

  • 闭源、无权重、无 API 自托管路径:所有音频必须过 Suno 的服务,数据主权敏感的场景(未发布作品的旋律与歌词)要按这个前提评估。本站音频域里可自托管的替代是 YuE2(音乐,非商业许可)与 VoiceStudio(语音)。
  • 没有稳定的模型版本语义:官方明确要求按能力而非版本号描述,同一首歌在不同时间的重生成结果会随模型更新而变;需要长期一致音色的项目要么固定使用 Voices / Custom Models,要么把成品导出为 stem 与 MIDI 落到自己的 DAW 里。
  • 商用权利随订阅档位:免费档与付费档对生成内容的商用授权不同,具体条款以官方 pricing 页为准。本站不转述价目与授权数字,官方也要求不要引用具体价格。
  • 基准分是第三方在既有交付物上跑的:WildSongBench 那组数字由 m-a-p 提交与评测,本站未复算;而且它量的是单次交付的音频,不包含 Studio 里的人工工序。

同域资产:语音与音频

4
语音与音频影音创作梯顶C

Eleven Music v2.5:把音乐生成拆成可编程产线的闭源梯顶

ElevenLabs 的音乐生成模型,当前版本 v2.5,2026-09-11 发布。本站把它列为音频域音乐方向的工程面梯顶,与已收的 Suno 形成对照而不是重复:Suno 的价值集中在产品内部的工序(Studio 多轨时间线、Custom Models、最多 12 轨 stem 与 MIDI 导出),Eleven Music 把同类能力拆成了端点——生成、流式生成、结构化编曲计划、给视频配乐、上传既有音频、分轨、微调、片段级 inpainting,外加一个让创作者互相授权的 Marketplace。所以判断该用哪一条不需要比音质,只要问一句:这段音乐是人坐着调出来的,还是被一条流水线批量要出来的。API 面是九个端点而不是一个生成接口,其中两处对企业采购关键:compose 与 stem-separation 都有 sign_with_c2pa 开关(仅对 mp3 生效),出站文件可以带内容凭证;输出格式与订阅档位绑定,stem-separation 与 video-to-music 上 mp3_44100_192 需 Creator 及以上、pcm_44100 需 Pro 及以上,compose 侧最高 mp3_48000_320,「拿到无损」的门槛按端点不同。⛔ 最容易踩的坑:产品界面里 v2.5 已是默认,但 API 的 model_id 枚举(music_v1/music_v2/music_v2_5)默认值仍是 music_v1,而 output_format=auto 按模型选最优(v1 系给 mp3_44100_128、v2 系给 mp3_48000_192),两件事叠起来就是一个不显式传 model_id 的最小调用会拿到最老那代模型加更低码率,且响应里看不出异常——生产代码里 model id 与 output format 都要写死。⛔ 两套 plan schema 互不通用:music_v1 吃 MusicPrompt,music_v2 与 music_v2_5 吃 CompositionPlan(chunks 的 text 里写方括号段名、歌词行与花括号内联指示),用错直接报错。版权与商用是这条线最结构化的部分:与环球音乐(UMG)的多年期协议在 v2.5 同期宣布且官方注明与 Music 2.5 独立;每个档位(含 Free)生成的曲子归你,Free 可商用但要署名,lossless 下载 Free 每天 5 次、Pro 每月 400 次;基于他人歌曲做出的曲子禁止下载;Marketplace 按 usage type 卖许可,创作者分成从 25% 起;任何许可下都禁止分发到 Spotify 这类流媒体。v2.5 的官方证据是一次自评盲听:47,885 对里多数胜出,差距最大在人声主导与声学密集类型。边界:API 只对付费订阅开放;人声只列英、西、德、日,中文歌更实际的是 YuE2 或 Suno;seed 不保证可复现;闭源无权重不可自托管。置信度 C(厂商宣称):音质未复算、未盲听,但 API 契约逐条可核对,本站把它们全列进正文。

10 minAPI 单曲时长上限(music_length_ms 3000-600000)厂商宣称 · 2026-09
生产ElevenLabs官网
Eleven Music v2.5:把音乐生成拆成可编程产线的闭源梯顶
语音与音频影音创作梯顶A

VibeVoice:7.5Hz 帧率换来 90 分钟单遍语音

微软的开源前沿语音模型家族,仓库 microsoft/VibeVoice(MIT,54,531★,本站经 GitHub API 核)。本站把它作为一条资产收录而不是拆成三条,因为 TTS、Realtime 与 ASR 共用同一个技术内核:声学与语义两个 tokenizer 都是连续的,帧率压到 7.5Hz。7.5Hz 是全部能力的来源——90 分钟音频在 25Hz 下是 135,000 个 token、进不了 64K 上下文,7.5Hz 下是 40,500 个,所以「单次合成 90 分钟」与「单遍转写 60 分钟」是同一件事的两个方向。五条产品线各有上限:TTS-1.5B 单次 90 分钟、最多 4 个说话人;Realtime-0.5B 首包约 300ms;ASR-7B 单遍 60 分钟、直接输出「谁 / 何时 / 说了什么」、支持自定义热词与 50+ 语言;ASR-Streaming 边说边出文本;ASR-BitNet 用异构量化把 4.62GB 压到 1.58GB、3+ CPU 线程 RTF < 1、不需要 GPU。ASR 那条线最值得记:传统长音频转写是切片、识别、分离、对齐四步串联,全局上下文在切片处就丢了,而 VibeVoice-ASR 把识别、分离与时间戳联合成一次生成,这对会议记录与客服质检是决定可用性的一项。架构是 next-token diffusion:LLM 管对话走向,diffusion head 管声学细节,长对话的轮次一致性是语言问题,交给 LLM 才拿得到 4 个说话人 90 分钟不串味。⛔ 有一条必须如实记录:2025-09-05 团队把 VibeVoice-TTS 的代码从仓库移除,原文说明是发现了与其声明意图不一致的使用实例;权重仍在 HF 但仓库 Quick Try 写着 Disabled、官方推理脚本不在仓库里,今天的 TTS 路径来自社区复现,模型页明写不建议未做进一步测试就用于商业场景。团队此后的公开动作全在 ASR 侧,所以可商用的一侧是 ASR 而不是 TTS。它在别人评测表里的位置也要如实转述:CosyVoice 3 的 README 列了它,test-zh CER 1.16 / SS 74.4、test-en WER 3.04 / SS 68.9,同表 CosyVoice3 base 是 1.21 / 78.0——短音频零样本克隆不是它的赛道,它该被比的三项是单次能生成多长、能不能保持 4 个说话人不串、能不能一遍处理 1 小时会议音频,这三项开源侧几乎找不到对手。边界:TTS 无官方推理路径;MIT 覆盖代码不覆盖模型页的使用限制;长音频的失败是全局的,90 分钟单遍没有坏一段重跑一段的补救面;官方在 Risks and Limitations 里点名深度伪造并要求披露 AI 参与。置信度 B(confirmed):确认的是帧率换算、各产品线公开上限、代码下架与许可边界这些可核对的文档事实,不是音质。

90 / 60 min单次长音频上限(TTS 4 说话人 / ASR 单遍)已确认 · 2026-09
研究Microsoft官网Repo
VibeVoice:7.5Hz 帧率换来 90 分钟单遍语音
语音与音频影音创作梯顶A

Kokoro-82M:1000 美元训出来的 Apache-2.0 TTS

hexgrad 发布的开放权重 TTS 模型,82M 参数,Apache-2.0,仓库 hexgrad/kokoro(9,061★,本站 2026-09-29 经 GitHub API 核)。本站把它列为音频域的成本下限与许可下限:它最值得被记住的不是某个榜的名次,而是把「一次 TTS 部署到底要花多少钱」公开算了一遍。训练成本合计 1000 美元——v0.19 与 v1.0 各 500 个 A100 80GB GPU 小时;v0.19(2024-12-25)训练数据不足 100 小时、1 种语言 10 个音色,v1.0(2025-01-27)是几百小时、8 种语言 54 个音色。价格侧有两个相互独立的第三方来源指向同一量级:ArtificialAnalysis 记录的 Replicate 价 65 美分/百万字符,DeepInfra 标价 80 美分/百万字符,折合约每小时成品音频 3 到 5 美分。这条价格线是本站音频域选型比较的参照下限:高于它的部分,买的是音色克隆、方言覆盖、情感控制、流式延迟或合规背书,而不是「能不能听」。技术形态是 StyleTTS 2 + ISTFTNet 的 decoder-only(无扩散、encoder 未发布),G2P 走作者自维护的 misaki 库,系统侧依赖 espeak-ng,输出 24kHz;输入文本支持内联音素覆盖(形如 [Kokoro](/kˈOkəɹO/)),与 CosyVoice 3 的拼音/CMU 音素级发音修正是同一类思路——把「读错」从概率问题变成声明式配置,只是作用域是词而不是整段韵律。反过来 decoder-only 也决定了它没有零样本音色克隆:54 个音色是训练进去的,给参考音频不会长出新声音,这不是缺陷而是分工。合规披露在 TTS 领域几乎找不到第二份这么细:模型卡声明只用许可宽松或无版权的音频训练,逐类列出公有领域、Apache/MIT 许可与由闭源 TTS 生成的合成音频,并明确排除「来自开源 TTS 模型的合成音频」与「自定义音色克隆」;CC BY 部分单列署名表,模型 SHA256 也公开,所以你能校验自己下到的是不是同一个权重。边界:不克隆音色,参考音频驱动的场景直接出局;24kHz 够播报与朗读、不够音乐级母带;8 种语言 54 个音色在 v1.0 之后没有继续扩,中文可用度要自己试听;项目基本停更(最近 push 2025-08-06),遇到 bug 只能自己改;它的知名度已经长出钓鱼面,模型卡点名 kokorottsai_com 等根域带 kokoro 的站点与本项目无关,真正的入口只有 HF 的 hexgrad/Kokoro-82M 与 GitHub 的 hexgrad/kokoro,不要在搜索结果首页的「Kokoro 官网」上付钱。置信度 B(confirmed):确认的是成本与市场价格这条有第三方独立来源的证据链,不是音质。

<$1API 市场价(每百万字符,2025-04 模型卡口径)已确认 · 2025-04
产品hexgrad官网Repo
Kokoro-82M:1000 美元训出来的 Apache-2.0 TTS
语音与音频影音创作梯顶C

Fun-CosyVoice3-0.5B:把可控性做成接口的开源 TTS

阿里通义 FunAudioLLM 的第三代 LLM 式语音合成系统,0.5B 参数,发布号 Fun-CosyVoice3-0.5B-2512,一次放出 base 与 RL 两档权重加训练与推理脚本;代码仓已迁到 QwenAudio/CosyVoice(Apache-2.0,23,794★,本站 2026-09-29 经 GitHub API 核)。本站把它列为音频域开源语音方向的梯顶,依据不是「最像人」,而是它给生产环境里 TTS 的四类真实故障各配了一个显式接口:多音字读错走发音修正(中文拼音与英文 CMU 音素直接写进输入);数字符号读法不对走自带文本归一化;长句崩掉走 RAS 重复感知采样;要低延迟走双向流式,官方首包 150ms,量级上能直接接进实时对话 agent。指标要读准三件事:test-zh 说话人相似度 78.0 是 0.5B 开源档最高、超过人类基线 75.5,但仍低于闭源 Seed-TTS 的 79.6,「开源第一」成立而「全球第一」不成立;test-hard 才是它的强项,base 6.71 / RL 5.44 全表最低、好过闭源 Seed-TTS 的 7.59,而 hard 集放的是长句与绕口令,这一列领先直接对应真实稿件的可用性;英文要打折看,base 的 test-en 相似度 71.8 低于人类基线 73.4,只有 RL 档的 WER 1.68 才追回来。base 与 RL 是同一架构的两个后训练权重:三处错误率全线下降(zh CER 降 33%、hard CER 降 19%),三处相似度小幅回落,播报与客服这类读错一个字就是事故的场景这笔交易划算,给特定 IP 配音的保真场景要先试听 RL 档。仓库同时放出 GRPO 训练脚本与 triton + TensorRT-LLM 运行时(官方称 4 倍加速),后训练是别人能接着跑的路径;语言面覆盖 9 种语言与 18 种以上中文方言口音,方言档是闭源 API 至今几乎不给的能力。边界:许可分两层,代码 Apache-2.0 但权重条款以模型页为准,商用前必须单独确认;全部读数出自作者自评测,没有第三方盲听榜可交叉验证,本站未复算;零样本克隆的相似度取自标准评测集,真实业务里参考录音的底噪与风格直接决定成品。置信度 C(厂商宣称)。

78.0test-zh 说话人相似度(0.5B 开源档,人类基线 75.5)厂商宣称 · 2025-12
产品Alibaba Tongyi FunAudioLLM (QwenAudio)官网Repo
Fun-CosyVoice3-0.5B:把可控性做成接口的开源 TTS