Skip to content
←返回领域赋能

能力资产

语音与音频影音创作梯顶

YuE2-3B:把乐谱做成接口的开源歌曲生成模型

yue2

m-a-p 的开源歌曲生成模型,3B 参数,权重 CC-BY-NC-4.0,歌词加风格 prompt 直出带人声与伴奏的 48kHz 立体声完整歌曲。本站把它列为音频域音乐方向的开放权重梯顶,依据是同代开源模型里几乎唯一的组合:开放权重加可编辑的中间表示。一条 AR-NAR Mixture-of-Transformers 主干先写 ABC 记谱(旋律与和弦)与语义 token,再用 flow matching 生成声学 latent、VAE 解码,所以乐谱是能被人和 agent 读改的产物,而不是只能重抽的黑箱;三档 cot(full / melody / off)分别对应作曲、翻唱与直出,官方 agent 编辑 demo 是 9 步 14 版把中文流行改成英文爵士。跑分口径要读准:WildSongBench 192 条 prompt 上 best-of-8 的 SongBench 均分 6.9632 高于 Suno v5 的 6.8721 与 v6 的 6.5562,但那是 8 候选选优对单次交付;MuLan 与 AllMusicCaps 两项风格文本对齐仍输给 Suno v5,PER 8.44% 也落后于 Suno v6 Wild 的 7.45% 与 MiniMax Music 3 的 6.27%。成本是它最实的优势:RTX 4090 24GB 上一首 3.6 分钟的歌 71 秒生成、峰值 11.18GiB,H800 加 vLLM 并发 32 达 373 首每小时。边界:非商业许可;翻唱的身份保持几乎全靠外部乐谱(不给谱 CLEWS mAP 塌到 0.006);跑分用 legacy VAE 而默认发的是新 VAE;技术报告未出、盲听榜尚无结果。置信度 C(厂商宣称),本站未复算。

C
置信度
厂商宣称
只有官方模型卡/发布会,无独立复测
6.9632
关键指标
WildSongBench SongBench 均分(best-of-8)
厂商宣称 · 2026-09
成熟度
研究
研究 → 演示 → 产品 → 生产
我们的判断

我们给它 C 档(厂商宣称)。WildSongBench 这套基准、192 条 prompt、九项指标的协议说明与全精度 CSV 都公开发布,透明度远高于一般厂商稿,这是它比同档条目更可信的地方;但基准由模型作者自己运营、跑分由作者自己提交,本站没有复算过任何一个数字,也没有做过盲听,所以按契约 §13.5 不能升成 A。best-of-8 与 Suno 的单次交付是不同口径这一点,官方写在协议里,我们照原样转述,不替它抹平。

它值得进音频域梯顶的理由不是「跑分第一」,而是开放权重 + 可编辑中间表示这个组合在音乐生成里几乎是唯一的。Suno、Eleven Music、MiniMax Music 都是服务:你能改的只有 prompt 与分段,想换一段和声只能重抽。YuE2 把 ABC 乐谱暴露成产物,于是「重新配和声」「把中文流行改成英文爵士」「让 solo 引用一段既有旋律」这些需求第一次变成可版本化的编辑操作,而不是抽卡。官方那条 9 步 14 版的 agent 编辑链是这条路线最有说服力的证据 —— agent 能改乐谱,意味着音乐生成第一次接得上本站 harness 域里那套「读产物、改产物、再渲染」的工作流。加上单卡 24GB / 71 秒出一首 3.6 分钟的歌,自托管成本落在个人工作站量级,这是闭源服务给不了的。

选型时要认清三条硬边界。许可是 CC-BY-NC-4.0,非商业;任何商用产品要么谈授权要么换服务,这条不能靠「跑分高」绕过去。翻唱依赖外部乐谱:不给谱时身份保持指标塌到 0.006 mAP,所以「AI 翻唱」这条产品线的真实前置条件是一套能用的转写链路(SheetSage2 + ASR 取词),而不是模型本身。咬字仍是短板,PER 8.44% 落后于 Suno v6 Wild 的 7.45% 与 MiniMax Music 3 的 6.27%,歌词密集的段落要先试听再上生产。另外注意跑分口径:6.9632 出自 YuE2-Vae-legacy,默认发的 YuE2-Vae 听感更好但基准分更低,复现跑分与本机试听听到的不是同一个解码器。技术报告未出、训练数据无从核验,这两条我们与「盲听榜尚无结果」一并计进 C 档。

Music GenerationOpen WeightsText-to-MusicSymbolic Planning
Multimodal Art Projects (m-a-p)官网github.com/multimodal-art-projection/YuE2 min read4

它解决的问题:让音乐生成的中间态变成可编辑的乐谱

YuE2-3B 是 multimodal-art-projection(m-a-p)的开源歌曲生成模型,给歌词与风格 prompt,直接出带人声与伴奏的完整歌曲,48kHz 立体声,权重以 CC-BY-NC-4.0 公开。它与本站已收的音乐模型最大的区别不在音质,而在中间表示:同一条 AR-NAR 主干先写出 ABC 记谱(旋律 + 和弦)与语义 token,再由 flow matching 生成声学 latent,最后过 VAE 解码成音频。乐谱因此是一个能被人读、被人改、被 agent 改的接口,而不是一个只能重新抽卡的黑箱。

这一设计直接决定了它的三种用法:cot="full"(旋律 + 和弦规划,默认)、cot="melody"(只规划旋律,官方推荐用于翻唱)、cot="off"(不生成符号规划直接出音频)。还能传入自己的 ABC,或用 pipe.plan() 只拿规划、改完再 generate_semantic() → synthesize() → decode() 分阶段跑。

WildSongBench:赢在哪几把尺子上,又输在哪几把

官方在 192 条 WildSongBench prompt 上与 17 个设置对比(2026-09-12 版),SongBench 平均分是主指标:

模型开放Musicality ↑SongBench Avg ↑MuLan ↑AllMusicCaps ↑Q3O ↑PER ↓
YuE2 (best-of-8)是6.26666.96320.50510.39804.70099.79%
YuE2(两候选取低 PER)是5.90756.73160.50680.40544.68198.44%
Suno v5否5.99186.87210.54280.43534.59078.10%
Suno v6 / v6 Wild否5.6558 / 5.56446.5562 / 6.41950.4916 / 0.49990.4305 / 0.43164.6258 / 4.58987.58% / 7.45%
Mureka 9否6.04886.93770.43940.41024.636811.69%
LeVo 2 / ACE-Step 1.5(开源同代)是5.4590 / 5.15886.3247 / 6.01180.3542 / 0.43720.2680 / 0.38693.9458 / 4.580926.12% / 7.46%

要读准三件事。一,best-of-8 是抽 8 个候选再按 Musicality → Q3O → PER 选优,不是单次生成质量;与 Suno 的单次交付比,这是不同口径,官方在协议里写明了,但选型时不能把它当成「同样算力下赢 Suno」。二,它并没有赢下所有尺子:MuLan 与 AllMusicCaps 这两个量「音频与风格文本对齐」的指标上 Suno v5 明显更高(0.5428 / 0.4353 对 0.5051 / 0.3980),YuE2 的优势集中在 Musicality、SongBench 综合分与 Q3O(prompt 遵循)。三,PER 8.44%~9.79% 不是这批模型里最低的,Suno v6 Wild 是 7.45%,MiniMax Music 3 低到 6.27% —— 咬字清晰度仍然是开放模型的短板。

翻唱那一组(SHS100K,948 首 × 2 风格 × 2 seed = 每法 3792 首)更能说明符号规划的作用:YuE2 带完整乐谱时 CLEWS mAP 0.647 / Hit@1 71.3%,去掉和弦降到 0.598 / 67.3%,完全不给乐谱则塌到 0.006 / 0.3%,而同代开源 ACE-Step 1.5 只有 0.024。也就是说「保住原曲身份」这件事几乎全部由外部传入的乐谱承担(由 SheetSage2 转写得来),模型本身不做音频到身份的隐式记忆。这既是能力也是边界:你有谱才翻得了。

速度与显存:单卡 24GB 能跑,这是它与闭源服务最实的差别

配置模式LM tokens/s生成 / 出音频峰值显存
RTX 4090 24GB(HF 包,PyTorch + CUDA graphs + FlashAttention)full139.4871.04s / 214.85s(3.6 分钟歌)11.18 GiB
RTX 4090 24GBoff121.0757.91s / 196.88s11.09 GiB
H800 80GB + vLLM 0.19,AR 并发 16full2418.63340.38 首/小时78.66 GiB
H800 80GB + vLLM 0.19,AR 并发 32full3231.74373.53 首/小时76.61 GiB

门槛写得很直白:Linux、Python 3.10+、24GB NVIDIA GPU(需 BF16)、24GB 可用主机内存,不量化;最大上下文测试峰值 14.08 GiB,一次一首。服务端那一档是独立的 vLLM 运行时,373 首/小时是热态批吞吐,不是单请求延迟,两个数字别混着读。

agent 编辑:官方 demo 是一条 9 步 14 版的修改链

官方把「用 agent 改歌」做成了一等公民:The Last Train 从中文流行一路改到英文爵士,加现代和声与萨克斯 solo,并让 solo 围绕两遍完整的《小星星》展开 —— 9 个回合、14 个版本,每一步的对话、乐谱、prompt、歌词与成品音频都公开可听。工程含义是:agent 拿到的不是「再生成一次」的按钮,而是 score.abc + 原 prompt + 歌词这三样可读可改的产物,再交给 YuE2 渲染。严格重新配和声时官方要求 agent 保持旋律音高与节奏不变,并把长音逐个对到新和弦上检查。

边界:许可、VAE 口径与尚未发布的技术报告

  • CC-BY-NC-4.0 是非商业许可。跑分再高也不能直接用在商用产品里;要商用得单独谈授权,或者选 Suno / Eleven Music 这类付费即授权的服务。这是它与本站音频域里所有闭源条目最硬的一条区别。
  • 跑分用的是 YuE2-Vae-legacy,默认发的是 YuE2-Vae。官方说明:legacy 在基准上 musicality 更高,新版听感更好。所以表里的 6.9632 与你在本机默认配置下听到的东西不是同一个解码器,复现跑分必须显式传 vae="m-a-p/YuE2-Vae-legacy"。
  • 技术报告尚未发布,官方让引用前代 YuE(arXiv 2503.08638)。训练数据构成、数据规模、后训练细节目前无从核验。
  • 盲听榜仍在收集:Music Arena 是与闭源模型并排的匿名偏好投票,尚无结果;自动指标与人耳偏好在音乐上历来分歧不小,这一票没出来之前,「超过 Suno」只是基准口径的说法。

同域资产:语音与音频

4
语音与音频影音创作梯顶C

Eleven Music v2.5:把音乐生成拆成可编程产线的闭源梯顶

ElevenLabs 的音乐生成模型,当前版本 v2.5,2026-09-11 发布。本站把它列为音频域音乐方向的工程面梯顶,与已收的 Suno 形成对照而不是重复:Suno 的价值集中在产品内部的工序(Studio 多轨时间线、Custom Models、最多 12 轨 stem 与 MIDI 导出),Eleven Music 把同类能力拆成了端点——生成、流式生成、结构化编曲计划、给视频配乐、上传既有音频、分轨、微调、片段级 inpainting,外加一个让创作者互相授权的 Marketplace。所以判断该用哪一条不需要比音质,只要问一句:这段音乐是人坐着调出来的,还是被一条流水线批量要出来的。API 面是九个端点而不是一个生成接口,其中两处对企业采购关键:compose 与 stem-separation 都有 sign_with_c2pa 开关(仅对 mp3 生效),出站文件可以带内容凭证;输出格式与订阅档位绑定,stem-separation 与 video-to-music 上 mp3_44100_192 需 Creator 及以上、pcm_44100 需 Pro 及以上,compose 侧最高 mp3_48000_320,「拿到无损」的门槛按端点不同。⛔ 最容易踩的坑:产品界面里 v2.5 已是默认,但 API 的 model_id 枚举(music_v1/music_v2/music_v2_5)默认值仍是 music_v1,而 output_format=auto 按模型选最优(v1 系给 mp3_44100_128、v2 系给 mp3_48000_192),两件事叠起来就是一个不显式传 model_id 的最小调用会拿到最老那代模型加更低码率,且响应里看不出异常——生产代码里 model id 与 output format 都要写死。⛔ 两套 plan schema 互不通用:music_v1 吃 MusicPrompt,music_v2 与 music_v2_5 吃 CompositionPlan(chunks 的 text 里写方括号段名、歌词行与花括号内联指示),用错直接报错。版权与商用是这条线最结构化的部分:与环球音乐(UMG)的多年期协议在 v2.5 同期宣布且官方注明与 Music 2.5 独立;每个档位(含 Free)生成的曲子归你,Free 可商用但要署名,lossless 下载 Free 每天 5 次、Pro 每月 400 次;基于他人歌曲做出的曲子禁止下载;Marketplace 按 usage type 卖许可,创作者分成从 25% 起;任何许可下都禁止分发到 Spotify 这类流媒体。v2.5 的官方证据是一次自评盲听:47,885 对里多数胜出,差距最大在人声主导与声学密集类型。边界:API 只对付费订阅开放;人声只列英、西、德、日,中文歌更实际的是 YuE2 或 Suno;seed 不保证可复现;闭源无权重不可自托管。置信度 C(厂商宣称):音质未复算、未盲听,但 API 契约逐条可核对,本站把它们全列进正文。

10 minAPI 单曲时长上限(music_length_ms 3000-600000)厂商宣称 · 2026-09
生产ElevenLabs官网
Eleven Music v2.5:把音乐生成拆成可编程产线的闭源梯顶
语音与音频影音创作梯顶A

VibeVoice:7.5Hz 帧率换来 90 分钟单遍语音

微软的开源前沿语音模型家族,仓库 microsoft/VibeVoice(MIT,54,531★,本站经 GitHub API 核)。本站把它作为一条资产收录而不是拆成三条,因为 TTS、Realtime 与 ASR 共用同一个技术内核:声学与语义两个 tokenizer 都是连续的,帧率压到 7.5Hz。7.5Hz 是全部能力的来源——90 分钟音频在 25Hz 下是 135,000 个 token、进不了 64K 上下文,7.5Hz 下是 40,500 个,所以「单次合成 90 分钟」与「单遍转写 60 分钟」是同一件事的两个方向。五条产品线各有上限:TTS-1.5B 单次 90 分钟、最多 4 个说话人;Realtime-0.5B 首包约 300ms;ASR-7B 单遍 60 分钟、直接输出「谁 / 何时 / 说了什么」、支持自定义热词与 50+ 语言;ASR-Streaming 边说边出文本;ASR-BitNet 用异构量化把 4.62GB 压到 1.58GB、3+ CPU 线程 RTF < 1、不需要 GPU。ASR 那条线最值得记:传统长音频转写是切片、识别、分离、对齐四步串联,全局上下文在切片处就丢了,而 VibeVoice-ASR 把识别、分离与时间戳联合成一次生成,这对会议记录与客服质检是决定可用性的一项。架构是 next-token diffusion:LLM 管对话走向,diffusion head 管声学细节,长对话的轮次一致性是语言问题,交给 LLM 才拿得到 4 个说话人 90 分钟不串味。⛔ 有一条必须如实记录:2025-09-05 团队把 VibeVoice-TTS 的代码从仓库移除,原文说明是发现了与其声明意图不一致的使用实例;权重仍在 HF 但仓库 Quick Try 写着 Disabled、官方推理脚本不在仓库里,今天的 TTS 路径来自社区复现,模型页明写不建议未做进一步测试就用于商业场景。团队此后的公开动作全在 ASR 侧,所以可商用的一侧是 ASR 而不是 TTS。它在别人评测表里的位置也要如实转述:CosyVoice 3 的 README 列了它,test-zh CER 1.16 / SS 74.4、test-en WER 3.04 / SS 68.9,同表 CosyVoice3 base 是 1.21 / 78.0——短音频零样本克隆不是它的赛道,它该被比的三项是单次能生成多长、能不能保持 4 个说话人不串、能不能一遍处理 1 小时会议音频,这三项开源侧几乎找不到对手。边界:TTS 无官方推理路径;MIT 覆盖代码不覆盖模型页的使用限制;长音频的失败是全局的,90 分钟单遍没有坏一段重跑一段的补救面;官方在 Risks and Limitations 里点名深度伪造并要求披露 AI 参与。置信度 B(confirmed):确认的是帧率换算、各产品线公开上限、代码下架与许可边界这些可核对的文档事实,不是音质。

90 / 60 min单次长音频上限(TTS 4 说话人 / ASR 单遍)已确认 · 2026-09
研究Microsoft官网Repo
VibeVoice:7.5Hz 帧率换来 90 分钟单遍语音
语音与音频影音创作梯顶A

Kokoro-82M:1000 美元训出来的 Apache-2.0 TTS

hexgrad 发布的开放权重 TTS 模型,82M 参数,Apache-2.0,仓库 hexgrad/kokoro(9,061★,本站 2026-09-29 经 GitHub API 核)。本站把它列为音频域的成本下限与许可下限:它最值得被记住的不是某个榜的名次,而是把「一次 TTS 部署到底要花多少钱」公开算了一遍。训练成本合计 1000 美元——v0.19 与 v1.0 各 500 个 A100 80GB GPU 小时;v0.19(2024-12-25)训练数据不足 100 小时、1 种语言 10 个音色,v1.0(2025-01-27)是几百小时、8 种语言 54 个音色。价格侧有两个相互独立的第三方来源指向同一量级:ArtificialAnalysis 记录的 Replicate 价 65 美分/百万字符,DeepInfra 标价 80 美分/百万字符,折合约每小时成品音频 3 到 5 美分。这条价格线是本站音频域选型比较的参照下限:高于它的部分,买的是音色克隆、方言覆盖、情感控制、流式延迟或合规背书,而不是「能不能听」。技术形态是 StyleTTS 2 + ISTFTNet 的 decoder-only(无扩散、encoder 未发布),G2P 走作者自维护的 misaki 库,系统侧依赖 espeak-ng,输出 24kHz;输入文本支持内联音素覆盖(形如 [Kokoro](/kˈOkəɹO/)),与 CosyVoice 3 的拼音/CMU 音素级发音修正是同一类思路——把「读错」从概率问题变成声明式配置,只是作用域是词而不是整段韵律。反过来 decoder-only 也决定了它没有零样本音色克隆:54 个音色是训练进去的,给参考音频不会长出新声音,这不是缺陷而是分工。合规披露在 TTS 领域几乎找不到第二份这么细:模型卡声明只用许可宽松或无版权的音频训练,逐类列出公有领域、Apache/MIT 许可与由闭源 TTS 生成的合成音频,并明确排除「来自开源 TTS 模型的合成音频」与「自定义音色克隆」;CC BY 部分单列署名表,模型 SHA256 也公开,所以你能校验自己下到的是不是同一个权重。边界:不克隆音色,参考音频驱动的场景直接出局;24kHz 够播报与朗读、不够音乐级母带;8 种语言 54 个音色在 v1.0 之后没有继续扩,中文可用度要自己试听;项目基本停更(最近 push 2025-08-06),遇到 bug 只能自己改;它的知名度已经长出钓鱼面,模型卡点名 kokorottsai_com 等根域带 kokoro 的站点与本项目无关,真正的入口只有 HF 的 hexgrad/Kokoro-82M 与 GitHub 的 hexgrad/kokoro,不要在搜索结果首页的「Kokoro 官网」上付钱。置信度 B(confirmed):确认的是成本与市场价格这条有第三方独立来源的证据链,不是音质。

<$1API 市场价(每百万字符,2025-04 模型卡口径)已确认 · 2025-04
产品hexgrad官网Repo
Kokoro-82M:1000 美元训出来的 Apache-2.0 TTS
语音与音频影音创作梯顶C

Fun-CosyVoice3-0.5B:把可控性做成接口的开源 TTS

阿里通义 FunAudioLLM 的第三代 LLM 式语音合成系统,0.5B 参数,发布号 Fun-CosyVoice3-0.5B-2512,一次放出 base 与 RL 两档权重加训练与推理脚本;代码仓已迁到 QwenAudio/CosyVoice(Apache-2.0,23,794★,本站 2026-09-29 经 GitHub API 核)。本站把它列为音频域开源语音方向的梯顶,依据不是「最像人」,而是它给生产环境里 TTS 的四类真实故障各配了一个显式接口:多音字读错走发音修正(中文拼音与英文 CMU 音素直接写进输入);数字符号读法不对走自带文本归一化;长句崩掉走 RAS 重复感知采样;要低延迟走双向流式,官方首包 150ms,量级上能直接接进实时对话 agent。指标要读准三件事:test-zh 说话人相似度 78.0 是 0.5B 开源档最高、超过人类基线 75.5,但仍低于闭源 Seed-TTS 的 79.6,「开源第一」成立而「全球第一」不成立;test-hard 才是它的强项,base 6.71 / RL 5.44 全表最低、好过闭源 Seed-TTS 的 7.59,而 hard 集放的是长句与绕口令,这一列领先直接对应真实稿件的可用性;英文要打折看,base 的 test-en 相似度 71.8 低于人类基线 73.4,只有 RL 档的 WER 1.68 才追回来。base 与 RL 是同一架构的两个后训练权重:三处错误率全线下降(zh CER 降 33%、hard CER 降 19%),三处相似度小幅回落,播报与客服这类读错一个字就是事故的场景这笔交易划算,给特定 IP 配音的保真场景要先试听 RL 档。仓库同时放出 GRPO 训练脚本与 triton + TensorRT-LLM 运行时(官方称 4 倍加速),后训练是别人能接着跑的路径;语言面覆盖 9 种语言与 18 种以上中文方言口音,方言档是闭源 API 至今几乎不给的能力。边界:许可分两层,代码 Apache-2.0 但权重条款以模型页为准,商用前必须单独确认;全部读数出自作者自评测,没有第三方盲听榜可交叉验证,本站未复算;零样本克隆的相似度取自标准评测集,真实业务里参考录音的底噪与风格直接决定成品。置信度 C(厂商宣称)。

78.0test-zh 说话人相似度(0.5B 开源档,人类基线 75.5)厂商宣称 · 2025-12
产品Alibaba Tongyi FunAudioLLM (QwenAudio)官网Repo
Fun-CosyVoice3-0.5B:把可控性做成接口的开源 TTS