Fun-CosyVoice3-0.5B:把可控性做成接口的开源 TTS
阿里通义 FunAudioLLM 的第三代 LLM 式语音合成系统,0.5B 参数,发布号 Fun-CosyVoice3-0.5B-2512,一次放出 base 与 RL 两档权重加训练与推理脚本;代码仓已迁到 QwenAudio/CosyVoice(Apache-2.0,23,794★,本站 2026-09-29 经 GitHub API 核)。本站把它列为音频域开源语音方向的梯顶,依据不是「最像人」,而是它给生产环境里 TTS 的四类真实故障各配了一个显式接口:多音字读错走发音修正(中文拼音与英文 CMU 音素直接写进输入);数字符号读法不对走自带文本归一化;长句崩掉走 RAS 重复感知采样;要低延迟走双向流式,官方首包 150ms,量级上能直接接进实时对话 agent。指标要读准三件事:test-zh 说话人相似度 78.0 是 0.5B 开源档最高、超过人类基线 75.5,但仍低于闭源 Seed-TTS 的 79.6,「开源第一」成立而「全球第一」不成立;test-hard 才是它的强项,base 6.71 / RL 5.44 全表最低、好过闭源 Seed-TTS 的 7.59,而 hard 集放的是长句与绕口令,这一列领先直接对应真实稿件的可用性;英文要打折看,base 的 test-en 相似度 71.8 低于人类基线 73.4,只有 RL 档的 WER 1.68 才追回来。base 与 RL 是同一架构的两个后训练权重:三处错误率全线下降(zh CER 降 33%、hard CER 降 19%),三处相似度小幅回落,播报与客服这类读错一个字就是事故的场景这笔交易划算,给特定 IP 配音的保真场景要先试听 RL 档。仓库同时放出 GRPO 训练脚本与 triton + TensorRT-LLM 运行时(官方称 4 倍加速),后训练是别人能接着跑的路径;语言面覆盖 9 种语言与 18 种以上中文方言口音,方言档是闭源 API 至今几乎不给的能力。边界:许可分两层,代码 Apache-2.0 但权重条款以模型页为准,商用前必须单独确认;全部读数出自作者自评测,没有第三方盲听榜可交叉验证,本站未复算;零样本克隆的相似度取自标准评测集,真实业务里参考录音的底噪与风格直接决定成品。置信度 C(厂商宣称)。