Kokoro-82M:1000 美元训出来的 Apache-2.0 TTS
kokoro-82m
hexgrad 发布的开放权重 TTS 模型,82M 参数,Apache-2.0,仓库 hexgrad/kokoro(9,061★,本站 2026-09-29 经 GitHub API 核)。本站把它列为音频域的成本下限与许可下限:它最值得被记住的不是某个榜的名次,而是把「一次 TTS 部署到底要花多少钱」公开算了一遍。训练成本合计 1000 美元——v0.19 与 v1.0 各 500 个 A100 80GB GPU 小时;v0.19(2024-12-25)训练数据不足 100 小时、1 种语言 10 个音色,v1.0(2025-01-27)是几百小时、8 种语言 54 个音色。价格侧有两个相互独立的第三方来源指向同一量级:ArtificialAnalysis 记录的 Replicate 价 65 美分/百万字符,DeepInfra 标价 80 美分/百万字符,折合约每小时成品音频 3 到 5 美分。这条价格线是本站音频域选型比较的参照下限:高于它的部分,买的是音色克隆、方言覆盖、情感控制、流式延迟或合规背书,而不是「能不能听」。技术形态是 StyleTTS 2 + ISTFTNet 的 decoder-only(无扩散、encoder 未发布),G2P 走作者自维护的 misaki 库,系统侧依赖 espeak-ng,输出 24kHz;输入文本支持内联音素覆盖(形如 [Kokoro](/kˈOkəɹO/)),与 CosyVoice 3 的拼音/CMU 音素级发音修正是同一类思路——把「读错」从概率问题变成声明式配置,只是作用域是词而不是整段韵律。反过来 decoder-only 也决定了它没有零样本音色克隆:54 个音色是训练进去的,给参考音频不会长出新声音,这不是缺陷而是分工。合规披露在 TTS 领域几乎找不到第二份这么细:模型卡声明只用许可宽松或无版权的音频训练,逐类列出公有领域、Apache/MIT 许可与由闭源 TTS 生成的合成音频,并明确排除「来自开源 TTS 模型的合成音频」与「自定义音色克隆」;CC BY 部分单列署名表,模型 SHA256 也公开,所以你能校验自己下到的是不是同一个权重。边界:不克隆音色,参考音频驱动的场景直接出局;24kHz 够播报与朗读、不够音乐级母带;8 种语言 54 个音色在 v1.0 之后没有继续扩,中文可用度要自己试听;项目基本停更(最近 push 2025-08-06),遇到 bug 只能自己改;它的知名度已经长出钓鱼面,模型卡点名 kokorottsai_com 等根域带 kokoro 的站点与本项目无关,真正的入口只有 HF 的 hexgrad/Kokoro-82M 与 GitHub 的 hexgrad/kokoro,不要在搜索结果首页的「Kokoro 官网」上付钱。置信度 B(confirmed):确认的是成本与市场价格这条有第三方独立来源的证据链,不是音质。
- 置信度
- 已确认
- ≥2 个独立来源,或本站 harness 复现通过
- 关键指标
- API 市场价(每百万字符,2025-04 模型卡口径)
- 已确认 · 2025-04
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断我们给它 B 档(confirmed),但要说清 confirmed 的是哪一条:不是音质,而是成本。模型卡自己给出了 2025 年 4 月的市场口径——按 API 提供 Kokoro 的价格低于每百万字符 1 美元,折合约每小时音频输出低于 0.06 美元(平均 1000 字符输入约 1 分钟输出),并附了两个相互独立的来源:ArtificialAnalysis 记录的 Replicate 价 65 美分/百万字符,以及 DeepInfra 上
hexgrad/Kokoro-82M的 80 美分/百万字符。两个独立第三方定价指向同一个量级,这一条按契约可以升 B。仓库 9,061★、Apache-2.0(本站 2026-09-29 经 GitHub API 核)。音质部分我们只转述、不复算,也没有做过盲听。它在音频域梯顶扮演的角色与其它行不同:它是这个域的成本下限与许可下限。选 TTS 时最容易犯的错是拿旗舰模型的指标去做全场景预算,而真实世界里大量需求(通知播报、无障碍朗读、内部工具、边缘设备)根本不需要克隆音色,只需要「便宜、可商用、能自托管、不出错」。Kokoro 用 82M 参数、约 1000 美元训练成本(1000 个 A100-80GB GPU 小时,v0.19 与 v1.0 各 500 小时,均价约 1 美元/小时)把这条线钉住了。有了这个下限,再去评估 Eleven v4 或 CosyVoice 3 这类旗舰时,你才知道自己多付的钱买的是什么。
第二个理由是训练数据的合规可审计性,这在 TTS 领域几乎是唯一的。模型卡明写训练只用了「许可宽松/无版权」的音频与 IPA 音素标注,并逐类列出:公有领域音频、Apache/MIT 等许可的音频、以及由大厂商闭源 TTS 模型生成的合成音频(引用了美国版权局的 AI 政策指引),同时明确排除「来自开源 TTS 模型的合成音频」与「自定义音色克隆」。它还给了一张 CC BY 署名表,写明 Koniwa 的
tnc(不足 1 小时,CC BY 3.0)与 SIWIS(不足 11 小时,CC BY 4.0)分别在 2024-11-22 之后并入训练集。对企业采购来说,这套披露比一句「遵循相关法规」有用得多——它让你能自己判断风险,而不是替你判断。三条边界。一,它不做音色克隆:架构是 StyleTTS 2 + ISTFTNet 的 decoder-only(无扩散、encoder 未发布),v1.0 提供 8 种语言 54 个固定音色,你只能选,不能给它一段参考音频让它学一个新声音。这是它与 CosyVoice 3、Eleven v4 的根本分工差异,不是能力落后。二,开发节奏已经慢下来:仓库最近一次 push 是 2025-08-06,选型时要接受这是一个基本停止迭代的成熟小模型,而不是一个还在长的项目。三,它的知名度已经长出钓鱼面:模型卡专门挂了一段警告,说
kokorottsai_com、kokorotts_net这类根域里带 kokoro 的站点与本模型及其作者没有任何关系,并附了存档快照。这条对本站读者有实操意义:自托管走 HF 权重与pip install kokoro,不要在搜索引擎首页的「Kokoro 官网」上付钱。
它解决的问题:当模型免费时,一次 TTS 部署到底要花多少钱
Kokoro 是 hexgrad 发布的开放权重 TTS 模型,82M 参数,Apache-2.0,仓库 hexgrad/kokoro(9,061★,最近 push 2025-08-06,本站经 GitHub API 核)。模型卡的自我陈述很克制:尽管架构轻量,它的质量与大得多的模型相当,同时显著更快、更省钱;权重是 Apache 许可,所以从生产环境到个人项目都能部署。v1.0 于 2025-01-27 发布,训练数据是几百小时量级,提供 8 种语言 54 个音色;上一版 v0.19(2024-12-25)只有 1 种语言 10 个音色、训练数据不足 100 小时。
它最值得被记住的不是某一榜的名次,而是把「TTS 的成本结构」公开算了一遍:
| 项 | v0.19 | v1.0 | 合计 |
|---|---|---|---|
| A100 80GB GPU 小时 | 500 | 500 | 1000 |
| 均价 | $0.80/小时 | $1.20/小时 | 约 $1/小时 |
| 美元 | $400 | $600 | $1000 |
| 训练数据 | <100 小时 | 几百小时 | - |
| 语言 / 音色 | 1 / 10 | 8 / 54 | - |
1000 美元训练出一个被大量商业 API 采用的模型,这件事的行业意义在于它把「训一个能用的 TTS」从大厂专属变成个人可及。模型卡的致谢里也记着这条线是怎么被看见的:感谢 @Pendrokar 把 Kokoro 加进 TTS Spaces Arena 当竞争者,感谢所有贡献合成训练数据的人与算力赞助者。它由 Discord 上的 @rzvzn 训练,架构出自 Li 等人的 StyleTTS 2,基座是 yl4579/StyleTTS2-LJSpeech。
市场价格:两个独立来源指向同一个量级
模型卡在 2025 年 4 月给出的口径是:按 API 提供 Kokoro 的市场价低于每百万字符 1 美元,折合约每小时音频输出低于 0.06 美元(平均 1000 字符输入约 1 分钟输出)。两个来源相互独立:
- ArtificialAnalysis 记录的 Replicate 价:65 美分 / 百万字符;
- DeepInfra 上
hexgrad/Kokoro-82M的标价:80 美分 / 百万字符。
把这两个数换算成业务语言:一小时成品音频的语音成本约 3 到 5 美分。这条价格线是本站在音频域做选型比较时的参照下限——高于它的部分,买的是音色克隆、方言覆盖、情感控制、流式延迟或者合规背书,而不是「能不能听」。
技术形态:decoder-only,所以它不克隆音色
架构是 StyleTTS 2 + ISTFTNet,decoder-only:没有扩散,encoder 也没有发布。G2P(字素到音素)走作者自己维护的 misaki 库,系统侧依赖 espeak-ng,输出采样率 24kHz。最小可跑代码就这几行:
pip install "kokoro>=0.9.2" soundfile
apt-get -qq -y install espeak-ng
from kokoro import KPipeline
import soundfile as sf
pipeline = KPipeline(lang_code="a") # 语言码,a = 美式英语
text = "Kokoro is an open-weight TTS model with 82 million parameters."
generator = pipeline(text, voice="af_heart") # 54 个固定音色之一
for i, (gs, ps, audio) in enumerate(generator):
sf.write(f"{i}.wav", audio, 24000)
这里有个容易被忽略的设计:输入文本里可以内联音素覆盖([Kokoro](/kˈOkəɹO/)),即在不改模型的前提下钉死某个词的读法。它与 CosyVoice 3 的拼音/CMU 音素级发音修正是同一类思路——都是把「读错」从概率问题变成声明式配置,只是 Kokoro 的作用域是词,而不是整段韵律。反过来,decoder-only 也决定了它没有零样本音色克隆:54 个音色是训练进去的,给一段参考音频不会长出新声音。这不是缺陷,是分工。
训练数据:一张可以被审计的合规表
模型卡对数据来源的披露在 TTS 领域几乎找不到第二份这么细的。它声明 Kokoro 只用许可宽松/无版权的音频与 IPA 音素标注训练,并举例三类:公有领域音频、Apache/MIT 等许可的音频、以及由大厂商闭源 TTS 模型生成的合成音频(脚注引了美国版权局的 AI 政策指引),第二个脚注明确写着「不使用来自开源 TTS 模型的合成音频,也不使用自定义音色克隆」。CC BY 部分单独给了一张署名表:
| 音频数据 | 使用时长 | 许可 | 并入训练集的时间 |
|---|---|---|---|
Koniwa tnc | <1 小时 | CC BY 3.0 | v0.19 之后 / 2024-11-22 |
| SIWIS | <11 小时 | CC BY 4.0 | v0.19 之后 / 2024-11-22 |
模型 SHA256 也公开(496dba11...),意味着你能校验自己下到的是不是同一个权重。对合规敏感的采购方,这三件事——数据来源分类、署名表、权重哈希——合起来才是「Apache-2.0」这四个字的实际含金量。
边界与失败模式
五条。不克隆音色:需要参考音频驱动的场景直接出局,看 CosyVoice 3(开源)或 Eleven v4(闭源)。24kHz 输出:够播报与朗读,不够音乐级母带;需要 48kHz 的场景要么后期重采样,要么换模型。语言与音色是封闭集合:8 种语言 54 个音色,v1.0 之后没有继续扩,中文等非英语语种的实际可用度要自己试听。项目基本停更:最近一次 push 是 2025-08-06,不会有新特性,好处是稳定、坏处是遇到 bug 只能自己改。钓鱼站:模型卡点名 kokorottsai_com、kokorotts_net 这类根域带 kokoro 的站点与本模型及作者无关(附了 archive.ph 快照),并说任何暗示有关联的表述都是危险信号。真正的入口只有两个:Hugging Face 的 hexgrad/Kokoro-82M 与 GitHub 的 hexgrad/kokoro。