Kokoro-82M:1000 美元训出来的 Apache-2.0 TTS
hexgrad 发布的开放权重 TTS 模型,82M 参数,Apache-2.0,仓库 hexgrad/kokoro(9,061★,本站 2026-09-29 经 GitHub API 核)。本站把它列为音频域的成本下限与许可下限:它最值得被记住的不是某个榜的名次,而是把「一次 TTS 部署到底要花多少钱」公开算了一遍。训练成本合计 1000 美元——v0.19 与 v1.0 各 500 个 A100 80GB GPU 小时;v0.19(2024-12-25)训练数据不足 100 小时、1 种语言 10 个音色,v1.0(2025-01-27)是几百小时、8 种语言 54 个音色。价格侧有两个相互独立的第三方来源指向同一量级:ArtificialAnalysis 记录的 Replicate 价 65 美分/百万字符,DeepInfra 标价 80 美分/百万字符,折合约每小时成品音频 3 到 5 美分。这条价格线是本站音频域选型比较的参照下限:高于它的部分,买的是音色克隆、方言覆盖、情感控制、流式延迟或合规背书,而不是「能不能听」。技术形态是 StyleTTS 2 + ISTFTNet 的 decoder-only(无扩散、encoder 未发布),G2P 走作者自维护的 misaki 库,系统侧依赖 espeak-ng,输出 24kHz;输入文本支持内联音素覆盖(形如 [Kokoro](/kˈOkəɹO/)),与 CosyVoice 3 的拼音/CMU 音素级发音修正是同一类思路——把「读错」从概率问题变成声明式配置,只是作用域是词而不是整段韵律。反过来 decoder-only 也决定了它没有零样本音色克隆:54 个音色是训练进去的,给参考音频不会长出新声音,这不是缺陷而是分工。合规披露在 TTS 领域几乎找不到第二份这么细:模型卡声明只用许可宽松或无版权的音频训练,逐类列出公有领域、Apache/MIT 许可与由闭源 TTS 生成的合成音频,并明确排除「来自开源 TTS 模型的合成音频」与「自定义音色克隆」;CC BY 部分单列署名表,模型 SHA256 也公开,所以你能校验自己下到的是不是同一个权重。边界:不克隆音色,参考音频驱动的场景直接出局;24kHz 够播报与朗读、不够音乐级母带;8 种语言 54 个音色在 v1.0 之后没有继续扩,中文可用度要自己试听;项目基本停更(最近 push 2025-08-06),遇到 bug 只能自己改;它的知名度已经长出钓鱼面,模型卡点名 kokorottsai_com 等根域带 kokoro 的站点与本项目无关,真正的入口只有 HF 的 hexgrad/Kokoro-82M 与 GitHub 的 hexgrad/kokoro,不要在搜索结果首页的「Kokoro 官网」上付钱。置信度 B(confirmed):确认的是成本与市场价格这条有第三方独立来源的证据链,不是音质。