三大基准深度解读:Raon-OpenTTS-1B凭什么以1.78% WER登顶零样本TTS榜单?
【免费下载链接】Raon-OpenTTS-1B项目地址: https://ai.gitcode.com/hf_mirrors/KRAFTON/Raon-OpenTTS-1B
Raon-OpenTTS-1B 是一款完全开源(开放权重 + 开放数据)的 10 亿参数零样本 TTS(文字转语音)模型。它在三大基准中以 1.78% 的 WER(词错误率)和 0.749 的说话人相似度领跑开源阵营,性能比肩用数百万小时私有数据训练的闭源 SOTA。本文带你逐张榜单拆解,并讲清它凭什么这么强。
一、30秒入门:什么是零样本 TTS?
一句话理解:给几秒钟的参考人声,模型就能立刻用这个人的音色朗读任意文本,无需任何训练。
- 零样本声音克隆:模型从参考音频中直接"学会"目标音色,换个句子照样说得像;
- WER(词错误率):合成语音念错的词占比,越低越好,相当于"朗读准确率"考试;
- SIM(说话人相似度):生成语音与参考语音的音色接近度,越高越好。
这两个指标一起回答核心问题:读得准不准?像不像那个人?
二、Seed-TTS-Eval:1.78% WER,开源模型第一 🏆
Seed-TTS-Eval 是目前公认的零样本 TTS 标准考卷。关键成绩如下(完整数据见 README.md):
| 模型 | 参数量 | WER(越低越好) | SIM(越高越好) |
|---|---|---|---|
| 人类参考 | - | 2.14 | 0.734 |
| Qwen3-TTS | 1.7B | 1.46 | 0.715 |
| Raon-OpenTTS-1B | 1.0B | 1.78 | 0.749 |
| VoxCPM | 0.5B | 1.98 | 0.730 |
| F5-TTS | 0.3B | 2.04 | 0.671 |
| Raon-OpenTTS-0.3B | 0.3B | 1.95 | 0.687 |
三个看点:
- WER 1.78% 位列全部开源数据模型第一,仅次于 Qwen3-TTS(1.46%),明显领先 F5-TTS 同门(2.04%)与 VoxCPM(1.98%);
- SIM 0.749 超越所有开源模型,仅与闭源标杆 Seed-TTS(0.762)相差一线;
- 小一号的 0.3B 版本也有 1.95% WER,说明这套开放数据的质量足够稳定。
三、CV3-Eval:难例集 3.92% WER,4项指标拿下3个第一 📊
CV3-Eval 更"刁钻"——它的 CV3-Hard-EN 子集专门用高难度内容给模型上压力:
| 模型 | CV3-EN WER | Hard-EN WER | Hard SIM | Hard DNSMOS |
|---|---|---|---|---|
| Raon-OpenTTS-1B | 3.92 | 6.15 | 0.775 | 3.85 |
| Qwen3-TTS | 4.52 | 7.89 | 0.666 | 3.87 |
| VoxCPM | 5.24 | 6.44 | 0.670 | 3.78 |
| CosyVoice 3 | 4.96 | 10.77 | 0.740 | 3.98 |
| CosyVoice 2 | 6.27 | 10.28 | 0.710 | 3.95 |
- 难例集 WER6.15% 全场第一,比 CosyVoice 3(10.77%)低 43%;
- 音色相似度 0.775大幅领先(第二名 0.740);
- 感知质量 DNSMOS 3.85 与头部模型基本持平。
越难的题分数越高——这就是"登顶"的底气。
四、Raon-OpenTTS-Eval:嘈杂环境 2.81%,综合最稳 💪
这是 KRAFTON 自建的"真实世界压力测试":覆盖 Clean / Noisy / Wild / Expressive 四大声学场景,12 个数据集、6000 组参考音频+文本配对,专治"参考音频带噪音、带情绪"这类棘手情况:
| 模型 | Clean WER | Noisy WER | Wild WER | Expr. WER | 综合 WER | 综合 SIM |
|---|---|---|---|---|---|---|
| Raon-OpenTTS-1B | 1.44 | 3.51 | 5.61 | 2.77 | 2.81 | 0.695 |
| CosyVoice 3 | 2.53 | 3.69 | 8.31 | 5.49 | 4.43 | 0.647 |
| VoxCPM | 2.24 | 3.42 | 43.83 | 2.66 | 9.48 | 0.642 |
| Qwen3-TTS | 3.38 | 4.60 | 79.14 | 5.81 | 17.59 | 0.626 |
| F5-TTS | 2.17 | 3.82 | 136.03 | 3.46 | 25.08 | 0.542 |
重点看 "Wild"(野外/无控制)一列:F5-TTS 的 WER 飙到 136%,而 Raon-OpenTTS-1B 稳在 5.61%。12 个分项中拿下 9 项第一——这是"跨声学条件稳健"最硬的证据。
五、凭什么这么强?三个核心原因 🧠
510K 小时开放训练数据:训练自 Raon-OpenTTS-Core 数据集(从 615K 小时、11 个英文语音数据集的 Pool 中,用 DNSMOS 音质 + WER + VAD 三重排名筛选而来)。"吃得好"是第一前提。
F5-TTS 的 DiT 架构:1B 参数的 Diffusion Transformer(扩散 Transformer + 流匹配),核心超参如 dim=1408、depth=28、heads=24 等记录在 config.yaml 中,在零样本语音合成上效率出色。
大规模训练:48 张 NVIDIA B200 GPU、520K 更新步数、AdamW 优化器(峰值学习率 1e-4、50K 步预热、线性衰减),对应的权重文件即 model_520000.pt(520K 步检查点)。
六、模型文件速览 📁
| 文件 | 说明 |
|---|---|
| model_520000.pt | 1B 参数模型权重(520K 步检查点) |
| config.yaml | 模型架构与音频参数(16kHz、80 通道 mel 谱、HiFi-GAN 声码器) |
| vocab.txt | 文本分词器词表 |
| README.md | 项目说明、听觉演示与完整基准数据 |
⚠️许可提醒:模型以 CC BY-NC 4.0 协议发布,仅限非商业用途。
七、总结 ✅
- 准确率:Seed-TTS-Eval WER 1.78%,开源模型第一;
- 克隆度:三大基准综合 SIM 第一,CV3-Hard 音色相似度 0.775 大幅领先;
- 鲁棒性:Raon-OpenTTS-Eval 综合 WER 2.81%,嘈杂/野外环境依然第一;
- 全开放:权重与 510K 小时训练数据均公开,可复现 TTS 研究。
如果你正在找一个"拿来就能用"的零样本语音合成方案,Raon-OpenTTS-1B 是当下最稳的开源选择之一。
【免费下载链接】Raon-OpenTTS-1B项目地址: https://ai.gitcode.com/hf_mirrors/KRAFTON/Raon-OpenTTS-1B
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考