三大基准深度解读:Raon-OpenTTS-1B凭什么以1.78% WER登顶零样本TTS榜单?
2026/8/26 15:02:31 网站建设 项目流程

三大基准深度解读:Raon-OpenTTS-1B凭什么以1.78% WER登顶零样本TTS榜单?

【免费下载链接】Raon-OpenTTS-1B项目地址: https://ai.gitcode.com/hf_mirrors/KRAFTON/Raon-OpenTTS-1B

Raon-OpenTTS-1B 是一款完全开源(开放权重 + 开放数据)的 10 亿参数零样本 TTS(文字转语音)模型。它在三大基准中以 1.78% 的 WER(词错误率)和 0.749 的说话人相似度领跑开源阵营,性能比肩用数百万小时私有数据训练的闭源 SOTA。本文带你逐张榜单拆解,并讲清它凭什么这么强。

一、30秒入门:什么是零样本 TTS?

一句话理解:给几秒钟的参考人声,模型就能立刻用这个人的音色朗读任意文本,无需任何训练。

  • 零样本声音克隆:模型从参考音频中直接"学会"目标音色,换个句子照样说得像;
  • WER(词错误率):合成语音念错的词占比,越低越好,相当于"朗读准确率"考试;
  • SIM(说话人相似度):生成语音与参考语音的音色接近度,越高越好

这两个指标一起回答核心问题:读得准不准?像不像那个人?

二、Seed-TTS-Eval:1.78% WER,开源模型第一 🏆

Seed-TTS-Eval 是目前公认的零样本 TTS 标准考卷。关键成绩如下(完整数据见 README.md):

模型参数量WER(越低越好)SIM(越高越好)
人类参考-2.140.734
Qwen3-TTS1.7B1.460.715
Raon-OpenTTS-1B1.0B1.780.749
VoxCPM0.5B1.980.730
F5-TTS0.3B2.040.671
Raon-OpenTTS-0.3B0.3B1.950.687

三个看点:

  1. WER 1.78% 位列全部开源数据模型第一,仅次于 Qwen3-TTS(1.46%),明显领先 F5-TTS 同门(2.04%)与 VoxCPM(1.98%);
  2. SIM 0.749 超越所有开源模型,仅与闭源标杆 Seed-TTS(0.762)相差一线;
  3. 小一号的 0.3B 版本也有 1.95% WER,说明这套开放数据的质量足够稳定。

三、CV3-Eval:难例集 3.92% WER,4项指标拿下3个第一 📊

CV3-Eval 更"刁钻"——它的 CV3-Hard-EN 子集专门用高难度内容给模型上压力:

模型CV3-EN WERHard-EN WERHard SIMHard DNSMOS
Raon-OpenTTS-1B3.926.150.7753.85
Qwen3-TTS4.527.890.6663.87
VoxCPM5.246.440.6703.78
CosyVoice 34.9610.770.7403.98
CosyVoice 26.2710.280.7103.95
  • 难例集 WER6.15% 全场第一,比 CosyVoice 3(10.77%)低 43%;
  • 音色相似度 0.775大幅领先(第二名 0.740);
  • 感知质量 DNSMOS 3.85 与头部模型基本持平。

越难的题分数越高——这就是"登顶"的底气。

四、Raon-OpenTTS-Eval:嘈杂环境 2.81%,综合最稳 💪

这是 KRAFTON 自建的"真实世界压力测试":覆盖 Clean / Noisy / Wild / Expressive 四大声学场景,12 个数据集、6000 组参考音频+文本配对,专治"参考音频带噪音、带情绪"这类棘手情况:

模型Clean WERNoisy WERWild WERExpr. WER综合 WER综合 SIM
Raon-OpenTTS-1B1.443.515.612.772.810.695
CosyVoice 32.533.698.315.494.430.647
VoxCPM2.243.4243.832.669.480.642
Qwen3-TTS3.384.6079.145.8117.590.626
F5-TTS2.173.82136.033.4625.080.542

重点看 "Wild"(野外/无控制)一列:F5-TTS 的 WER 飙到 136%,而 Raon-OpenTTS-1B 稳在 5.61%。12 个分项中拿下 9 项第一——这是"跨声学条件稳健"最硬的证据。

五、凭什么这么强?三个核心原因 🧠

510K 小时开放训练数据:训练自 Raon-OpenTTS-Core 数据集(从 615K 小时、11 个英文语音数据集的 Pool 中,用 DNSMOS 音质 + WER + VAD 三重排名筛选而来)。"吃得好"是第一前提。

F5-TTS 的 DiT 架构:1B 参数的 Diffusion Transformer(扩散 Transformer + 流匹配),核心超参如 dim=1408、depth=28、heads=24 等记录在 config.yaml 中,在零样本语音合成上效率出色。

大规模训练:48 张 NVIDIA B200 GPU、520K 更新步数、AdamW 优化器(峰值学习率 1e-4、50K 步预热、线性衰减),对应的权重文件即 model_520000.pt(520K 步检查点)。

六、模型文件速览 📁

文件说明
model_520000.pt1B 参数模型权重(520K 步检查点)
config.yaml模型架构与音频参数(16kHz、80 通道 mel 谱、HiFi-GAN 声码器)
vocab.txt文本分词器词表
README.md项目说明、听觉演示与完整基准数据

⚠️许可提醒:模型以 CC BY-NC 4.0 协议发布,仅限非商业用途

七、总结 ✅

  • 准确率:Seed-TTS-Eval WER 1.78%,开源模型第一;
  • 克隆度:三大基准综合 SIM 第一,CV3-Hard 音色相似度 0.775 大幅领先;
  • 鲁棒性:Raon-OpenTTS-Eval 综合 WER 2.81%,嘈杂/野外环境依然第一;
  • 全开放:权重与 510K 小时训练数据均公开,可复现 TTS 研究。

如果你正在找一个"拿来就能用"的零样本语音合成方案,Raon-OpenTTS-1B 是当下最稳的开源选择之一。

【免费下载链接】Raon-OpenTTS-1B项目地址: https://ai.gitcode.com/hf_mirrors/KRAFTON/Raon-OpenTTS-1B

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询