☰
FireRedTTS3是什么?24语言+21中文方言开源TTS语音克隆系统完整介绍
2026/10/11 19:20:02 网站建设 项目流程

【免费下载链接】FireRedTTS3

FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing

项目地址:https://gitcode.com/gh_mirrors/fi/FireRedTTS3
点击查看免费下载

FireRedTTS3是一个开箱即用的开源TTS 语音克隆系统,一套模型同时搞定24 种语言+21 种中文方言的零样本声音克隆,还支持用自然语言"设计"全新音色、对已有录音做内容级编辑。基于 Apache-2.0 许可免费使用,本文带你从零部署到实战,附完整功能、架构与源码导读。

🔥 FireRedTTS3 核心功能一览:克隆 + 设计 + 编辑

FireRedTTS3 提供两个变体,覆盖绝大多数 TTS 场景:

变体能力适用场景
FireRedTTS3-Base24 语言 + 21 方言零样本语音克隆有声书、多语种配音、方言内容
FireRedTTS3-Instruct语音克隆 + 自然语言音色设计 + 语音编辑定制音色、后期改词、调语速

✨四大亮点:

  • 🌍24 种语言:中文、英语、日语、韩语、粤语、阿拉伯语、法语、德语、俄语、西班牙语、泰语、越南语、印地语……覆盖全球主流语种
  • 🗣️21 种中文方言:四川话、粤语、闽南话、上海话、天津话、辽宁话、湖北话、广东(福建)等,地道方言腔调
  • 🎨自然语言音色设计:无需参考音频,一句"温柔的年轻女声、语速稍慢"即可生成全新音色
  • ✂️自由语音编辑:对录音插入/删除/替换词句,或调整语速、音高、音量

🏗️ 技术架构揭秘:连续语音表示驱动语音克隆

FireRedTTS3 的核心创新是语义富集的连续语音表示(RedAE Tokenizer)。与传统"离散 token"路线不同,它把 24kHz 音频压缩成 25Hz 的连续潜变量,再由Qwen3-1.7B主干 Transformer +DiT(扩散 Transformer)解码头逐块自回归还原波形,兼顾自然度与可控性。

上图左半为RedAE Tokenizer(连续语音编码器 + 语义蒸馏),中间是FireRedTTS3-Base克隆管线,右侧是FireRedTTS3-Instruct指令驱动管线。

主干模型细节可参考 fireredtts3/llm/fireredtts3_base.py 中的 Qwen3-1.7B 配置,以及 fireredtts3/redae/redae.py 的连续表示编码器。

🚀 快速开始:3步部署开源TTS语音克隆系统

第一步:克隆仓库并安装依赖

git clone https://gitcode.com/gh_mirrors/fi/FireRedTTS3.git cd FireRedTTS3 pip install -r requirements.txt

第二步:下载预训练模型

将模型下载到pretrained_models/目录(约需数 GB 磁盘空间):

pip install "huggingface_hub[cli]" hf download FireRedTeam/FireRedTTS3 --local-dir pretrained_models/

第三步:启动 Gradio 图形界面(最易上手)

pip install gradio # 零样本语音克隆 python gradio_base.py --host "0.0.0.0" --port 7860 # 音色设计 + 语音编辑 python gradio_instruct.py --host "0.0.0.0" --port 7860

浏览器打开http://localhost:7860即可拖入音频、选择语言、一键合成。

🎙️ 零样本语音克隆实战:24语言+21方言一句话生成

克隆效果的关键:参考音频的语种/方言最好与目标一致。合成四川话就用四川话参考音频,合成日语就用日语参考音频。

import torchaudio from fireredtts3.core import FireRedTTS3 tts = FireRedTTS3("pretrained_models", use_wetext=True) prompt_audio, prompt_audio_sr = torchaudio.load("prompt.wav") gen_audio, gen_audio_sr = tts.generate( language="Chinese", # 传 None 可自动检测语种 prompt_text="参考音频对应的文字", prompt_audio=prompt_audio, prompt_audio_sr=prompt_audio_sr, text="今天天气很好,我们一起去公园散步吧。", ) torchaudio.save("gen.wav", gen_audio.cpu(), gen_audio_sr)

💡 系统会自动完成文本清洗 → 语种判定 → 长文拆句 → 逐句合成 → 淡入淡出拼接,长文本无需手动切分。完整前端逻辑见 fireredtts3/core.py。

🎨 Instruct 高级玩法:自然语言音色设计与语音编辑

FireRedTTS3-Instruct 用一个入口统一了四类任务:

方法作用示例指令
generate_tts零样本克隆参考音频 + 文本
generate_voice_design自然语言音色设计"温柔的年轻女声,语速稍慢"
generate_semantic_edit内容级编辑"把 cats 换成 dogs"
generate_acoustic_edit声学编辑"adjust the speed to 0.5x"
from fireredtts3.core import FireRedTTS3Instruct instruct = FireRedTTS3Instruct("pretrained_models", use_wetext=True) # 音色设计:无需参考音频 gen_audio, gen_audio_sr, plan = instruct.generate_voice_design( instruction="一个年轻女性的温柔嗓音,语速稍慢,带一点俏皮。", text="今天天气很好,我们一起去公园散步吧。", ) print("音色规划:", plan)

📌 声学编辑需遵循训练模板:语速adjust the speed to X、音高shift the pitch by N steps、音量adjust the volume to X。API 细节见 fireredtts3/core.py。

🖥️ Gradio 图形界面体验:多语种方言TTS在线演示

左侧是Base 多语种/方言克隆界面(选语言、上传参考音频、输入文本),右侧是Instruct 音色设计与语音编辑界面(可切换 Semantic / Acoustic 两种编辑模式)。界面脚本位于 gradio_base.py 与 gradio_instruct.py。

📊 性能表现:语音克隆质量评测对比

FireRedTTS3 在主流评测集上表现领先:

  • Seed-TTS-eval(克隆质量):平均 WER/CER3.04%、平均说话人相似度78.8%,双双第一
  • MiniMax-MLS-Test(24 语言多语克隆):平均 WER/CER3.75%、平均相似度84.8%,均为最优

相比 CosyVoice3、IndexTTS2、VoxCPM2 等开源方案,在准确率与音色相似度上均有明显优势。

📂 项目结构与源码导读

路径说明
fireredtts3/core.py合成主入口,含文本前端 + 4 类任务
fireredtts3/llm/fireredtts3_base.pyBase 克隆模型
fireredtts3/llm/fireredtts3_instruct.pyInstruct 指令模型
fireredtts3/llm/dit.py扩散 Transformer 解码头
fireredtts3/llm/patch_encoder.py块级编码器
fireredtts3/redae/redae.pyRedAE 连续语音表示
fireredtts3/campp/campp.pyCAM++ 说话人嵌入提取
fireredtts3/utils/text_normalize.py文本规整前端(wetext / LLM TN)

依赖清单见 requirements.txt,许可见 LICENSE(Apache-2.0)。

⚠️ 常见问题与使用注意事项

  • 🔊 克隆效果不理想?优先选择与目标语种/方言一致的参考音频,并使用清晰干声
  • 🌐 其他语言的文本规整?默认 wetext 只支持中英/粤语,多语种可开启use_llm_tn=True(需配置 LLM API)
  • 🛡️ 合规提示:零样本克隆能力仅限学术研究,请勿用于任何非法用途

总结

FireRedTTS3 把24 语言 + 21 方言的语音克隆、自然语言音色设计、自由语音编辑收敛到一个开源模型里,Apache-2.0 许可、提供 Gradio 界面与 Python API,是个人开发者与研究者快速上手多语种 TTS 的完整方案。

【免费下载链接】FireRedTTS3

FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing

项目地址:https://gitcode.com/gh_mirrors/fi/FireRedTTS3
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询