GPT-SoVITS 声音克隆版本指南:6 个版本怎么选
【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS
GPT-SoVITS 是一个开源的少样本语音合成与声音克隆工具,仅需 1 分钟人声数据就能微调出高相似度的专属 TTS 模型,5 秒音频甚至可以直接零样本体验。但项目已先后推出 v1、v2、v3、v4、v2Pro、v2ProPlus 六个版本,显存门槛、音质和推理速度各不相同——新手到底该选哪个?
📌 先给答案:三条推荐
- 低显存、先跑通流程:选v2。底模由 2k 小时扩展到 5k 小时,显存最省,生态与教程最全。
- 常规配置、追音质:选v4。原生 48kHz 输出、无金属音,是 v3 的直接替代。
- 直播或实时场景、追速度:选v2ProPlus。保留 v2 一系的推理速度,官方明确其性能超过 v4,并支持流式推理。
版本速览
| 版本 | 一句话定位 | 显存门槛(微调) | 适合谁 |
|---|---|---|---|
| v1 | 初代版本,2k 小时底模,中/英/日 | 低,老显卡可跑 | 存量老项目,新项目不推荐 |
| v2 | 5k 小时底模,新增韩语、粤语 | 低 | 新手首选、日常使用 |
| v3 | 相似度更高、情绪更丰富、支持 LoRA | 14GB;梯度检查点 12GB;LoRA 8GB | 追求音色相似度 |
| v4 | 修复 v3 金属音,原生 48kHz | 同 v3 | 已有 v3 用户、音质优先 |
| v2Pro | 性能超 v4,保留 v2 的硬件成本 | 比 v2 稍高 | 音质与性价比都要 |
| v2ProPlus | v2Pro 同族,推理更快 | 比 v2 稍高 | 实时合成、流式场景 |
v1/v2 输出 32kHz,v3 原生 24kHz(可用内置的 24k→48k 超分模型缓解偏闷),v4 原生 48kHz,v2Pro 系列回到 32kHz。
⚡ 按场景选版本
- 老显卡入门(8GB 左右):建议选 v2,显存占用最低、流程最完整。若硬要在 8GB 卡上练 v3,只有一条路:LoRA 微调,官方 2025.02 起支持 8G 显存完成,全量微调放不下。
- 追求音质上限(≥12GB 显卡):建议选 v4。它修复了 v3 非整数倍上采样带来的金属音,并原生输出 48kHz,不需要再挂超分模型。
- 训练录音质量一般(手机录、有底噪):建议选 v2 或 v2Pro。官方文档写明:平均音质较低的训练集上,v1/v2/v2Pro 效果较好,而 v3/v4 做不到;且 v3/v4 音色更偏向参考音频,而非整个训练集的风格。
- 直播、实时 TTS:建议选 v2ProPlus。它保住 v2 的推理速度,项目同时提供流式推理入口(GPT_SoVITS/stream_v2pro.py),适合低延迟场景。
- 已有 v3 存量项目:直接迁到 v4。作者定位 v4 就是 v3 的直接替代,更新权重后原有流程可继续。
⚠️ 避坑提醒与下一步
三个高频疑问先说清楚:
- 跨版本模型能通用吗?不能。各版本训练产物分目录存放(SoVITS_weights、SoVITS_weights_v2、_v3、_v4、_v2Pro、_v2ProPlus,GPT 权重同理),切换版本需重新训练,只有底模预训练权重可以复用,目录映射逻辑见 config.py。
- 8GB 显存怎么训 v3?走 LoRA 微调,官方 2025.02 起支持 8G 显存完成;全量微调要 14GB,开梯度检查点可压到 12GB。
- 怎么确认自己下的权重是哪个版本?查看 GPT_SoVITS/configs/tts_infer.yaml,各版本默认预训练权重路径都注册在这里:s2G488k.pth 对应 v1,gsv-v2final-pretrained/ 对应 v2,s2Gv3.pth 对应 v3,gsv-v4-pretrained/ 对应 v4,v2Pro/ 对应 v2Pro 系列。
想切回 v1 环境时,启动主 WebUI 要显式指定版本:
python webui.py v1不带参数则默认使用当前默认版本(见 webui.py 顶部配置)。
下一步清单:
- 下载权重:把所选版本的预训练权重放进 GPT_SoVITS/pretrained_models/,各版本所需文件清单见 docs/cn/README.md 的"预训练模型"一节。
- 启动入口:主 WebUI 用 webui.py,推理 WebUI 用 GPT_SoVITS/inference_webui.py,也可在主界面内动态切换模型版本。
- 训练入口:v1/v2/v2Pro 用 GPT_SoVITS/s2_train.py,v3/v4 用 GPT_SoVITS/s2_train_v3.py(LoRA 为 s2_train_v3_lora.py)。
- 跟进更新:版本号、发布时间与各版本特性以 docs/cn/Changelog_CN.md 官方更新日志为准。
【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考