RVC 语音转换 WebUI 十分钟跑通指南:面向新手的变声实战
2026/9/1 20:59:36 网站建设 项目流程

RVC 语音转换 WebUI 十分钟跑通指南:面向新手的变声实战

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

这是一个基于 RVC(Retrieval-based Voice Conversion)的语音转换框架:打开浏览器 WebUI,上传音频文件,就能把声音变成目标音色。它用不到 10 分钟的干净语音数据就能训练出可用的变声模型,不需要你懂深度学习原理。

RVC 是什么:浏览器里的变声工作台

RVC 是一个基于 VITS 的语音转换(VC)框架,用 Gradio 把训练和推理都做成了网页界面。它解决的核心痛点是"训练变声模型麻烦、数据少效果差":通过 top1 特征检索杜绝音色泄漏(自己的音色混进输出),在入门级显卡上也能快速训练和推理。

核心功能速览:你能用它做什么

功能一句话说明
一键语音转换在 WebUI 上传音频,选模型和索引,点击转换即得变声结果
一键训练音色模型放入 10 分钟语音,一键跑完数据处理、音高提取、模型训练、索引构建
实时变声双击go-realtime-gui.bat启动实时变声界面,端到端约 170ms 延迟
人声/伴奏分离内置调用 UVR5 的能力,快速把歌声从歌曲里分离出来
音色模型融合用 ckpt-merge 功能融合多个 .pth 模型,微调出更满意的音色

环境准备与最快启动步骤

最低硬件与软件要求

  • 系统:Windows / Linux / macOS(macOS 有专门的run.sh脚本)
  • Python:推荐 3.8;若用 Poetry 安装依赖,3.7~3.10 都稳定,版本过新会装不上
  • 显卡:NVIDIA 卡最佳(PyTorch CUDA 加速);AMD/Intel 卡可走 DML 路线
  • ffmpeg:必须安装,负责所有音频读写

三步跑通

第 1 步:获取代码

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

第 2 步:安装依赖(在项目目录内执行)

pip install torch torchvision torchaudio pip install -r requirements.txt sudo apt install ffmpeg

macOS 用brew install ffmpeg;A 卡或 I 卡用户把第二条换成pip install -r requirements-dml.txt;Windows + RTX 30xx 的用户建议给 PyTorch 指定 CUDA 11.7 的轮子:pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117

第 3 步:下载预训练模型并启动

./tools/dlmodels.sh python infer-web.py --port 7897

dlmodels.sh会把 hubert、pretrained 等底模拉到assets/(Windows 双击tools/dlmodels.bat)。启动后浏览器打开http://127.0.0.1:7897就是 RVC WebUI。习惯 Windows 的话也可以直接双击go-web.bat,效果等同。

关键目录与配置速查

按"对你有什么用"分组来看:

  • 入口脚本组infer-web.py是训练 + 推理 WebUI 的主入口;go-web.batgo-realtime-gui.bat是 Windows 一键启动脚本;run.sh是 macOS/Linux 的一键装依赖 + 下模型 + 启动脚本。
  • 模型权重组assets/放运行必需的底模(hubert/pretrained/pretrained_v2/uvr5_weights/等);assets/weights/放你自己训练出的 .pth 音色模型;assets/indices/放 .index 特征检索库。缺哪个文件就按 README 的清单补到这里。
  • 配置依赖组requirements.txt是 N 卡依赖清单,requirements-dml.txt是 A/I 卡版;configs/里是 v1/v2 不同采样率(32k/40k/48k)的训练配置,日常不用动。
  • 文档许可组docs/有多语种 README、FAQ 与训练技巧;LICENSE是 MIT 协议。

其余核心代码集中在infer/(推理、训练、UVR5 模块)和tools/(模型下载、CLI 与批量推理),不折腾源码可以完全不看。

新手高频坑与一句话解法

一句话原因一句话解法
装依赖时llvmlite/numba报错Python 版本过新,与锁定版本冲突换 Python 3.8 重建虚拟环境重装
启动或转换时报 ffmpeg 相关错误音频工具链没装sudo apt install ffmpeg,macOS 用brew install ffmpeg,Windows 把 ffmpeg.exe 放根目录
训练时显存爆掉batch size 按默认值偏大调小 WebUI 里的 batch_size,或开启半精度训练
界面提示预训练模型不存在底模没下到assets/tools/dlmodels.sh(Windows 双击dlmodels.bat
Windows 上 PyTorch 与 CUDA 版本对不上装了不带 CUDA 或版本错配的轮子指定 cu117 索引源重装 PyTorch

延伸资源

  • README.md:环境配置、模型下载清单、启动方式,一切细节以此为准
  • docs/cn/faq.md:中文常见问题解答
  • docs/cn/Changelog_CN.md:中文更新日志
  • tools/:模型下载脚本与命令行、批量推理工具

跑通后,先拿一段歌声在"单次推理"里试一次转换,再去训练页走一遍"一键训练"流程,跟着界面提示填参数即可上手。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询