RVC 语音转换 WebUI 十分钟跑通指南:面向新手的变声实战
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
这是一个基于 RVC(Retrieval-based Voice Conversion)的语音转换框架:打开浏览器 WebUI,上传音频文件,就能把声音变成目标音色。它用不到 10 分钟的干净语音数据就能训练出可用的变声模型,不需要你懂深度学习原理。
RVC 是什么:浏览器里的变声工作台
RVC 是一个基于 VITS 的语音转换(VC)框架,用 Gradio 把训练和推理都做成了网页界面。它解决的核心痛点是"训练变声模型麻烦、数据少效果差":通过 top1 特征检索杜绝音色泄漏(自己的音色混进输出),在入门级显卡上也能快速训练和推理。
核心功能速览:你能用它做什么
| 功能 | 一句话说明 |
|---|---|
| 一键语音转换 | 在 WebUI 上传音频,选模型和索引,点击转换即得变声结果 |
| 一键训练音色模型 | 放入 10 分钟语音,一键跑完数据处理、音高提取、模型训练、索引构建 |
| 实时变声 | 双击go-realtime-gui.bat启动实时变声界面,端到端约 170ms 延迟 |
| 人声/伴奏分离 | 内置调用 UVR5 的能力,快速把歌声从歌曲里分离出来 |
| 音色模型融合 | 用 ckpt-merge 功能融合多个 .pth 模型,微调出更满意的音色 |
环境准备与最快启动步骤
最低硬件与软件要求
- 系统:Windows / Linux / macOS(macOS 有专门的
run.sh脚本) - Python:推荐 3.8;若用 Poetry 安装依赖,3.7~3.10 都稳定,版本过新会装不上
- 显卡:NVIDIA 卡最佳(PyTorch CUDA 加速);AMD/Intel 卡可走 DML 路线
- ffmpeg:必须安装,负责所有音频读写
三步跑通
第 1 步:获取代码
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI第 2 步:安装依赖(在项目目录内执行)
pip install torch torchvision torchaudio pip install -r requirements.txt sudo apt install ffmpegmacOS 用brew install ffmpeg;A 卡或 I 卡用户把第二条换成pip install -r requirements-dml.txt;Windows + RTX 30xx 的用户建议给 PyTorch 指定 CUDA 11.7 的轮子:pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117。
第 3 步:下载预训练模型并启动
./tools/dlmodels.sh python infer-web.py --port 7897dlmodels.sh会把 hubert、pretrained 等底模拉到assets/(Windows 双击tools/dlmodels.bat)。启动后浏览器打开http://127.0.0.1:7897就是 RVC WebUI。习惯 Windows 的话也可以直接双击go-web.bat,效果等同。
关键目录与配置速查
按"对你有什么用"分组来看:
- 入口脚本组:
infer-web.py是训练 + 推理 WebUI 的主入口;go-web.bat、go-realtime-gui.bat是 Windows 一键启动脚本;run.sh是 macOS/Linux 的一键装依赖 + 下模型 + 启动脚本。 - 模型权重组:
assets/放运行必需的底模(hubert/、pretrained/、pretrained_v2/、uvr5_weights/等);assets/weights/放你自己训练出的 .pth 音色模型;assets/indices/放 .index 特征检索库。缺哪个文件就按 README 的清单补到这里。 - 配置依赖组:
requirements.txt是 N 卡依赖清单,requirements-dml.txt是 A/I 卡版;configs/里是 v1/v2 不同采样率(32k/40k/48k)的训练配置,日常不用动。 - 文档许可组:
docs/有多语种 README、FAQ 与训练技巧;LICENSE是 MIT 协议。
其余核心代码集中在infer/(推理、训练、UVR5 模块)和tools/(模型下载、CLI 与批量推理),不折腾源码可以完全不看。
新手高频坑与一句话解法
| 坑 | 一句话原因 | 一句话解法 |
|---|---|---|
装依赖时llvmlite/numba报错 | Python 版本过新,与锁定版本冲突 | 换 Python 3.8 重建虚拟环境重装 |
| 启动或转换时报 ffmpeg 相关错误 | 音频工具链没装 | sudo apt install ffmpeg,macOS 用brew install ffmpeg,Windows 把 ffmpeg.exe 放根目录 |
| 训练时显存爆掉 | batch size 按默认值偏大 | 调小 WebUI 里的 batch_size,或开启半精度训练 |
| 界面提示预训练模型不存在 | 底模没下到assets/ | 跑tools/dlmodels.sh(Windows 双击dlmodels.bat) |
| Windows 上 PyTorch 与 CUDA 版本对不上 | 装了不带 CUDA 或版本错配的轮子 | 指定 cu117 索引源重装 PyTorch |
延伸资源
- README.md:环境配置、模型下载清单、启动方式,一切细节以此为准
- docs/cn/faq.md:中文常见问题解答
- docs/cn/Changelog_CN.md:中文更新日志
- tools/:模型下载脚本与命令行、批量推理工具
跑通后,先拿一段歌声在"单次推理"里试一次转换,再去训练页走一遍"一键训练"流程,跟着界面提示填参数即可上手。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考