10分钟音频训出专属音色:RVC WebUI 语音克隆变声完整上手指南
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
RVC WebUI(Retrieval-based-Voice-Conversion-WebUI)是一个基于 VITS 的开源变声与语音克隆框架,核心思路是"检索-替换":把训练集拆成成千上万个声音特征片段,实时分析你的输入声音,从库里找出最接近的片段做音色替换。官方推荐只要10 分钟低底噪语音就能训出可用模型,4GB 显存的显卡即可训练,实时变声端到端延迟约170ms(ASIO 设备可压到 90ms)。它解决的是"想让麦克风输出变成某个固定音色,但不想凑一堆工具"的问题。
值不值得装:跟传统变声器差在哪
传统变声器靠改频率、移调,声音发硬;RVC 走的是检索替换路线,输出更贴近目标音色、失真更小。原理一句话:把你的声音"换成"训练集里最像的那段。
几个帮你判断的点:
- 硬件:4GB 显存起步,4GB 以下官方建议放弃;A 卡/I 卡可走 DirectML 或 CPU 方案。
- 数据:10~50 分钟训练集,音色特征明显时 5~10 分钟也能出效果。
- 用途:直播、游戏配音的实时变声,或批量配音素材产出,都合适。
- 不想折腾环境:网页界面把训练、推理、人声分离(UVR5)、模型融合都整合好了。
| 维度 | 传统变声器 | RVC WebUI |
|---|---|---|
| 音色还原度 | 改频率,声音发硬 | 检索替换,接近目标音色 |
| 硬件门槛 | 低 | 4GB 显存可跑 |
| 上手成本 | 装即用 | 需配 Python 环境 |
| 实时延迟 | 低 | 约 170ms(ASIO 90ms) |
10 分钟装好并启动 WebUI
前置条件:Python 3.12 x64(本分支定向 3.12)、ffmpeg(训练推理都要用它读写音频)、以及目标硬件对应的显卡驱动。Windows 用户可直接装好 Python 后走下面的步骤。
第一步:clone 仓库并建虚拟环境
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI py -3.12 -m venv .venv && .venv\Scripts\activate # WindowsUbuntu 24.04 用sudo apt install -y python3.12 python3.12-venv ffmpeg代替,然后python3.12 -m venv .venv && source .venv/bin/activate。
第二步:按硬件装依赖(N 卡分 CUDA 11.8 / 12.8 两档,CPU/AMD/Intel 走 cpu 文件):
python -m pip install -r requirments_cpu_py312.txt # 或 N 卡 50 系以前:requirments_cu118_py312.txt;50 系:requirments_cu128_py312.txt装完可跑python -c "import torch; print(torch.cuda.is_available())"验证,输出True说明 GPU 识别正常。
第三步:下预训练模型到assets/目录(hubert_base、rmvpe、pretrained 等):
python -m pip install --upgrade huggingface_hub hf download lj1995/VoiceConversionWebUI --revision main \ --include "hubert_base/*" "pretrained/*" "pretrained_v2/*" --local-dir assets hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main --local-dir assets/rmvpe需要 RMVPE 音高提取就保留上面第二条,需要 UVR5 人声分离再补下uvr5_weights/*。
第四步:启动并验证:
python webui.py你应该看到浏览器自动打开7865端口,出现中文界面,含"数据集处理""一键训练""推理""UVR5"等选项卡——界面能正常渲染就说明跑通了。
用法手册:从训练到出声
训练一个专属音色(最高频)
目标:用你自己的(或某位歌手的)声音训一个可推理的.pth模型。
步骤:
- 准备10 分钟以上干净音频,放仓库内某目录;
- 网页"数据集处理"选项卡做切片、特征提取(音高提取算法选RMVPE,官方说它比 crepe_full 更快、占用更小,还能解决哑音问题);
- 点一键训练,
total_epoch按训练集质量定:底噪大、音质差 20~30 够;音质好可上 200。
预期结果:训练结束后assets/weights/下会生成60MB+ 的.pth小模型,这就是分享和推理用的成品(logs/下几百 MB 的大 pth 是实验状态文件,不用于推理)。
关键参数:
f0method:音高提取算法,推荐 RMVPE;total_epoch:训练轮数,决定模型充分程度,别盲目拉高;index_rate:音色检索强度,推理时用它控制"像目标音色"还是"贴合输入"。
实时变声
目标:麦克风实时输出目标音色,用于直播、游戏配音。启动 realtime_gui.py(Windows 双击go-realtime_gui.bat),加载刚训好的模型即可。普通设备端到端约 170ms,ASIO 输入输出可低至 90ms(依赖硬件驱动)。推理端开半精度(is_half=True)能降低显存占用。
批量转换 / 人声分离
批量把整批 wav 转成目标音色,走 infer/vc/ 的推理管线;分离人声与伴奏用内置 UVR5(tools/uvr5/模块),在 WebUI 的 UVR5 选项卡里操作。核心调参:f0up_key(移调)、index_rate(检索强度,默认 0.66)、f0method(音高算法)。
排障手册:报错了对着查
- ffmpeg error / utf8 error→ 多半不是 ffmpeg 的锅,而是音频路径带空格、括号或中文 → 把路径改成纯英文、无特殊字符即可。
- CUDA out of memory(显存不足)→ 训练调小
batch size到 1 还爆就换卡;推理改 configs/config.py 末尾的x_pad、x_query、x_center、x_max。 - 训练完了没看到索引文件→ 训练集太大时"添加索引"卡住 → 重新点一次"训练索引"按钮通常能补上。
- 推理听不到训练集的音色→ 索引没加载 → 先点"刷新音色"再试;还不行就查
logs/实验名下的 log。 - 音色不像 / 往别的音色跑(音色泄露)→ 检索强度不够 →
index_rate调到 1,理论上杜绝泄露但音质会更贴近训练集。 - 4GB 以下显存→ 程序会回退 CPU、速度很慢 → 官方建议换卡,别硬跑。
它能做什么、做不到什么
RVC 做的是音色替换,不是 TTS:它不能凭空生成新内容,你停麦它就停,输出严格跟随你的输入节奏。想加混响、变调这类效果得靠外部音频工具。安装与推理的大部分疑难,建议先通读自带的 docs/cn/faq.md,绝大多数问题那里都有答案;更新动态看 docs/cn/Changelog_CN.md。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考