RVC WebUI UVR5 人声提取新手教程:一条时间线走通免费人声伴奏分离,伴奏直接拿去翻唱
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
RVC WebUI(Retrieval-based-Voice-Conversion-WebUI)内置的 UVR5 人声提取功能,专门做一件事:把你手里的立体声音频做人声伴奏分离。跑完之后,你会在输出目录里拿到两个文件夹——主人声和非主人声:主人声是抠出来的人声轨,非主人声就是你要的干净伴奏。直接拿去做翻唱、给视频配音、清理录音里的房间回声,都不需要再经过任何中间工具。
📦 能力与边界:先把预期摆正
- 能:对整个文件夹批量分离,导出 flac / wav / mp3 / m4a 四种格式
- 能:去混响、去延迟。MDX-Net 模型(onnx_dereverb_By_FoxJoy)处理双通道混响,DeEcho 系列处理回声和单声道混响
- 不能:实时分离,每个文件必须等整段处理完
- 不能:把单通道混响彻底除干净,MDX-Net 只支持双通道
- 心理预期:分离是"抠"出来的,伴奏里残留一丝人声、人声里漏进一点伴奏,是这类算法的正常水平,不是环境没装对
⏱️ 从装好到出结果:一条时间线走完
按顺序做,全程大约就是"装代码 → 装依赖 → 拉权重 → 起界面 → 填参数 → 点转换 → 验收"一条线,中途不用切换文档。
① 拿代码
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI② 按显卡装依赖
依赖文件按你的显卡选,装错显卡是最常见的翻车点:
| 显卡 | 安装命令 |
|---|---|
| NVIDIA | pip install -r requirements.txt |
| AMD | pip install -r requirements-amd.txt |
| Intel | pip install -r requirements-ipex.txt |
③ 拉 UVR5 权重
运行tools/dlmodels.bat(Windows)或tools/dlmodels.sh(Linux/Mac),脚本会把全部 UVR5 权重下载进assets/uvr5_weights/目录。这一步是后面"模型"下拉框里能选到东西的前提,如果失败或列表为空,见文末「权重缺失怎么补」。
④ 启动界面
Windows 双击项目根目录的go-webui.bat,Linux/Mac 执行python webui.py,浏览器会自动打开主界面(首次启动耐心等几十秒)。
⑤ 切到分离页签
点顶部的「伴奏人声分离&去混响&去回声」标签,所有字段都在这一屏。
⑥ 填参数
- 模型:按你的目标选(选型表见下节),翻唱抽伴奏选 HP3 最稳
- 输入待处理音频文件夹路径:填音频所在目录,整个文件夹会批量处理;也可以改用旁边的多选文件框,但填了文件夹时文件夹优先
- 人声提取激进程度(聚合度):默认 10 先用着,残多残少再微调(0-20,越大抠得越狠)
- 导出文件格式:默认 flac 无损。后期还要加工就选 flac 或 wav,只是存档分享选 mp3 更省空间
- 指定输出主人声 / 非主人声文件夹:保持默认
opt即可,结果会分别落进两个子目录,名字可以改但别改成不存在的深层路径
采样率不用你操心:源码逻辑会先用 ffprobe 检测,只要源文件不是 44100Hz 双声道,程序自动用 ffmpeg 重编码成 44100Hz 双声道再处理。唯一要你自己把关的是——别拿过度压缩的低码率 MP3 当源文件,模型只能分开已有的信息,补不了没有的信息。
⑦ 点「转换」
右侧「输出信息」会逐行打出文件名 → 成功,全部打完整批完成。
⑧ 验收
- 到主人声文件夹听:人声是否完整、有没有伴奏漏进来
- 到非主人声文件夹听:歌词是否已经基本听不出来
两边都过关,这次分离才算合格;伴奏直接就能进剪辑软件铺底。
🎚️ 参数速查:模型怎么选、字段怎么填
UVR5 模型选型表
| 模型 | 适用场景 |
|---|---|
| HP2 | 没有和声的歌曲,保留主人声,整体最均衡 |
| HP3 | 同 HP2,主人声保留更完整,可能轻微漏一点伴奏 |
| HP5 | 带和声的歌曲,只留主旋律人声,主人声可能被略削弱 |
| onnx_dereverb_By_FoxJoy | 去双通道混响(MDX-Net) |
| DeEcho-Normal | 去延迟、去混响,标准档 |
| DeEcho-Aggressive | 同 Normal 但更彻底 |
| DeEcho-DeReverb | 额外去混响,耗时接近前两者的 2 倍 |
字段填写表
| 字段 | 填法 | 为什么这么填 |
|---|---|---|
| 输入待处理音频文件夹路径 | 待处理音频目录(或改用多选文件框) | 文件夹优先级更高,适合批量 |
| 模型 | 先翻唱选 HP3,去混响选 onnx_dereverb_By_FoxJoy | 模型选错,后面参数全白填 |
| 人声提取激进程度 | 默认 10,残多往 12-15 调,人声变薄往 8 调 | 越大抠得越狠,但伴奏里被带走的频率也越多 |
| 导出文件格式 | flac(默认) | 无损,后续加工不二次损失 |
| 输出主人声 / 非主人声文件夹 | 默认opt | 结果分两个子目录落盘,互不覆盖 |
🩺 结果不对劲,按顺序查这 4 件事
别乱试,按「模型 → 参数 → 源文件 → 依赖」走,大部分问题前三步就能定位:
- 模型选错了吗?有和声的歌用了 HP2/HP3,和声会被当主人声留下;去混响却选了 HP5,等于白跑。对照选型表换一个重跑。
- 聚合度偏了吗?伴奏里人声残留多,从 10 往 12-15 调;人声变薄、伴奏味太重,往 8 降。每次只动 2 档,听完再动。
- 源文件质量够吗?单声道、低码率、本身有严重削波的文件,分离上限就在那里。换一份无损源文件再试。
- 依赖环境全吗?看「输出信息」里有没有报错堆栈:torch 版本和显卡不匹配常见于 AMD 用户装错了依赖文件。更多报错含义可翻 docs/ 下对应语言的 faq。
权重缺失(.pth 不在 assets/uvr5_weights/)怎么补
「模型」下拉框是空的,或者处理时报找不到模型,先确认assets/uvr5_weights/里有没有以.pth结尾的权重文件(Roformer 类模型是.ckpt+.yaml)。没有的话重新运行一次tools/dlmodels.bat或tools/dlmodels.sh(脚本入口在 tools/ 下);仍不行的话,从项目文档里找到对应下载链接,手动把权重文件放进assets/uvr5_weights/,重启界面后下拉框就能选到了。
🧭 延伸玩法:分离只是第一步
- 做翻唱:先用 HP3 抽出干净伴奏,录上自己的声音,在剪辑软件里把两轨叠到同一时间轴上对齐进拍点。
- 清理播客:先过一遍 onnx_dereverb_By_FoxJoy 去掉房间回声,再用 DeEcho-Aggressive 收一遍残留,双通道录音按这个顺序最干净。
- 视频重新配音:把视频音轨导出成音频文件,用 UVR5 把背景音乐和原声分开,留伴奏轨垫底,人声轨替换成你的配音,音量按段落拉平。
✍️ 收尾:接下来直接做这 4 件事
- 挑一首干净的立体声歌曲,用 HP3 完整跑一遍,两个输出文件夹各听一遍
- 记下残留人声和漏伴奏最严重的时间点,用聚合度 12 和 8 各跑一次做对比
- 去混响场景,按 onnx_dereverb_By_FoxJoy → DeEcho-Aggressive 的顺序试一遍双通道录音
- 分离稳定后,把提出来的人声直接接到 RVC 主界面,走后续变声流程
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考