RVC WebUI UVR5 人声提取新手教程:一条时间线走通免费人声伴奏分离,伴奏直接拿去翻唱
2026/9/19 8:02:35 网站建设 项目流程

RVC WebUI UVR5 人声提取新手教程:一条时间线走通免费人声伴奏分离,伴奏直接拿去翻唱

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

RVC WebUI(Retrieval-based-Voice-Conversion-WebUI)内置的 UVR5 人声提取功能,专门做一件事:把你手里的立体声音频做人声伴奏分离。跑完之后,你会在输出目录里拿到两个文件夹——主人声非主人声:主人声是抠出来的人声轨,非主人声就是你要的干净伴奏。直接拿去做翻唱、给视频配音、清理录音里的房间回声,都不需要再经过任何中间工具。

📦 能力与边界:先把预期摆正

  • :对整个文件夹批量分离,导出 flac / wav / mp3 / m4a 四种格式
  • :去混响、去延迟。MDX-Net 模型(onnx_dereverb_By_FoxJoy)处理双通道混响,DeEcho 系列处理回声和单声道混响
  • 不能:实时分离,每个文件必须等整段处理完
  • 不能:把单通道混响彻底除干净,MDX-Net 只支持双通道
  • 心理预期:分离是"抠"出来的,伴奏里残留一丝人声、人声里漏进一点伴奏,是这类算法的正常水平,不是环境没装对

⏱️ 从装好到出结果:一条时间线走完

按顺序做,全程大约就是"装代码 → 装依赖 → 拉权重 → 起界面 → 填参数 → 点转换 → 验收"一条线,中途不用切换文档。

① 拿代码

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

② 按显卡装依赖

依赖文件按你的显卡选,装错显卡是最常见的翻车点:

显卡安装命令
NVIDIApip install -r requirements.txt
AMDpip install -r requirements-amd.txt
Intelpip install -r requirements-ipex.txt

③ 拉 UVR5 权重

运行tools/dlmodels.bat(Windows)或tools/dlmodels.sh(Linux/Mac),脚本会把全部 UVR5 权重下载进assets/uvr5_weights/目录。这一步是后面"模型"下拉框里能选到东西的前提,如果失败或列表为空,见文末「权重缺失怎么补」。

④ 启动界面

Windows 双击项目根目录的go-webui.bat,Linux/Mac 执行python webui.py,浏览器会自动打开主界面(首次启动耐心等几十秒)。

⑤ 切到分离页签

点顶部的「伴奏人声分离&去混响&去回声」标签,所有字段都在这一屏。

⑥ 填参数

  • 模型:按你的目标选(选型表见下节),翻唱抽伴奏选 HP3 最稳
  • 输入待处理音频文件夹路径:填音频所在目录,整个文件夹会批量处理;也可以改用旁边的多选文件框,但填了文件夹时文件夹优先
  • 人声提取激进程度(聚合度):默认 10 先用着,残多残少再微调(0-20,越大抠得越狠)
  • 导出文件格式:默认 flac 无损。后期还要加工就选 flac 或 wav,只是存档分享选 mp3 更省空间
  • 指定输出主人声 / 非主人声文件夹:保持默认opt即可,结果会分别落进两个子目录,名字可以改但别改成不存在的深层路径

采样率不用你操心:源码逻辑会先用 ffprobe 检测,只要源文件不是 44100Hz 双声道,程序自动用 ffmpeg 重编码成 44100Hz 双声道再处理。唯一要你自己把关的是——别拿过度压缩的低码率 MP3 当源文件,模型只能分开已有的信息,补不了没有的信息。

⑦ 点「转换」

右侧「输出信息」会逐行打出文件名 → 成功,全部打完整批完成。

⑧ 验收

  • 主人声文件夹听:人声是否完整、有没有伴奏漏进来
  • 非主人声文件夹听:歌词是否已经基本听不出来

两边都过关,这次分离才算合格;伴奏直接就能进剪辑软件铺底。

🎚️ 参数速查:模型怎么选、字段怎么填

UVR5 模型选型表

模型适用场景
HP2没有和声的歌曲,保留主人声,整体最均衡
HP3同 HP2,主人声保留更完整,可能轻微漏一点伴奏
HP5带和声的歌曲,只留主旋律人声,主人声可能被略削弱
onnx_dereverb_By_FoxJoy去双通道混响(MDX-Net)
DeEcho-Normal去延迟、去混响,标准档
DeEcho-Aggressive同 Normal 但更彻底
DeEcho-DeReverb额外去混响,耗时接近前两者的 2 倍

字段填写表

字段填法为什么这么填
输入待处理音频文件夹路径待处理音频目录(或改用多选文件框)文件夹优先级更高,适合批量
模型先翻唱选 HP3,去混响选 onnx_dereverb_By_FoxJoy模型选错,后面参数全白填
人声提取激进程度默认 10,残多往 12-15 调,人声变薄往 8 调越大抠得越狠,但伴奏里被带走的频率也越多
导出文件格式flac(默认)无损,后续加工不二次损失
输出主人声 / 非主人声文件夹默认opt结果分两个子目录落盘,互不覆盖

🩺 结果不对劲,按顺序查这 4 件事

别乱试,按「模型 → 参数 → 源文件 → 依赖」走,大部分问题前三步就能定位:

  1. 模型选错了吗?有和声的歌用了 HP2/HP3,和声会被当主人声留下;去混响却选了 HP5,等于白跑。对照选型表换一个重跑。
  2. 聚合度偏了吗?伴奏里人声残留多,从 10 往 12-15 调;人声变薄、伴奏味太重,往 8 降。每次只动 2 档,听完再动。
  3. 源文件质量够吗?单声道、低码率、本身有严重削波的文件,分离上限就在那里。换一份无损源文件再试。
  4. 依赖环境全吗?看「输出信息」里有没有报错堆栈:torch 版本和显卡不匹配常见于 AMD 用户装错了依赖文件。更多报错含义可翻 docs/ 下对应语言的 faq。

权重缺失(.pth 不在 assets/uvr5_weights/)怎么补

「模型」下拉框是空的,或者处理时报找不到模型,先确认assets/uvr5_weights/里有没有以.pth结尾的权重文件(Roformer 类模型是.ckpt+.yaml)。没有的话重新运行一次tools/dlmodels.battools/dlmodels.sh(脚本入口在 tools/ 下);仍不行的话,从项目文档里找到对应下载链接,手动把权重文件放进assets/uvr5_weights/,重启界面后下拉框就能选到了。

🧭 延伸玩法:分离只是第一步

  • 做翻唱:先用 HP3 抽出干净伴奏,录上自己的声音,在剪辑软件里把两轨叠到同一时间轴上对齐进拍点。
  • 清理播客:先过一遍 onnx_dereverb_By_FoxJoy 去掉房间回声,再用 DeEcho-Aggressive 收一遍残留,双通道录音按这个顺序最干净。
  • 视频重新配音:把视频音轨导出成音频文件,用 UVR5 把背景音乐和原声分开,留伴奏轨垫底,人声轨替换成你的配音,音量按段落拉平。

✍️ 收尾:接下来直接做这 4 件事

  1. 挑一首干净的立体声歌曲,用 HP3 完整跑一遍,两个输出文件夹各听一遍
  2. 记下残留人声和漏伴奏最严重的时间点,用聚合度 12 和 8 各跑一次做对比
  3. 去混响场景,按 onnx_dereverb_By_FoxJoy → DeEcho-Aggressive 的顺序试一遍双通道录音
  4. 分离稳定后,把提出来的人声直接接到 RVC 主界面,走后续变声流程

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询