UVR5 完整教程:3 步免费人声分离,提取干净伴奏
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
UVR5(Ultimate Vocal Remover)是一款免费、开源的人声分离工具,音频全程在本地离线处理,不上传任何第三方服务。它把一首歌里的人声和伴奏拆成两条独立轨道,适合三类人:想提取清唱伴奏的翻唱者、需要分轨单独调整声音的混音者、想去掉原唱只留背景音乐的视频制作者。本文从环境准备、第一次跑通,讲到模型选型和参数调优,照着走完就能拿到自己的第一版伴奏。
10 分钟装好 UVR5:克隆仓库、装依赖,GPU 可选
UVR5 底层是 PyTorch,需要一个 Python 环境。整个安装就是三条命令的事:克隆仓库、装依赖,有显卡的话再补一条 CUDA 版 PyTorch。
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremoverguipip install -r requirements.txt装依赖时若报权限错误,给 pip 命令加--user,或者先建虚拟环境再装;Windows 启动时报缺 DLL,装上 Visual C++ Redistributable 基本就能解决。有 NVIDIA 显卡的话,建议把 CUDA 版 PyTorch 也装上:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117装上后处理时间可以压到 CPU 的十分之一左右 ⚡;没有显卡就跳过,程序会自动用 CPU 跑。
第一次跑通:人声和伴奏两个 wav 文件怎么出来
主界面分三块:左侧是 Select Input 和 Select Output,分别选输入文件和输出目录,下面带 WAV / FLAC / MP3 输出格式;中间是 Process Method 和模型下拉框;底部是 Start Processing 按钮,版本号印在最下方。上手第一遍只碰两个地方:左侧选文件、中间选模型,其余全部默认。
具体做法:Select Input 里加载要处理的歌;Select Output 指一个专门新建的文件夹,别让结果和原文件混在一起。首次运行且网络正常时,程序会自动下载预训练模型,不用挑,默认模型先跑起来即可。有显卡就勾上 GPU Conversion,点 Start Processing,等进度条走完。
跑完看输出目录,会多出两个 wav:Vocals 是纯人声轨,Instrumental 就是你要的伴奏。提前说清速度预期:一首 3 分钟的歌,纯 CPU 跑要十几分钟,属正常现象,别以为是卡死了。
它凭什么分得开:神经网络像个"熟练的挑果人"
传统滤波器按固定频率一刀切,可人声和吉他常常挤在同一频段,切一刀两边都伤。UVR5 的思路完全不同:神经网络先"听"过海量"混音 + 干净分轨"的成对样本,从中学会人声的频谱长什么样、每件乐器的频谱又长什么样。这有点像经验丰富的挑果人——不称每一颗的重量,只看色泽、形状、手感,就把一筐混装的果子按品种分到不同筐里:不是按频率切,而是先认出混音里"谁是谁",再逐个拆出来。AI 分离听感比传统滤镜干净,根源就在这里。想读代码的读者,可以从 lib_v5/ 下的spec_utils.py入手,它是频谱处理的公共底座,再看核心网络结构mdxnet.py。
三个模型家族:一张表选对不踩坑 🎯
预训练模型都放在 models/ 目录,按算法分成三个家族,擅长领域差别很大:
| 存放目录 | 模型家族 | 适合的场景 |
|---|---|---|
| models/VR_Models/ | VR Architecture | 通用场景,另含 DeNoise 等降噪专用模型 |
| models/MDX_Net_Models/ | MDX-Net | 流行、摇滚,人声与伴奏平衡性较好 |
| models/Demucs_Models/ | Demucs | 复杂编曲,对细节的保留更完整 |
我的建议:流行歌直接上 MDX-Net,稳;古典、爵士这类编曲复杂的选 Demucs;实在不知道挑哪个,先用 VR 系列跑一版当基准,多跑几次对比的成本很低。网络不稳、模型反复下载失败时,自己找到模型文件放进上面对应目录,重启软件即可识别。
调优与排障:Segment、Overlap 与四类高频报错
日常值得动的参数主要是两个:
- Segment(分段长度):音频被切多长再喂给模型。取值小,内存占用低,对配置一般的机器友好;取值大,模型看到的上下文更完整,分离更稳。在 128 到 512 之间多试几档,找到自家机器的舒适值。
- Overlap(重叠率):相邻片段的搭接程度。太低,拼接处容易出接缝声;太高,处理时间明显拉长。从 8 起步,有接缝再加到 16 或 24。
| 现象 | 常见原因 | 解决方式 |
|---|---|---|
| 拼接处有接缝声 | Overlap 太低 | 提高到 16 或 24 |
| 部分频段听感缺失 | 模型与歌曲风格不匹配 | 换另一个模型家族对比 |
| 启动即报 DLL 错误 | 缺少运行库 | 安装 Visual C++ Redistributable |
| 模型反复下载失败 | 网络受限 | 手动下载放入 models/ 对应目录后重启 |
| CUDA out of memory | 显存不足 | 调低 Segment,或降低批处理规模 |
出问题时,建议先动 Segment 和 Overlap;参数解决不了再换模型家族;还不行就回头查环境,比如显卡驱动版本。有显卡却识别不到设备,先查驱动,或者暂时关掉 GPU Conversion 用 CPU 兜底。
现在就能做的一步最小任务
挑一首你最熟的歌扔进输入目录,按上面的默认设置跑一遍;进度条走完,把 Instrumental 轨听一遍,把觉得"不对味"的地方记下来,再回到模型和参数两节逐项修正。手里还有一整个文件夹的歌要处理时,项目的UVR.py支持命令行脚本批量跑,一次处理几十首没有压力。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考