UVR5 完整教程:3 步免费人声分离,提取干净伴奏
2026/9/13 4:08:46 网站建设 项目流程

UVR5 完整教程:3 步免费人声分离,提取干净伴奏

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

UVR5(Ultimate Vocal Remover)是一款免费、开源的人声分离工具,音频全程在本地离线处理,不上传任何第三方服务。它把一首歌里的人声和伴奏拆成两条独立轨道,适合三类人:想提取清唱伴奏的翻唱者、需要分轨单独调整声音的混音者、想去掉原唱只留背景音乐的视频制作者。本文从环境准备、第一次跑通,讲到模型选型和参数调优,照着走完就能拿到自己的第一版伴奏。

10 分钟装好 UVR5:克隆仓库、装依赖,GPU 可选

UVR5 底层是 PyTorch,需要一个 Python 环境。整个安装就是三条命令的事:克隆仓库、装依赖,有显卡的话再补一条 CUDA 版 PyTorch。

git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui
pip install -r requirements.txt

装依赖时若报权限错误,给 pip 命令加--user,或者先建虚拟环境再装;Windows 启动时报缺 DLL,装上 Visual C++ Redistributable 基本就能解决。有 NVIDIA 显卡的话,建议把 CUDA 版 PyTorch 也装上:

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117

装上后处理时间可以压到 CPU 的十分之一左右 ⚡;没有显卡就跳过,程序会自动用 CPU 跑。

第一次跑通:人声和伴奏两个 wav 文件怎么出来

主界面分三块:左侧是 Select Input 和 Select Output,分别选输入文件和输出目录,下面带 WAV / FLAC / MP3 输出格式;中间是 Process Method 和模型下拉框;底部是 Start Processing 按钮,版本号印在最下方。上手第一遍只碰两个地方:左侧选文件、中间选模型,其余全部默认。

具体做法:Select Input 里加载要处理的歌;Select Output 指一个专门新建的文件夹,别让结果和原文件混在一起。首次运行且网络正常时,程序会自动下载预训练模型,不用挑,默认模型先跑起来即可。有显卡就勾上 GPU Conversion,点 Start Processing,等进度条走完。

跑完看输出目录,会多出两个 wav:Vocals 是纯人声轨,Instrumental 就是你要的伴奏。提前说清速度预期:一首 3 分钟的歌,纯 CPU 跑要十几分钟,属正常现象,别以为是卡死了。

它凭什么分得开:神经网络像个"熟练的挑果人"

传统滤波器按固定频率一刀切,可人声和吉他常常挤在同一频段,切一刀两边都伤。UVR5 的思路完全不同:神经网络先"听"过海量"混音 + 干净分轨"的成对样本,从中学会人声的频谱长什么样、每件乐器的频谱又长什么样。这有点像经验丰富的挑果人——不称每一颗的重量,只看色泽、形状、手感,就把一筐混装的果子按品种分到不同筐里:不是按频率切,而是先认出混音里"谁是谁",再逐个拆出来。AI 分离听感比传统滤镜干净,根源就在这里。想读代码的读者,可以从 lib_v5/ 下的spec_utils.py入手,它是频谱处理的公共底座,再看核心网络结构mdxnet.py

三个模型家族:一张表选对不踩坑 🎯

预训练模型都放在 models/ 目录,按算法分成三个家族,擅长领域差别很大:

存放目录模型家族适合的场景
models/VR_Models/VR Architecture通用场景,另含 DeNoise 等降噪专用模型
models/MDX_Net_Models/MDX-Net流行、摇滚,人声与伴奏平衡性较好
models/Demucs_Models/Demucs复杂编曲,对细节的保留更完整

我的建议:流行歌直接上 MDX-Net,稳;古典、爵士这类编曲复杂的选 Demucs;实在不知道挑哪个,先用 VR 系列跑一版当基准,多跑几次对比的成本很低。网络不稳、模型反复下载失败时,自己找到模型文件放进上面对应目录,重启软件即可识别。

调优与排障:Segment、Overlap 与四类高频报错

日常值得动的参数主要是两个:

  • Segment(分段长度):音频被切多长再喂给模型。取值小,内存占用低,对配置一般的机器友好;取值大,模型看到的上下文更完整,分离更稳。在 128 到 512 之间多试几档,找到自家机器的舒适值。
  • Overlap(重叠率):相邻片段的搭接程度。太低,拼接处容易出接缝声;太高,处理时间明显拉长。从 8 起步,有接缝再加到 16 或 24。
现象常见原因解决方式
拼接处有接缝声Overlap 太低提高到 16 或 24
部分频段听感缺失模型与歌曲风格不匹配换另一个模型家族对比
启动即报 DLL 错误缺少运行库安装 Visual C++ Redistributable
模型反复下载失败网络受限手动下载放入 models/ 对应目录后重启
CUDA out of memory显存不足调低 Segment,或降低批处理规模

出问题时,建议先动 Segment 和 Overlap;参数解决不了再换模型家族;还不行就回头查环境,比如显卡驱动版本。有显卡却识别不到设备,先查驱动,或者暂时关掉 GPU Conversion 用 CPU 兜底。

现在就能做的一步最小任务

挑一首你最熟的歌扔进输入目录,按上面的默认设置跑一遍;进度条走完,把 Instrumental 轨听一遍,把觉得"不对味"的地方记下来,再回到模型和参数两节逐项修正。手里还有一整个文件夹的歌要处理时,项目的UVR.py支持命令行脚本批量跑,一次处理几十首没有压力。

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询