UVR人声分离快速上手:从安装到第一遍伴奏
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
Ultimate Vocal Remover(简称 UVR)是一款免费开源的 AI 人声分离工具,用深度学习模型把歌曲里的人声和伴奏拆开,也能细分出鼓、贝斯等元素。它适合需要制作卡拉OK伴奏、提取纯净人声、或做音频素材分离的新手,全程图形界面,不需要写代码。
🎙️ 工具速览
UVR 把 MDX-Net、Demucs、VR Arc 三套主流分离架构放进同一个图形界面,你只需要选文件、选模型、点按钮,不用碰命令行。它解决的问题很具体:把一首歌拆成人声和伴奏两条轨道,或者拆出更多独立元素。
- 开源免费:MIT 协议,个人和商业使用都不收费
- 三大架构齐全:MDX-Net/MDX23C、Demucs、VR Arc,并自带预训练模型,放在 models/ 目录下
- 图形界面:选文件、选模型、调参数,点 Start Processing 即可
- 非 WAV 格式(如 MP3、FLAC)依赖 FFmpeg 转换,安装说明见 README.md
- 支持 GPU 加速,NVIDIA 显卡可明显缩短处理时间
📦 安装与环境准备
Windows 一键安装
最省事的方式是到项目仓库的发布页下载安装包UVR_v5.6.0_setup.exe,按向导安装即可,安装包已内置 Python、PyTorch 等依赖。注意两点:
- 安装目录必须选 C 盘,装到其他盘会导致运行不稳定
- 如果你用的是 AMD Radeon 或 Intel Arc 显卡,可以改选 OpenCL 版本安装包
如果你更习惯从源码运行,则克隆仓库后装依赖:
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui && cd ultimatevocalremovergui pip install -r requirements.txt python UVR.py有 NVIDIA 显卡的话,建议再按 README.md 里的说明安装带 CUDA 的 PyTorch。
Linux 源码安装
以 Debian/Ubuntu 系为例,在仓库目录下依次执行:
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui && cd ultimatevocalremovergui sudo apt update && sudo apt upgrade && sudo apt install ffmpeg python3-pip python3-tk pip3 install -r requirements.txt python3 UVR.py仓库里还提供一个 install_packages.sh 脚本,可以逐行读取 requirements.txt 自动安装依赖,适合想简化流程的场景。Arch 系系统的命令见 README.md。
macOS 安装
到发布页下载对应芯片的安装包:Apple 芯片选 arm64 版,Intel 芯片选 x86_64 版的.dmg。首次启动如果系统提示“无法打开”,在终端执行以下两条命令解除隔离限制,完成后再建议用sudo spctl --master-enable恢复默认设置:
sudo spctl --master-disable sudo xattr -rd com.apple.quarantine /Applications/Ultimate\ Vocal\ Remover.app🚀 第一次运行:从启动到出结果
启动后你会看到一个带控制台日志、模型选项和参数区的窗口,按下面五步走:
- 选输入(Select Input):点 Select Input 按钮,或直接把音频拖进窗口,支持 WAV、MP3、FLAC 等格式
- 选架构和模型:在 MDX-Net、MDX23C、Demucs、VR Arc 四个架构页签里挑一个,第一次建议选 MDX-Net 或 MDX23C 里标着 Vocals 的模型,音质和速度比较均衡
- 调参数:保持默认即可,Overlap(重叠度)默认 0.25,Segment(分段)默认取模型推荐值,先跑通再调
- 设输出目录:给 Export Path 选一个可写的目录,注意留出足够空间
- 开始处理:点 Start Processing,完成后输出目录会出现
歌曲名 (Vocals).wav和歌曲名 (Instrumental).wav两个文件,一个纯人声,一个纯伴奏
🧩 核心能力拆解
多轨分离:从两轨到六轨
它能做什么:Demucs 模型可以把音频拆成 2 轨(人声/伴奏)、4 轨(人声、鼓、贝斯、其他)甚至 6 轨(再加钢琴、吉他);MDX-Net 还提供 Drums、Bass、Reverb 等单元素提取模型。怎么操作:在 Demucs 页签选 4-stem 或 6-stem 模型,输出时勾选需要的轨。什么时候用:你需要从混音里单独抠出某个乐器,比如只留鼓或只留贝斯。
人声拆分:主唱与和声
它能做什么:在人声和伴奏分离的基础上,进一步把人声轨拆成 Lead Vocal(主唱)和 Backing Vocal(和声),并额外导出分别包含各部分人声的伴奏版本。怎么操作:在 MDX-Net 页签选择带 vocal split 功能的模型并启用对应选项。什么时候用:你想只保留主唱人声,或者单独处理和声部分时。
集成模式与降噪
它能做什么:集成模式(Ensemble)一次跑两个模型并对结果加权,可以互补各自短板;仓库自带 UVR-DeNoise-Lite.pth 降噪模型,用于清理分离后残留的杂音。什么时候用:单模型分离后仍有明显残留或伪影时,开启集成加降噪能改善结果,代价是处理时间变长。
🎬 实战案例
案例一:制作卡拉OK伴奏
- 需求:把一首完整歌曲变成可跟唱的伴奏
- 操作要点:选 MDX-Net 或 VR Arc 里标注 karaoke 的模型,输出轨选 Instrumental,输出格式选 WAV
- 预期效果:得到
xxx (Instrumental).wav,人声被去掉,伴奏编曲基本保持原样,可以直接用于跟唱
案例二:提取人声学歌
- 需求:学一首歌,需要干净的纯人声轨
- 操作要点:选 MDX23C 里 Vocals 方向的模型,参数保持默认;若觉得残留噪声明显,再叠加降噪
- 预期效果:得到独立的
xxx (Vocals).wav人声轨,可以放慢速度听清咬字和转音细节
案例三:现场录音元素提取
- 需求:从一段现场录音里单独拿到鼓组
- 操作要点:选 Demucs 4-stem 模型并输出 Drums 轨,或选 MDX-Net 中 Drums 单元素模型
- 预期效果:得到一条独立鼓轨,可用于采样、编曲或节奏分析
⚠️ 排坑指南
- 现象:处理 MP3、FLAC 等非 WAV 文件时报错。可能原因:FFmpeg 没装或没放到正确位置。解决办法:安装 FFmpeg,并把
ffmpeg.exe放到应用根目录(Windows) - 现象:内存分配错误、程序卡死。可能原因:Segment 或 Window 设置超过可用内存。解决办法:把 Segment Size(分段大小)或 Window Size(窗口大小)调小
- 现象:macOS 提示无法打开应用。可能原因:系统安全策略拦截。解决办法:执行 macOS 小节的两条命令解除隔离
- 现象:Windows 下运行不稳定、偶发崩溃。可能原因:装在了 C 盘以外的盘。解决办法:卸载后重新安装到 C:\
- 现象:Time Stretch / Change Pitch 功能不可用。可能原因:缺少 Rubber Band 库。解决办法:按 README.md 说明把 rubberband 相关文件放入应用目录
- 现象:处理特别慢。可能原因:在纯 CPU 上跑。解决办法:确认显卡满足 GPU 要求(NVIDIA 6GB 显存起步)并启用 GPU 转换
⚙️ 进阶调优
硬件参考(依据 README.md 的官方说明):
- 最低配置:64 位系统,纯 CPU 运行,对显卡无要求
- 推荐配置:NVIDIA 显卡,RTX 1060 6GB 是 GPU 转换的门槛,8GB 以上显存更从容
最值得调的三个参数:
- Segment Size(分段大小,MDX):越大处理越快但显存占用越高,内存紧张就往下调,追求速度就往上调
- Overlap(重叠度):默认 0.25,MDX23C 默认 8;重叠越多接缝处理越平滑,但耗时同步增加,多数歌曲用默认值就够了
- Window Size(窗口大小,VR):在质量与速度之间取舍,输出出现明显伪影时可以尝试更换档位
- 另外 Demucs 的 Segment 默认跟随模型自带配置(见 lib_v5/vr_network/modelparams/),第一次使用保持默认即可
下一步
- 打开仓库的 README.md,对照你的系统核对最新安装说明和支持范围
- 按上文对应系统的步骤装好依赖,并确认 FFmpeg 已就位
- 找一首三分钟以内的歌,完整走一遍“选输入、选模型、Start Processing”,检查输出目录里的两条音轨是否正常
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考