Ultimate Vocal Remover UVR v5.6 完整教程:从安装到第一次人声伴奏分离
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
Ultimate Vocal Remover(简称 UVR)是一款开源的 AI 音频分离工具,能把一首歌曲拆成独立的人声轨和伴奏轨。它面向音乐制作人、卡拉 OK 爱好者和普通音频用户,几行安装命令即可跑起来。
项目定位:UVR 能做什么
UVR 的核心任务只有一个:从混音里把声音元素拆开。你给它一条 MP3 或 WAV,它还你两条互不干扰的音频。围绕这个目标,它具备四项基础能力:
- AI 模型分离:内置 MDX-Net、Demucs、VR Architecture 三套神经网络架构,各自针对不同类型的歌曲调优。
- 跨平台:同一套代码支持 Windows、macOS(含 M1/M2 芯片)和 Linux。
- 硬件加速:有 NVIDIA 显卡时走 CUDA,有 AMD/Intel 显卡时可试 OpenCL,没有独显则用 CPU 完成。
- 开源免费:代码随仓库开放,模型文件直接放在
models/目录下,可自取自改。
环境与硬件
先确认你的机器满足条件,能少走不少弯路。
| 项目 | 支持 / 建议 |
|---|---|
| 操作系统 | Windows 10+、macOS Big Sur+、Debian/Arch 系 Linux |
| GPU 加速 | NVIDIA(CUDA)、AMD/Intel(OpenCL,可选) |
| CPU 运行 | 无独显也能跑,速度较慢 |
| 最低配置 | i5/Ryzen 5,8GB 内存 |
| 推荐配置 | i7/Ryzen 7,16GB 内存,NVIDIA RTX 2060 及以上 |
没有独显不必放弃,CPU 模式只是更慢,分离结果质量不受影响。
安装与启动
Linux 用户从命令行开始。克隆仓库后,用仓库自带的脚本装依赖,再启动主程序:
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui chmod +x install_packages.sh ./install_packages.sh python3 UVR.pyinstall_packages.sh会读取 requirements.txt 逐个安装依赖包。Debian 系系统建议先装好ffmpeg和python3-tk,否则 MP3 解码与界面会出问题。
Windows 与 macOS 用户直接到项目发布页下载安装包:Windows 是.exe安装器(AMD/Intel 显卡可选 OpenCL 版本),macOS 分 arm64 与 x86_64 两个.dmg。安装包已内置 Python 与 PyTorch,装完即开。
完成第一次人声分离
跟着这五步走,你会得到两个成品文件。
- 选择文件:点主界面的Select Input按钮,挑一首 MP3 或 WAV。
- 设置输出:点Select Output指定一个存放结果的文件夹。
- 选择模型:在模型区选一个架构(新手建议先选 MDX-Net 的人声分离模型)。
- 设置参数:保持默认即可,想提速可把 Segment Size 调大。
- 开始处理:点Start Processing,等待进度条走完。
结束后到输出目录里,你会看到一条人声轨、一条伴奏轨。文件按“原文件名 + 模型 + 声部”命名,便于对照。
模型怎么选:三种 AI 架构
三套架构分工不同,选对再谈参数。模型文件都在models/下,按架构分子目录存放。
| 架构 | 擅长场景 | 模型位置 |
|---|---|---|
| MDX-Net | 高质量人声与伴奏二分离,日常首选 | models/MDX_Net_Models/ |
| Demucs | 多轨拆分(人声/鼓/贝斯/其他),处理复杂混音 | models/Demucs_Models/ |
| VR Architecture | 现场录音、特定类型音频,支持高端后处理 | models/VR_Models/ |
拿不准时先用 MDX-Net 跑一遍,不满意再换 Demucs 对照。
关键参数说明
三个参数直接影响速度与质量,按场景取值:
- Segment Size(分段大小):控制每段音频的长度。小值更省内存,大值质量可能更好。默认 256;内存紧张选 256,追求质量且资源充足可试 512。
- Overlap(重叠度):相邻预测窗口之间的重叠比例,影响接缝平滑度。MDX-Net 常用 0.25–0.75,Demucs 提供 0.25/0.50/0.75/0.99。取值过高会更慢,过低可能留下接缝痕迹。
- GPU Conversion(GPU 开关):有 NVIDIA 显卡时勾选,处理速度可提升数倍;纯 CPU 环境保持关闭即可,不影响结果正确性。
参数本质是“速度—资源—质量”的取舍,改一项就重跑一次对比最直观。
场景实战
- 卡拉 OK 伴奏:用 MDX-Net 人声模型分离,取伴奏轨即成品;需要更干净的背景再叠加一个去混响选项。
- Remix 与重混:Demucs 拆出鼓、贝斯、其他轨,逐轨替换或重排,得到新版混音。
- 音频清理:先分离出人声,再对这条干声单独做降噪,比直接整首降噪更能保住人声细节。
- 教学素材:拆出特定乐器轨供学生跟练,或单独提取旋律线做听辨讲解。
每个场景的核心都是“先分离、再加工”,分离质量决定后续上限。
常见问题速查
- 内存报错(内存分配失败)现象:处理到一半弹出内存不足。原因:Segment Size 过大或文件过长。解决:把 Segment Size 从 1024 降到 512 或 256 后重跑。
- 非 WAV 文件处理失败现象:MP3/FLAC 报错。原因:系统缺 FFmpeg。解决:安装 FFmpeg 并确认其在 PATH 中,UVR 依赖它做格式解码。
- 分离质量不满意现象:人声带乐器残留。原因:单一模型对这首歌不匹配。解决:换另一套架构重跑,或用主模型先粗分、副模型再精修的两段式流程。
从单文件到批量
UVR 的启动入口是 UVR.py(拉起界面),真正的分离逻辑集中在 separate.py,它是被调用的核心模块,并没有独立的命令行参数入口,因此不存在python separate.py -i ...这类命令。
要处理多首,最直接的方式是在Select Input里一次勾选多个音频文件,UVR 会依次处理并把每条结果按统一命名写进输出目录。大批量时建议分批、并留意内存占用,避免长文件连续堆叠。
写在最后
当前版本为 v5.6.0,项目保持持续更新,社区会在发布页推送补丁与修复。代码遵循开源许可,核心分离算法见 separate.py,模型与预置配置集中在models/目录。把第一首歌跑通,再按场景微调模型与参数,你会很快形成自己的取舍习惯。打开 UVR,选一首歌,点 Start Processing——剩下的交给它。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考