Ultimate Vocal Remover UVR v5.6 完整教程:从安装到第一次人声伴奏分离
2026/9/12 12:20:41 网站建设 项目流程

Ultimate Vocal Remover UVR v5.6 完整教程:从安装到第一次人声伴奏分离

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

Ultimate Vocal Remover(简称 UVR)是一款开源的 AI 音频分离工具,能把一首歌曲拆成独立的人声轨和伴奏轨。它面向音乐制作人、卡拉 OK 爱好者和普通音频用户,几行安装命令即可跑起来。

项目定位:UVR 能做什么

UVR 的核心任务只有一个:从混音里把声音元素拆开。你给它一条 MP3 或 WAV,它还你两条互不干扰的音频。围绕这个目标,它具备四项基础能力:

  • AI 模型分离:内置 MDX-Net、Demucs、VR Architecture 三套神经网络架构,各自针对不同类型的歌曲调优。
  • 跨平台:同一套代码支持 Windows、macOS(含 M1/M2 芯片)和 Linux。
  • 硬件加速:有 NVIDIA 显卡时走 CUDA,有 AMD/Intel 显卡时可试 OpenCL,没有独显则用 CPU 完成。
  • 开源免费:代码随仓库开放,模型文件直接放在models/目录下,可自取自改。

环境与硬件

先确认你的机器满足条件,能少走不少弯路。

项目支持 / 建议
操作系统Windows 10+、macOS Big Sur+、Debian/Arch 系 Linux
GPU 加速NVIDIA(CUDA)、AMD/Intel(OpenCL,可选)
CPU 运行无独显也能跑,速度较慢
最低配置i5/Ryzen 5,8GB 内存
推荐配置i7/Ryzen 7,16GB 内存,NVIDIA RTX 2060 及以上

没有独显不必放弃,CPU 模式只是更慢,分离结果质量不受影响。

安装与启动

Linux 用户从命令行开始。克隆仓库后,用仓库自带的脚本装依赖,再启动主程序:

git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui chmod +x install_packages.sh ./install_packages.sh python3 UVR.py

install_packages.sh会读取 requirements.txt 逐个安装依赖包。Debian 系系统建议先装好ffmpegpython3-tk,否则 MP3 解码与界面会出问题。

Windows 与 macOS 用户直接到项目发布页下载安装包:Windows 是.exe安装器(AMD/Intel 显卡可选 OpenCL 版本),macOS 分 arm64 与 x86_64 两个.dmg。安装包已内置 Python 与 PyTorch,装完即开。

完成第一次人声分离

跟着这五步走,你会得到两个成品文件。

  1. 选择文件:点主界面的Select Input按钮,挑一首 MP3 或 WAV。
  2. 设置输出:点Select Output指定一个存放结果的文件夹。
  3. 选择模型:在模型区选一个架构(新手建议先选 MDX-Net 的人声分离模型)。
  4. 设置参数:保持默认即可,想提速可把 Segment Size 调大。
  5. 开始处理:点Start Processing,等待进度条走完。

结束后到输出目录里,你会看到一条人声轨、一条伴奏轨。文件按“原文件名 + 模型 + 声部”命名,便于对照。

模型怎么选:三种 AI 架构

三套架构分工不同,选对再谈参数。模型文件都在models/下,按架构分子目录存放。

架构擅长场景模型位置
MDX-Net高质量人声与伴奏二分离,日常首选models/MDX_Net_Models/
Demucs多轨拆分(人声/鼓/贝斯/其他),处理复杂混音models/Demucs_Models/
VR Architecture现场录音、特定类型音频,支持高端后处理models/VR_Models/

拿不准时先用 MDX-Net 跑一遍,不满意再换 Demucs 对照。

关键参数说明

三个参数直接影响速度与质量,按场景取值:

  • Segment Size(分段大小):控制每段音频的长度。小值更省内存,大值质量可能更好。默认 256;内存紧张选 256,追求质量且资源充足可试 512。
  • Overlap(重叠度):相邻预测窗口之间的重叠比例,影响接缝平滑度。MDX-Net 常用 0.25–0.75,Demucs 提供 0.25/0.50/0.75/0.99。取值过高会更慢,过低可能留下接缝痕迹。
  • GPU Conversion(GPU 开关):有 NVIDIA 显卡时勾选,处理速度可提升数倍;纯 CPU 环境保持关闭即可,不影响结果正确性。

参数本质是“速度—资源—质量”的取舍,改一项就重跑一次对比最直观。

场景实战

  • 卡拉 OK 伴奏:用 MDX-Net 人声模型分离,取伴奏轨即成品;需要更干净的背景再叠加一个去混响选项。
  • Remix 与重混:Demucs 拆出鼓、贝斯、其他轨,逐轨替换或重排,得到新版混音。
  • 音频清理:先分离出人声,再对这条干声单独做降噪,比直接整首降噪更能保住人声细节。
  • 教学素材:拆出特定乐器轨供学生跟练,或单独提取旋律线做听辨讲解。

每个场景的核心都是“先分离、再加工”,分离质量决定后续上限。

常见问题速查

  • 内存报错(内存分配失败)现象:处理到一半弹出内存不足。原因:Segment Size 过大或文件过长。解决:把 Segment Size 从 1024 降到 512 或 256 后重跑。
  • 非 WAV 文件处理失败现象:MP3/FLAC 报错。原因:系统缺 FFmpeg。解决:安装 FFmpeg 并确认其在 PATH 中,UVR 依赖它做格式解码。
  • 分离质量不满意现象:人声带乐器残留。原因:单一模型对这首歌不匹配。解决:换另一套架构重跑,或用主模型先粗分、副模型再精修的两段式流程。

从单文件到批量

UVR 的启动入口是 UVR.py(拉起界面),真正的分离逻辑集中在 separate.py,它是被调用的核心模块,并没有独立的命令行参数入口,因此不存在python separate.py -i ...这类命令。

要处理多首,最直接的方式是在Select Input里一次勾选多个音频文件,UVR 会依次处理并把每条结果按统一命名写进输出目录。大批量时建议分批、并留意内存占用,避免长文件连续堆叠。

写在最后

当前版本为 v5.6.0,项目保持持续更新,社区会在发布页推送补丁与修复。代码遵循开源许可,核心分离算法见 separate.py,模型与预置配置集中在models/目录。把第一首歌跑通,再按场景微调模型与参数,你会很快形成自己的取舍习惯。打开 UVR,选一首歌,点 Start Processing——剩下的交给它。

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询