UVR完全教程:用AI从歌曲中分离人声与伴奏
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
UVR(Ultimate Vocal Remover)是一款基于深度神经网络的AI音频分离工具。把一首歌拖进界面,它能按模型把混在一起的声轨拆开:人声、伴奏,或者鼓、贝斯等分轨。全程图形化操作,不用写一行代码,普通用户也能处理出接近专业水准的分离结果。
UVR能做什么:三种分离思路
UVR内部封装了三套独立的AI模型架构,思路各不相同:
- MDX-Net:单目标分离为主,你指定"我要人声"或"我要伴奏",它就专门去抠这一项,人声消除的主力。模型配置信息存放在 models/MDX_Net_Models/ 目录。
- VR Architecture:除了分轨,还承担降噪、去混响、去回声等修复类任务,比如自带的 UVR-DeNoise-Lite 模型就能净化背景噪声。
- Demucs:多轨精细分离,一次把歌曲拆成四个人声、鼓、贝斯、其他四个声轨,v4 版本还支持六轨。相关网络代码在 demucs/ 目录。
三者输出格式都是标准音频文件(WAV、FLAC、MP3 等可选),处理完直接落地到输出目录,可继续拿给 DAW 或剪辑软件用。
UVR安装步骤:三个平台各走一条路
Windows 和 macOS 用户:直接下载官方安装包(.exe / .dmg)按向导装完即可,包内已带 Python、PyTorch 等全部依赖,无需任何前置配置。注意两点:Windows 版只支持 Win10 及以上,且必须装在 C 盘;macOS 版要求 Big Sur 以上。
Linux 用户(Debian/Arch 系):先把仓库拿到本地,再跑安装脚本。
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui然后执行:
chmod +x install_packages.sh ./install_packages.sh装完依赖后用python3 UVR.py启动。脚本会按 requirements.txt 逐包安装,Debian 系还需先sudo apt install ffmpeg,因为 UVR 处理 WAV 以外的音频都靠 FFmpeg 解码。
硬件方面,程序只跑在 64 位系统上;想用 GPU 加速,最低要求是 Nvidia RTX 1060 6GB,显存 8GB 以上更稳。AMD 显卡可用 OpenCL 版或社区分支,但支持有限。
实操:给一首歌去掉人声
下面按最常见的"做伴奏(卡拉OK)"任务走一遍:
- 添加音频:把 MP3 或 WAV 拖进输入区域,点 Input 字段可展开列表,能删除、预览甚至截取试听片段。
- 选模型:在 Model 下拉框里挑一个 MDX-Net 的人声类模型。项目内置了 MDX23C 系列等数十个权重,模型清单可参考 gui_data/model_manual_download.json。
- 设输出:指定输出目录和格式,选"Vocal Remover"模式——这样输出的是扣掉人声的伴奏。
- 点 Start Processing,进度条会实时同步每个处理阶段。
如果不想整首试,可以打开Sample Mode:它只截取前几秒(时长可在 Additional Settings 里设)先跑一遍,满意了再全量处理,省时间也省显存。
人声消除的模型怎么选
不同需求对应的选择其实很直接:
- 只要干净伴奏:MDX-Net 里带 Karaoke 标记的模型,或"主模型为人声、输出取伴奏"的组合。
- 只要干净人声:选 primary stem 为 Vocals 的模型,如 UVR-MDX-NET-Voc_FT 系列。
- 背景噪声多:走 VR Architecture,用 UVR-DeNoise-Lite(文件就在 models/VR_Models/)或降噪类 VR 模型。
- 要精细多轨:用 Demucs v3/v4,一次出四轨或六轨;v4 还带 Pre-process 选项,先过一遍人声模型再拆其余声轨,能明显减少乐器里的"人声漏音"。
拿不准就先按默认模型跑 Sample Mode 试听,再换模型对比,这是成本最低的选法。
参数怎么调:分段大小与重叠率
界面里最常被误动的两个数值,解释一下:
- 分段大小(Segment Size):把整首歌切成多长的片段送进模型,MDX-Net 默认 256。数值越小越省内存、处理越快,但接缝处可能出现瑕疵;数值越大质量越稳,越吃显存。
- 重叠率(Overlap):相邻片段重复计算的比例,MDX-Net 默认 0.25,MDX23 默认 8。重叠越大,拼接痕迹越淡,耗时越长。
实操规律:显存充足就用默认值;一旦报内存分配错误,把 Segment 往小调一档通常就能解决。Demucs 的 Segment 则直接给 1/5/10/15/20 秒的档位,同样是"越小越省资源"。
进阶功能:批量、合集与设置记忆
处理歌单级别的素材时,几项功能值得了解:
- 批量模式(Batch Mode):MDX-Net 和 VR Architecture 都支持,多文件排队处理,更省内存,v5.6 起对输出质量无任何折损。
- Ensemble 合集模式:把多个模型的结果按算法(含新增的 Averaging 平均算法)融合成一份,模型数量不限,还能把整套组合存到 gui_data/saved_ensembles/ 下次直接调用。
- Secondary Model 副模型:给三种架构任意声轨挂一个辅助模型,并调节它的影响权重。
- 设置自动记忆:程序会记住你上次的全部配置;也可在 Settings 里手动保存/恢复整套参数,或一键恢复默认。
- Help Hints:打开后鼠标悬停在任何选项上会弹出该选项的说明文字,新手建议常开。
常见坑与硬件提醒
- 报 FFmpeg 缺失错误:说明你处理了非 WAV 文件却没装 FFmpeg,装好重跑即可。
- 时间拉伸/变调不可用:这两个功能依赖 Rubber Band 库,需单独把其可执行文件放进程序目录。
- 处理慢:先关 Sample Mode 外的实时操作,再考虑降分段;GPU 用户确认勾选了 GPU Conversion 且驱动版本匹配。
- Mac 首次启动慢:首次打开可能等 5-10 分钟,属正常现象。
- 报错了怎么排查:点 Start Processing 左侧的 Settings 按钮,打开 Error Log 能看到完整报错,报问题时附上它会快很多。
写在最后
UVR 把"分离"这件事的门槛压到了"会拖文件"的程度:选模型、定输出、点开始,三下完成。它的价值不在单点炫技,而在于三类模型互相补足——MDX-Net 抠单轨、VR 做降噪修复、Demucs 拆多轨,一套界面覆盖大多数音频处理需求。装好、跑通一次 Sample Mode,你就已经掌握 80% 的用法了。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考