UVR 人声分离实战指南:三步提取干净干声
2026/9/7 7:31:33 网站建设 项目流程

UVR 人声分离实战指南:三步提取干净干声

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

给混音留一条干净的人声干声,或做一首 K 歌伴奏。背后都是同一个动作:音频分离。UVR 是一款基于深度神经网络的图形化人声提取 / 伴奏分离工具。从装环境到出干声,走通这条路径。你就完成第一次 UVR 人声分离。

UVR 能干什么:核心能力速览

输入一首歌,UVR 拆成人声和器乐,输出 WAV、FLAC、MP3。当前版本 v5.6.0。

  • 内置多套模型:MDX-Net 系列、VR 架构、Demucs v3 / v4 四音轨,权重文件都在 models/ 目录
  • 算法可切换:主界面下拉框在 MDX-Net、VR、Demucs 之间切换,各适合不同素材
  • 三平台覆盖:Windows 一体化安装包、macOS 双架构 dmg(M1 带 MPS 加速)、Linux 脚本安装
  • 输出灵活:WAV / FLAC / MP3 三选一,附带时间拉伸、变调后处理
  • 硬件加速可选:NVIDIA 走 CUDA,AMD / Intel 独显走 OpenCL,纯 CPU 也能跑

环境准备:最短安装路径

按操作系统挑最短路径,Windows 装一体化包最省心。Windows 10 以上直接装 UVR_v5.6.0_setup.exe,Python 和依赖都打包在内。官方要求装在 C 盘,装到其他盘会不稳定。AMD / Intel 独显用户改选 OpenCL 版。macOS 按芯片选 arm64 或 x86_64 的 dmg。M1 芯片的 MPS 加速已覆盖 Demucs v4 和全部 MDX-Net 模型。首次启动可能等 5 到 10 分钟。

Linux 或想手动装的话,先补两个系统依赖:图形界面要 python3-tk,MP3 和 FLAC 的格式转换靠 FFmpeg。

git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui
sudo apt install ffmpeg python3-tk python3-pip
pip3 install -r requirements.txt python3 UVR.py

嫌逐条装麻烦,用 install_packages.sh 照着 requirements.txt 把依赖装齐。有 NVIDIA 独显就装 CUDA 版 PyTorch,没有装 CPU 版,界面里的 GPU Conversion 勾选框才会真正提速。

核心操作流程

界面从上到下就是选文件、选算法、点开始,三步出干声。

第一步:确定输入与输出。点左上角 Select Input 选要处理的音频,Select Output 指定结果目录。右侧单选框决定导出格式,首次用选 WAV,保真度最高。两个路径框都填入,界面就算就绪。

目录就绪后,往下选算法和模型,组合决定分离效果。

第二步:选算法与模型。在 CHOOSE PROCESS METHOD 下拉框里选 MDX-Net,这是首次使用的稳妥选项。下方 CHOOSE MDX-NET MODEL 选 MDX23C-InstVoc HQ,它是默认的人声分离主力模型。有独显就把 GPU Conversion 勾上,处理速度提升数倍。选完,模型框停在 MDX23C-InstVoc HQ,配置就绪。

模型选定后,点底部大按钮开始跑。

第三步:点 Start Processing 出干声。进度条和控制台实时反馈分离进度。完成后去输出目录,找带 Vocals 和 Instrumental 后缀的两个文件,干声就在手里了。

另外,三个勾选框按需使用:Vocals Only 只出人声,Instrumental Only 只出伴奏,Sample Mode (30s) 只跑前 30 秒。换模型前先用它试听,能省大量等待时间。右侧 SELECT SAVED SETTINGS 可存整套参数,多个文件用同一套设置连跑就是批量处理。

参数选择与效果调优

先按素材类型定模型,参数只需要碰三处。

按素材类型选模型

  • 流行曲提人声:MDX-Net + MDX23C-InstVoc HQ,默认组合就是为这种场景调的
  • 做卡拉 OK 伴奏:UVR-MDX-NET Karaoke 或 Karaoke 2,去人声更彻底
  • 编曲复杂要拆多轨:Demucs v4,一次分出 Vocals / Drums / Bass / Other 四条
  • 现场录音混响重:VR 架构对这类素材适应性更好

UVR 人声分离参数怎么调

  • Segment Size(分段大小):复杂素材用 256 或 512,简单音频 1024 换速度;它也是显存 / 内存占用的开关,机器小就往下调
  • Overlap(重叠度):默认 8 基本不用动,调高过渡更平滑但更耗时
  • Sample Mode (30s)(30秒试跑):每次换模型先跑它,听完再决定全曲跑不跑

拿不准就用这套默认配置:MDX-Net + MDX23C-InstVoc HQ,Segment Size 512,Overlap 8,输出 WAV。

高频问题与排错

五个高频坑,每个都有具体解法。

  1. 内存或显存报错(Memory allocation error):Segment Size 开太大 → 从 1024 降到 512 或 256,关掉后台占显存的程序
  2. MP3、FLAC 读不进来:系统缺 FFmpeg → 装好 FFmpeg 后重启程序,WAV 文件不受影响
  3. NVIDIA 卡勾了 GPU 却没加速:只认 CUDA 版环境 → 确认装的是 CUDA 版 PyTorch,独显至少 RTX 1060 6GB、推荐 8GB 显存,显存不够就降一档 Segment Size
  4. AMD / Intel 显卡点不了 GPU:装的是 CUDA 版 → 换 OpenCL 版安装包,CUDA 版不认这两家显卡
  5. 时间拉伸、变调不可用:缺 Rubber Band 库 → 把对应系统的 rubberband 可执行文件放进应用目录

延伸场景与硬件参考

干声拿到的下一步,是重混和批量。干声可以进 DAW 重混、加和声,去人声的伴奏轨直接当 K 歌用。含杂音的录音先分离出人声,再交给降噪工具精修。批量任务把参数存进 SELECT SAVED SETTINGS 连跑,真正脚本化可以基于 separate.py 的分离流程封装自己的调用逻辑。

硬件心里有个数:

档位配置
最低8GB 内存 + 集显或纯 CPU
推荐16GB 内存 + RTX 20 系以上独显
进阶32GB 内存 + RTX 30 系以上独显

打开 UVR,选一首你熟悉的歌,勾上 Sample Mode 跑 30 秒,第一条干声马上就到。

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询