UVR 音频分离与人声提取实战指南三步得到干净干声【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui做卡拉OK伴奏、给重混音留一条干净的人声干声、或者从成品曲里抠掉某条音轨再二次创作——这些事背后都是同一个技术动作音频分离。UVRUltimate Vocal Remover用深度学习模型把人声和伴奏拆开是目前开源社区里最成熟的图形化音频分离工具之一。这篇指南带你从装环境到选参数完整走通第一次人声提取。UVR 是什么先认清它的定位一句话概括UVR 是一款基于深度神经网络的图形化人声提取 / 伴奏分离工具把一首歌拆成人声与器乐按模型能力最多可拆到四条音轨。几个值得记住的特点内置多套分离模型MDX-Net 系列含卡拉OK取向的 Karaoke 模型、MDX23C-InstVoc HQ 等、VR 架构、Demucs v3 / v4 四音轨模型权重文件都放在 models/ 目录下三平台覆盖Windows 提供一体化安装包macOS 支持 Apple 芯片 MPS 加速Linux 用脚本装依赖直接跑硬件加速可选NVIDIA 走 CUDAAMD / Intel 独显有专门的 OpenCL 安装包没有独显也能用 CPU 完成分离输出格式灵活WAV、FLAC、MP3 三选一还附带时间拉伸、变调等后处理安装与运行两条命令跑起来Windows 用户直接下载 v5.6 安装包UVR_v5.6.0_setup.exe按提示装到 C 盘即可官方明确要求装在 C 盘以保证稳定AMD 或 Intel 核显用户可选 OpenCL 版本。Linux / 手动安装的路径最简短进入项目目录后执行pip install -r requirements.txt python UVR.py装之前补两个系统依赖图形界面需要python3-tkMP3、FLAC 等格式的文件转换依赖 FFmpeg。嫌逐条装麻烦的话项目里也备了install_packages.sh一键把 requirements.txt 里的依赖装齐。三步走通第一次人声提取界面不长从上到下就是选文件 → 选算法 → 点开始第一步确定输入输出。点左上角的 Select Input 选你要处理的音频文件Select Output 指定结果目录。右侧的单选框决定导出格式首次使用建议选 WAV保真度最高。第二步选算法和模型。中间区域的 CHOOSE PROCESS METHOD 下拉框控制用哪类网络第一次用选 MDX-Net 最稳妥下方 CHOOSE MDX-NET MODEL 里它默认带的 MDX23C-InstVoc HQ 就是人声分离的主力模型。如果你用的是独显把 GPU Conversion 勾上处理速度能提升数倍。第三步点击 Start Processing。底部进度条和右侧控制台会实时反馈分离进度完成后输出目录里会出现带 Vocals / Instrumental 后缀的文件。另外三个勾选框按需使用Vocals Only 只要人声、Instrumental Only 只要伴奏、Sample Mode (30s) 只处理前 30 秒——换模型前先用它试听一下能省大量等待时间。人声分离参数怎么选模型与调参策略按音频类型挑模型流行歌提人声MDX-Net MDX23C-InstVoc HQ默认组合就是为这种场景调的做卡拉OK伴奏换 MDX-Net 系列的 Karaoke 模型去人声更彻底留下的伴奏更干净编曲复杂、想拆出更多音轨切到 Demucs v4 四音轨一次分出 Vocals / Drums / Bass / Other 四条现场录音、混响重试试 VR 架构它对这类素材的适应性更好三个关键参数Segment Size分段大小复杂素材用 256 或 512简单音频拉到 1024 换速度它同时也是显存/内存占用的开关机器小就往下调Overlap重叠度默认 8 基本不用动调高会增加耗时但过渡更平滑Sample Mode (30s)任何模型切换都建议先跑 30 秒样本听完再决定跑不跑全曲进阶用法与高频问题排查批量怎么处理GUI 本身一次只处理一个文件但右侧的 SELECT SAVED SETTINGS 可以保存整套参数排队的文件用同一套设置连续跑就行。需要真正脚本化时可以基于 separate.py 里的分离流程封装自己的调用逻辑。速度和质量怎么权衡质量优先 高质量模型 较小分段 全曲处理速度优先 中等模型 大分段 开 GPU。大批量任务建议先 Sample Mode 抽检确认模型合适再全量跑。三个最常碰到的坑内存/显存报错把 Segment Size 从 1024 降到 512 或 256再关掉不必要的后台程序MP3、FLAC 读不进来多半是系统没装 FFmpeg装完重启程序AMD / Intel 卡点不了 GPU检查是否装了 OpenCL 版本安装包CUDA 版只认 NVIDIA收尾几个直接用得上的场景拿到干声可以重混音、加和声去掉人声就是现成的K歌伴奏含背景杂音的录音先分离出人声再用降噪工具精修做教学素材时把某条乐器轨单独提出来讲解也很方便。硬件上心里有个数即可8GB 内存 集显能跑通16GB 内存加一张 RTX 20 系以上的独显体验明显更好追求速度就 32GB 内存配 RTX 30 系以上。原理层面不用深究——底层是把音频转成频谱后用多尺度卷积网络学习人声与伴奏的差异模式逐段处理加重叠拼接保证长音频稳定核心分离代码都在 separate.py想扩展可以看 Demucs 子目录下的模型实现。当前版本 v5.6.0 修复了 macOS 上的交互问题并扩大了 MPS 加速覆盖范围。打开 UVR选一首你熟悉的歌先用 Sample Mode 跑 30 秒听听效果——这就是最快的上手方式。【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考