资讯动态

用 UVR5 把播客人声从背景噪音里捞出来:一份 AI 音频分离实操指南

发布时间:2026/9/2 13:13:18 来源:尧图企业网站定制
用 UVR5 把播客人声从背景噪音里捞出来一份 AI 音频分离实操指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI上次录远程访谈对方那边的空调噪音一路录了进来后期怎么处理都留着嗞声几个降噪插件都试了最后只能忍痛弃掉那条素材。Retrieval-based-Voice-Conversion-WebUI 内置了 UVR5 AI音频分离 模块它做的人声提取靠的是深度学习模型把声音从混音里拆出来普通电脑就能跑。️ UVR5 能做什么人声提取、伴奏分离与去混响说白了UVR5Ultimate Vocal Remover v5就是一个纯粹的音频分离工具不需要专业音频工作站不用学频谱编辑把文件丢进去模型自动把人声和伴奏分别输出。它的核心逻辑在 infer/modules/uvr5/入口是 WebUI 里的音频预处理-UVR5 批量处理页签能力可以概括为三点人声提取HP2/HP3 模型把主唱从混音里拆出来非人声部分自动归到伴奏轨伴奏分离同一轮处理会同时输出 instrumental 轨剪辑时两轨音量可以各自调去混响与去延迟MDX-Net 去混响模型处理双通道房间混响DeEcho 系列针对延迟、回声还可以串联使用这套模型按用途而不是按算法来分模型名即用途带 Vocals 字样的保留人声dereverb 负责去混响下拉框里的选项和权重文件名一一对应不用死记硬背。另外它支持整文件夹批量处理遇到非 44.1kHz 的音频会自动转格式缺的权重文件会自动补到 assets/uvr5_weights/开箱即用。 跑起来4 行命令装好并启动 WebUI硬件方面建议有一张显存 4GB 以上的 NVIDIA 显卡AMD 显卡装对应的 requirements 文件即可集显或纯 CPU 模式也能推理只是慢一些。git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt bash run.shWindows 用户把最后一行换成双击 go-web.bat 就行。启动后浏览器会自动打开 WebUI首次运行若提示缺模型等它下载完成或参照 docs/cn/faq.md 把权重手动放进 assets/uvr5_weights/之后每次启动就没有下载环节了。人声提取参数怎么选从输入文件夹到结果检查先准备素材把要处理的音频整理到一个文件夹MP3、WAV、FLAC 都能读后续要拿去训练的话建议保留无损 WAV。程序遇到非 44.1kHz 立体声的文件会自动调用 FFmpeg 转格式不用提前手动规整。进 WebUI 的音频预处理-UVR5 批量处理页签填输入文件夹和两个输出文件夹人声 / 伴奏选模型点开始。下面是参数参照表实际跑下来这套值的第一次结果就比较稳参数推荐值说明模型选择人声提取 HP2仅主人声 HP5去混响 onnx_dereverb_By_FoxJoy带和声的音频选 HP5 只留主唱聚合度 (agg)10–20从 12 起步越高分离越彻底瑕疵也越多输出格式WAV无损方便直接喂给 RVC 训练聚合度没把握就先保持 12分离不彻底人声轨还夹带背景音乐再每次加 2试 14、16不建议一步拉到 20值越高人声里越容易出现爆米花式的颗粒瑕疵。跑完后进度区会逐个文件打印结果听分离出来的人声时重点盯两处语句间的静音段底噪干不干净和音节转换处高频细节有没有掉。感觉还有混响残留可以再叠一轮去混响模型——MDX-Net 去混响接 DeEcho-Aggressive 是公认最干净的组合代价是耗时约翻倍。干净人声怎么喂给 RVC从分离到合成RVC 训练链路里的坑在于素材带着噪音的人声直接进训练合成出来的声音会连噪音一起学走。所以进阶路径其实就一条UVR5 拆出干净人声 → 对它跑预处理和 F0 提取 → 训练声库模型 → 在 WebUI 里完成音高转换与合成。习惯 CLI 的话同一个函数可以直接在 Python 里调签名依次是模型名、输入目录、人声输出目录、文件列表、伴奏输出目录、聚合度、输出格式from infer.modules.uvr5.modules import uvr for r in uvr(HP2-人声vocals非人声instrumentals, inputs, vocals, [], instruments, 12, wav): print(r)vocals/ 目录跑满之后后续环节项目里也都现成训练脚本在 infer/modules/train/音频切片、特征与 F0 提取、训练三步走完后就能在 WebUI 里直接用模型做转换。分离只是第一个环节但缺了它后面每一步都要为混着噪音的素材买单。做播客的远程访谈也好课程里想单独调 BGM 音量也好UVR5 就解决一件事把人声和背景干净地拆开。照着上面的流程把第一次分离跑通吧。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价