资讯动态

RVC部署完整指南:从安装到出声的两条路径

发布时间:2026/9/1 20:51:22 来源:尧图企业网站定制
RVC部署完整指南从安装到出声的两条路径【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI把10分钟的人声数据变成可用的AI音色模型或让麦克风以170ms的延迟实时变声——这是Retrieval-based-Voice-Conversion-WebUI下文简称RVC能做的两件事。这篇RVC部署指南覆盖Windows、Linux与macOS走完后你会在浏览器里打开训练推理界面或在桌面端接上麦克风直接听到变声后的自己。为什么是它训练门槛高→ 常规做法要大量数据和好显卡RVC用10分钟低底噪语音就能出不错的效果中端显卡也跑得动。分离人声要靠别的软件→ 内置UVR5模型在界面里选个预设就能把人声和伴奏拆开。变声后声音发闷、音高乱跳→ 音高提取用的是RMVPE算法Interspeech 2023效果显著更好且比crepe_full更省资源。基于特征的变声会漏原音色→ RVC用top1检索把源特征替换成训练集特征从机制上杜绝泄漏。A卡、I卡用户常被排除在外→ 提供AMDDirectML/ROCm与IntelIPEX加速支持。开始之前前置条件要求说明操作系统Windows / Linux / macOSWindows体验最省事有现成整合包Python3.8及以上macOS的run.sh会自动处理3.8环境显卡N卡优先A卡/I卡可用非N卡用户要换对应的依赖清单ffmpeg已安装负责音频读写Windows需将ffmpeg.exe、ffprobe.exe放在根目录预模型hubert、rmvpe、pretrained系列.pth等用tools/download_models.py一键下载磁盘数GB空闲预模型、训练日志与推理产物都要落盘两条上手路径Windows整合包一键启动步骤下载RVC-beta.7z整合包并解压包内已配好Python运行时与模型文件。双击go-web.bat等待终端打印启动信息该脚本等价于以7897端口运行infer-web.py。浏览器打开127.0.0.1:7897。✨你应该看到训练推理网页正常打开左侧有人声分离训练推理等标签页若终端直接报错或提示文件找不到多半是解压目录含中文或空格换个纯英文路径重试。Linux / macOS手动搭建最快配置方法第1步拿到代码git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI第2步安装依赖macOS走捷径sh ./run.sh会自动创建3.8虚拟环境、按requirements.txt装依赖、下载全部预模型最后直接启动界面一条命令完成。Linux / Windows先装PyTorch选择与本机驱动匹配的CUDA版本RTX 30系建议指定cu117源再按显卡类型安装对应依赖清单N卡pip install -r requirements.txtA卡DirectMLWindowsrequirements-dml.txtA卡ROCmLinuxrequirements-amd.txt个别显卡需设置HSA_OVERRIDE_GFX_VERSION环境变量I卡IPEXLinuxrequirements-ipex.txt并先执行source /opt/intel/oneapi/setvars.sh第3步下载预模型python tools/download_models.py脚本会拉取hubert_base.pt、rmvpe.pt、vocals.onnx以及pretrained与pretrained_v2两套底模和UVR5权重对应仓库里的assets目录。第4步装ffmpegUbuntu/Debian用apt install ffmpegmacOS用brew install ffmpegWindows把ffmpeg.exe和ffprobe.exe放进根目录即可。第5步启动python infer-web.py✨你应该看到终端打印出Web地址浏览器打开7897端口即出现完整界面。如果启动时报assets/... not found回到第3步补下预模型。两个使用场景训练推理模式批量产出音色模型启动方式为python infer-web.pyWindows双击go-web.bat。典型流程是在界面里依次完成人声分离、切片、训练、推理先拿一段目标人声素材训出一个音色模型再把任意干声批量转成这个音色。训练完可分享的是weights文件夹里60MB以上的.pth文件而不是logs里的大文件。适合做AI歌手、配音替换这类离线批处理任务。实时变声模式麦克风直接出效果启动方式为Windows双击go-realtime-gui.bat其他系统运行python gui_v1.py。官方实测端到端延迟170ms换用ASIO输入输出设备可压到90ms依赖硬件驱动支持。适合直播、语音通话、游戏连麦这类要求边说边变的场景。卡住了怎么办音频读取报错ffmpeg路径问题现象指定音频后读不出来或报乱码错误最可能原因文件路径含空格、括号等符号解决方式把音频移到纯英文、无空格的目录再试训练时CUDA out of memory现象训练中途显存爆掉最可能原因batch size偏大解决方式调小batch size若卡在推理检索阶段缩小configs/config.py末尾的x_pad、x_query、x_center、x_max四个参数依赖安装中途失败现象pip安装报llvmlite冲突或版本错误最可能原因Python版本不在支持区间解决方式改用3.7–3.10Poetry路径或3.8pip/run.sh路径重装环境N卡30系启动报CUDA错误现象torch能导入运行时却提示CUDA版本不匹配最可能原因PyTorch wheel的CUDA版本与驱动不一致解决方式卸载后指定cu117源重装torch、torchvision、torchaudio三个包实时变声延迟高、有卡顿现象实时模式下回音明显滞后最可能原因使用了普通声卡设备解决方式Windows换ASIO设备或调小界面中的音频块参数⚠️ 以上都没覆盖到你的情况时先翻一下中文FAQ大部分环境疑难都有现成答案。继续深入docs/cn/faq.md中文常见问题集环境报错和训练调优的第一站。docs/cn/Changelog_CN.md更新日志升级或换整合包版本前先看这里。configs/config.py全局参数文件推理检索相关参数集中在文件末尾。tools/infer/批量推理与索引训练的独立脚本适合不想打开网页、只想跑命令的场景。下一步建议先拿自己录的一段1分钟干声走一遍分离→训练→推理完整流程确认链路通了再扩展到完整数据集。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价