免费RVC WebUI教程10分钟语音练一个AI歌手【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVC WebUIRetrieval-based-Voice-Conversion-WebUI是一个基于 VITS 的免费开源 AI 变声工具能用 10 分钟语音样本训练出可唱歌的 AI 声线模型。它提供网页训练推理、实时变声和 UVR5 人声分离三类功能基于 MIT 协议。有 4GB 显存的显卡即可运行适合想制作 AI 翻唱、配音的普通用户无需写代码。初见了解这个项目到底是什么它是什么基于 VITS 的语音转换变声框架底层用检索式特征替换来防止音色泄漏。能做什么训练自己的 AI 声线、转换整首歌、麦克风实时变声、分离人声与伴奏。适合谁想做 AI 翻唱、视频配音、直播变声的内容创作者零代码。上手需要什么4GB 以上显存的显卡、Python 3.8 以上、ffmpeg以及 10 分钟干净人声。效果参考10 分钟数据即可得到可用模型实时变声端到端约 170msASIO 设备约 90ms。准备清单动手前核对一下类别要求备注显卡NVIDIA / AMD / Intel 均可4GB 显存可起步6GB 更从容Python3.8 以上依赖需按显卡选对应清单安装ffmpeg必须安装音频处理底层依赖预模型assets 目录下的权重用 tools/download_models.py 下载人声数据10 至 50 分钟44.1kHz WAV底噪低、无背景音乐、无破音动手实践六步跑通第一个模型1. 克隆仓库git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI把项目源码拉到本地后文所有路径都相对于这个目录。2. 安装 Python 依赖pip install torch torchvision torchaudio pip install -r requirements.txt第一条装 PyTorch 核心第二条装项目其余依赖AMD 卡改用requirements-amd.txt。3. 下载预训练模型python tools/download_models.py把推理和训练要用的底模放进assets/首次启动前只需执行一次。4. 启动 Web 界面python infer-web.py终端打印出地址后会自动弹出浏览器训练、推理、模型融合都在这个界面完成Windows 用户也可直接双击go-web.bat。5. 格式化数据并一键训练进入训练集格式化选项卡填实验名、音频文件夹路径选采样率32k 或 48k点一键训练。看到Training is done即成功成品模型约 60MB落在assets/weights/。6. 推理验证与实时变声切到推理选项卡刷新音色选中刚训练好的模型上传测试音频音高算法选 RMVPE索引比率先设 0.5点转换即可试听。想体验实时变声再执行python gui_v1.py打开麦克风实时变声界面选输入输出设备后说话立刻听到 AI 音色。关键参数解读新手只需盯这五项参数建议值作用总训练轮数50 至 100轮数太少音色不稳音质一般的训练集超过 200 意义不大批大小4显存小则调 1 至 2决定单次处理的样本量直接影响显存占用索引比率0.5 起步抑制音色泄漏越高越贴近训练集原始音色音高算法RMVPE提取音高效果最好且比 crepe_full 更快、占用更小采样率48k48k 音质更好32k 更快更省显存默认学习率1e-4、批大小4记录在 configs/v1/48k.json 中新手不建议改动。避坑问答高频问题速查显存不够Cuda out of memory怎么办训练调小批大小推理调小 configs/config.py 末尾的 x_pad、x_max 等参数。训练结束后没有.index索引文件训练集太大可能卡住回界面再点一次训练索引即可。训练完推理列表里没有新音色先点刷新音色没有就查logs/实验名/下的日志。分享模型要发哪个文件发assets/weights/下 60MB 以上的 pthlogs/下的大 pth 是训练状态不能用于推理。实时变声延迟高换 ASIO 声卡可压到约 90ms并调小音频缓冲区。报 ffmpeg error / utf8 error多半是路径带空格、括号或中文把文件夹挪到纯英文路径再试。界面提示Expecting value: line 1...关闭系统的局域网或全局代理后重试。更多问题可查 docs/cn/faq.md。创意延展这些玩法可以试起来AI 翻唱用目标声线翻唱整首歌先用 UVR5 分离出干声转完再叠回伴奏。视频配音批量跑 tools/infer_batch_rvc.py让整期节目声音风格统一。直播实时变声python gui_v1.py打开实时界面麦克风进、AI 声音出适合 K 歌和聊天。模型融合在 ckpt 选项卡用 ckpt-merge 把两个声线按权重混合得到新的中间音色。收尾今天就能做完的四件事备一份 10 至 50 分钟的干净人声放好路径按上述六步完成第一次训练。用一首熟悉的歌做首次推理对比原声调整索引比率。跑一次实时变声感受 170ms 延迟下的实际体验。进阶设置显卡选择、显存优化、参数细节参考 configs/config.py 与 docs/cn/faq.md。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考