资讯动态

RVC变声器:普通显卡10分钟训出你的AI音色

发布时间:2026/10/3 17:26:49 来源:尧图企业网站定制
RVC变声器普通显卡10分钟训出你的AI音色【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVC 是社区里做音色转换最常被用到的工具十几分钟质量过关的清唱就能在普通 N 卡上练出一套你自己的 AI 声音。下面不按装、训、推的顺序走而是把新手最容易卡住的 4 个地方直接摆出来每个都讲清楚怎么做、做对之后长什么样。读完全文你手里应该有一份能在推理页选中的模型文件和索引。按显卡挑依赖文件把 7865 端口跑起来 ⚠️requirements 文件怎么选仓库带了 3 份依赖清单各对应一类硬件选错后 torch 一整条链都会打架显卡清单文件装法RTX 50 系以前requirments_cu118_py312.txt分两步RTX 50 系requirments_cu128_py312.txt分两步A 卡 / I 卡 / CPUrequirments_cpu_py312.txt一步到位N 卡两份都是两步走先装对应 CUDA 版本的 torch版本须低于 2.8再装其余依赖pip install torch2.7.1cu118 torchaudio2.7.1cu118 pip install -r requirments_cu118_py312.txt第二行按你的卡换文件名CPU 清单一条命令即可。动手前确认两件事解释器是Python 3.12 x64FFmpeg 是读音频的嘴缺了所有音频处理都会罢工。装完在 REPL 里跑一下torch.cuda.is_available()结果为 True 说明显卡已识别。预训练权重目录要备齐依赖只是骨架训练、推理都要从assets/里取文件程序一跑缺哪个就会报哪个路径作用必须assets/hubert_base/说话人嵌入是assets/rmvpe/rmvpe.pt基频跟踪是assets/pretrained/、pretrained_v2/v1 / v2 底模训练要assets/uvr5_weights/人声与伴奏分离可选README 里写了下载来源逐份下到对应子目录即可。启动与端口一条python webui.py起界面端口默认7865想换加--port 7866。门口两个卡点浏览器报 Connection Error十有八九是黑色控制台窗口被关了或者 7865 被其他进程占用弹出Expecting value系统或全局代理在作怪本地和服务端代理都关掉再刷新。自查信号控制台打印出 7865 的地址浏览器侧弹出训练推理页面顶部能看到显卡名。一键训练epoch 和 batch size 怎么取数据精选优于堆量项参考值理由总时长10~50 分钟太短音色学不出来太长白等单段5~10 秒过长易爆显存、尺寸对不上采样率48k选一个用到底底噪目标 -60dB底噪越大轮数越不敢拉素材丢进logs/你的实验名/对应子目录剩下的切分交给一键训练按钮自动做。❌ 堆几小时录音 ✅ 精选 10~50 分钟清唱就够了。必须你拍板的两个参数batch_size默认约为显存 GB 数的一半紧张就调小最低1total_epoch带噪素材 20~30 足够极干净清唱可到200。轮数拔太高模型容易把答案背下来而不是学会音色。采样率要和数据一致。中途改等于换了个实验换新实验名重训即可。自查信号日志末尾出现Training is done. The program is closed.紧跟其后的红色报错是假的别被吓退。60MB 的 pth 去哪找 两个 pth 只有一个能要文件体积用途logs/实验名/G_*.pth几百 MB存训练状态接着练用assets/weights/xxx.pth60MB推理、分享❌ 把 logs 的大 pth 发出去 ✅ 把 weights 下的 60MB pth 发出去。这步我当年也卡了二十分钟——前两次都把 logs 里的大 pth 当模型用推理页一直报 f0、tgt_sr 这类 key 不存在。已经踩坑也不用重训到 ckpt 选项卡做提取小模型输入指向 G 开头的文件assets/weights/ 下会多出一个 60MB 的新文件。索引为什么不能省added_*.index由一键训练末段的训练索引环节产出。索引的活儿是输出开始像源音时从训练集里捞最接近的音色特征贴上去。缺了它漏不泄漏全凭裸模型发挥。一键训练结束没看到它多半是训练集太大卡住了这一步——再到训练页点一次训练索引按钮补生成。自查信号assets/weights/里有 60MB 的 pth实验目录里有added_*.index推理页点刷新音色新模型能进下拉框。出声不对味Index Rate 怎么拉 ️最值得调的那一个滑块底层逻辑见 infer/vc/索引特征按权重混进结果。素材质量滑块位置效果好于源音频0.6~0.8音色稳不泄漏差于源音频0.6再拉只会更糊长且高质量不敏感基本可忽略拉到 1 确实能堵住泄漏代价是音色死死咬住训练集素材。新手先拉到 0.6~0.8边 AB 边微调。报错对表查症状原因解法llvmlite.dll 缺失没装 VC 运行库装 2015-2022 版ffmpeg error路径含空格、中文换无空格英文路径Cuda out of memory显存不够降 batch推理端看 x_* 配置张量尺寸错训练集混了坏短段删掉异常小的 wav 重训key 不存在用了 logs 大 pthckpt 页提取小模型configs/config.py 末尾的x_pad / x_query / x_center / x_max会按显存大小自动变小放着别动。更多问题都按症状格式写在 docs/cn/faq.md直接搜报错原文。出声对味后可以接上 realtime_gui.py 开实时变声接麦即用最低延迟约 170ms数据切分与 batch 的更深入原理见 docs/en/training_tips_en.md。四个卡点走完环境只是门票音色真正的差距在数据里。接下来值得干两件事去 ckpt 选项卡试两组比例把两个音色融出第三种换一批数据做一组 A/B 对照训练这时才算真正把 RVC 玩明白了。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑