资讯动态

GPT-SoVITS保姆级实战:用1分钟录音克隆自己的声音,从安装到玩出花

发布时间:2026/8/20 1:26:00 来源:尧图企业网站定制
GPT-SoVITS保姆级实战用1分钟录音克隆自己的声音从安装到玩出花【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS做短视频的人可能都有过这样的深夜为了一段配音反复录音嗓子哑了AI 音色又一听就是电音机器人。如果你也想要一个声音像自己的配音工具GPT-SoVITS 就是答案——这是一个开源的少样本语音克隆项目只需要 5 秒参考音频就能零样本合成给到 1 分钟语音数据还能微调出相似度更高的专属音色。下面我会按先跑通、再变好、后玩花的节奏带你走一遍。全程不聊底层原理只讲你动手时真正会碰到的东西。二十分钟跑通第一个零样本案例先装环境。三种方式任选Windows 用户下载整合包解压后双击根目录的go-webui.bat浏览器会自动弹出 WebUI。Linux / macOS 用户依次执行下面三行命令。conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128 --source ModelScope --download-uvr5安装脚本会顺带把预训练模型下载到GPT_SoVITS/pretrained_models省去手动搬模型的功夫。如果是手动部署也可以先拉代码再装依赖git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS装好后运行python webui.py打开页面切到1-GPT-SoVITS-TTS / 1C-inference新版也叫 0-Fast-WebUI就能开始零样本合成了。整个过程只需要三样东西一段 5 秒左右的参考音频你想要模仿的那个声音这段音频里说出的那句话参考文本一段你想让 AI 说的话合成文本填好这三项点一下合成按钮。几秒后你会听到一个声音它正在读你写的内容——这就是零样本语音克隆。️ 小提示参考音频选 44.1kHz 以上、无背景噪音的录音效果差异非常大。随便用一条嘈杂的语音备忘录出来的声音会明显糊。新手最容易踩的坑参考文本必须和你参考音频里说的内容一致一字不差。如果你随手填了别的话模型会听不明白参考音频合成结果立刻跑偏。把 5 秒换成 1 分钟微调声音会更像你零样本快但相似度有上限。想让成品音色更贴原声、情绪更自然就做一次少样本微调。先看下面这张对比决定自己走哪条路对比维度零样本合成1 分钟微调需要的素材一段 5 秒参考音频1 分钟左右音频 对应文字上手时间几分钟半小时上下音色相似度接近但细节有限明显更贴近语气更稳适合场景临时试听、快速验证正式内容、长期复用微调前要先准备数据集WebUI 里已经内置了一条自动化流水线按顺序走就行切片在数据集处理里填上音频路径系统会自动把长音频切成若干小段剔除过长的静音。降噪可选素材背景不干净就做一步降噪用 WebUI 里的 denoise 工具一键处理。自动标注用内置的 ASR 引擎默认 Fun-ASR-Nano也可换 SenseVoice给每段音频生成文字稿。校对这一步别跳过。ASR 偶尔会把同音字写错而训练吃的是音频文字的配对关系错一个字都会拖累效果。训练切到训练页签填好路径和实验名其余参数保持默认即可启动。 新手容易踩的坑训练文本的格式是音频路径|说话人|语言|文字语言代码用zh中文、en英文、ja日文、ko韩文、yue粤语。如果你手动整理数据文件注意分隔符是竖线|不是空格。让微调效果更好的三个小设置素材不够 1 分钟时可以适当增大total_epoch多跑几轮补偿数据量显存紧张就把batch_size调小8GB 显存的入门卡也能顺畅跑完训练日志里如果 loss 不再下降就早点停过拟合反而会让音色发僵。声音到手之后还能玩出这些花样模型训练完你的声音就不再只属于你本人了跨语言朗读用中文素材训练的模型可以直接让它读英文、日文、韩文甚至粤语文本口音会带着原声的特色适合做多语言内容。从歌曲里提取音色内置的 UVR5 人声分离工具tools/uvr5能把一首歌里的人声和伴奏分开你直接用干净人声当训练素材做翻唱类内容非常顺手。接入自己的程序项目提供了api_v2.py的 HTTP 接口文本、参考音频、采样参数都能通过请求下发接进自己的脚本或应用只要几十行代码。导出加速模型想要更快的推理或部署到无 Python 环境可以用export_torch_script.py或onnx_export.py导出优化后的模型。另外项目里有多个模型版本可选v2 强化了中英日韩粤的多语言支持v3 用更少数据就能逼近目标音色v4 原生输出 48kHz 并修复了 v3 的金属声问题v2Pro 则兼顾了速度和音质。日常使用建议直接选最新稳定版本别把不同版本的权重混着加载。新手最常问的三个问题先看这个能少走弯路我的电脑只有 8G 显存跑得动吗完全没问题。项目支持从 CPU 到中端显卡的全梯度部署官方实测 v2 ProPlus 在 4060Ti 上推理加速比约 0.028大约一分钟音频只要一两秒算完。没有 N 卡的话纯 CPU 也能合成只是训练阶段会慢一些。为什么合成的语音有点机械或金属感十有八九是模型版本混用了GPT 权重和 SoVITS 权重不是同一版本或者声码器不匹配。解决办法是清空pretrained_models里的旧文件重新下一整套同版本权重再重试一次。1 分钟数据真的够用吗录音有什么讲究够入门但素材质量比时长更重要。优先录干净、无喷麦、无回声的内容尽量带一点不同语气陈述、疑问、带笑的这样模型学到的情绪更丰富。别用压缩过度的聊天语音文件那种素材神仙也救不回来。今晚就能做的第一个实验现在打开 WebUI 的0-Fast-WebUI页签做这几步用手机在安静房间里录 5 秒自己说话的声音传上去在参考文本框里把你说的话原样打出来在下方的文本框里输入一句你一直想听自己说的话点合成戴上耳机听第一句。如果这一步成功了再往前推一步把素材攒到 1 分钟走一遍切片→降噪→标注→微调那是你真正拥有专属音色的开始。仓库地址在 https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS clone 下来、跑起 WebUI剩下的就交给你的第一段录音了。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价