GPT-SoVITS 少样本语音克隆完整教程从 5 秒录音到专属声音模型【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS如果你手里只有一段 5 秒的人声录音能不能让它读出一整篇文章GPT-SoVITS一个开源的少样本语音克隆与文本转语音工具就是解决这个问题的5 秒录音可以直接零样本合成1 分钟录音可以微调出一个音色更接近本人的专属模型。本文带你在自己电脑上完整走一遍装好环境、即时推理、准备数据、训练模型、对比效果。先跑起来在三种机器上安装 GPT-SoVITS这一节的目标只有一个让浏览器打开 GPT-SoVITS-WebUI 控制面板WebUI 就是浏览器里的图形化操作界面后面所有步骤都在它里面完成。Windows用整合包最省事下载 GPT-SoVITS 的 Windows 整合包下载地址见 中文文档。解压后双击目录里的go-webui.bat。运行后浏览器会自动打开 WebUI 页面看到左侧 0-音频预处理、1-GPT-SoVITS-TTS 这样的页签树就说明环境已经就绪不需要再做任何配置。Linux / macOS三条命令装完git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128 --source HF--device按你的机器选NVIDIA 显卡按 CUDA 版本填 CU126 或 CU128AMD 填 ROCM纯 CPU 填 CPUMac 填 MPS。--source选模型来源国内网络可以换成HF-Mirror或ModelScope。运行后你会看到依赖包和预训练模型逐项下载全部完成后执行python webui.py浏览器打开且页面无报错安装就算成功。装好的模型默认放在GPT_SoVITS/pretrained_models如果脚本没跑成功才需要手动补中文合成还需要把 G2PW 模型放到GPT_SoVITS/text目录下G2PW 负责中文多音字选音。合成第一句声音零样本推理只需 5 秒这一节用最小成本验证环境可用不训练任何模型直接听效果。在 WebUI 左侧点开1-GPT-SoVITS-TTS/1C-inference页签。上传一段目标声音的参考音频5 秒左右即可。输入要合成的文本选择语言点击合成。合成完成后你会听到一段和参考音频音色接近的声音读出文本。零样本模式zero-shot即不训练、直接模仿参考音频支持中文、英文、日语、韩语和粤语音色每次略有浮动第一次先确认能不能用就够了。准备 1 分钟训练数据零样本只是试驾车想让声音稳定地像那个人需要微调。微调的前提是拿到一批带文字标注的音频。收集目标人声 1 到 3 分钟的干净录音放进同一个文件夹。在 WebUI 的0-音频预处理页签里先做音频切割slicing把长录音切成十几秒以内的短片段。如果录音里有背景音乐或噪声可选地先跑降噪UVR5 负责把人声从伴奏里分离出来。用内置的 ASR语音识别把声音转成文字自动转写每个片段。打开校对界面逐条修正识别错的字。做完后检查生成的.list文件每行是四段、用竖线分隔音频路径|说话人名称|语言代码|文本内容语言代码对应 zh中文、en英文、ja日文、ko韩文、yue粤语。每一行的音频能对上文字这一步就算合格。微调训练专属声音模型这一节把预处理好的数据变成两个模型文件。GPT-SoVITS 的训练分两段S1 阶段训练 GPT 模型负责把文字转成语义序列S2 阶段训练 SoVITS 模型负责把语义序列还原成声音波形。在 WebUI 中填写训练数据所在目录路径自动补全功能会帮你定位文件。程序按切割、降噪可选、ASR、校对的顺序处理数据上节已全部做好的话直接跳到训练。切到训练页签点击开始训练等待 S1 和 S2 两个阶段跑完。训练结束时数据目录里会多出新的.ckpt和.pth模型文件这就是你声音模型的记忆。首次训练耗时较长中途进度条停顿属正常现象耐心等即可。用新模型合成并对比效果训练的价值要靠对比体现而不是凭感觉判断。回到1C-inference页签在模型下拉框里选中刚训练出的 GPT 和 SoVITS 模型文件。参考音频仍用之前那 5 秒样本文本也保持和零样本那次完全相同。合成后把两次结果并排听。如果微调版音色更稳、偏音更少、情绪更自然说明训练成功如果差距不大通常是因为训练数据太短或有噪声可以补充干净录音后重新训练。常见问题与优化建议显存不够时开启半精度模式half-precision用更低精度换更少的显存占用Docker 部署把环境变量is_half设为 trueWebUI 里也有对应开关能明显降低显存压力。按数据质量选基础版本训练集音质一般时 v2 系列更稳v3/v4 音色相似度更高合成音色更贴近参考音频v4 还修复了 v3 的金属音问题并原生输出 48kHz 高采样率音频。推理速度参考RTF即合成 1 秒音频需要的计算秒数v2 ProPlus 在 RTX 4060 Ti 上约 0.0284090 上约 0.0144 分钟长文大约 3.4 秒出结果Mac M4 纯 CPU 也能跑。习惯命令行的话单独打开 UVR5 页面可以用python tools/uvr5/webui.py cuda True 7860批量转写和推理也有对应脚本入口在tools/asr/目录下。想把合成能力接进自己的程序可以直接调用 api_v2.py 提供的接口服务。跑通之后还能做什么把目标人声录音扩到 3 到 5 分钟再训一次和 1 分钟版本对比看相似度提升多少。试试跨语言推理用中文训练的数据直接输入英文或日文文本验证合成是否可用。需要查参数细节或版本更新历史时翻 中文文档 和 更新日志比翻代码快得多。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考