资讯动态

GPT-SoVITS专属音色微调指南:S1 GPT + S2 SoVITS两阶段训练手把手教程

发布时间:2026/9/3 12:50:58 来源:尧图企业网站定制
GPT-SoVITS专属音色微调指南S1 GPT S2 SoVITS两阶段训练手把手教程【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS是一款强大的少样本语音克隆与文本转语音TTS开源工具核心亮点是只需 1 分钟语音数据就能训练出高相似度的专属音色模型。它采用S1 GPT 阶段 S2 SoVITS 阶段的两阶段训练架构S1 负责把文字转成语义语音特征S2 负责把语义特征还原为自然逼真的声波。本文将带你从零开始完成一次完整的音色微调让 AI 说出你的声音。️一、GPT-SoVITS 是什么两阶段训练原理速览GPT-SoVITS 支持三种能力零样本 TTS仅需 5 秒人声样本立刻克隆音色少样本 TTS本文重点用 1 分钟左右的数据微调模型显著提升相似度跨语言推理支持中文、英文、日语、韩语、粤语两阶段训练可以这样理解阶段训练内容核心文件作用S1GPT 语义模型GPT_SoVITS/s1_train.py文本 → 离散语义 tokenS2SoVITS 声码器GPT_SoVITS/s2_train.py / GPT_SoVITS/s2_train_v3.py语义 token → 自然语音波形训练脚本由 WebUI 一键调用入口为 webui.py新手无需手动敲命令。二、环境安装一键脚本快速部署Windows 用户下载官方整合包后双击go-webui.bat即可启动或手动执行安装脚本 install.ps1conda create -n GPTSoVits python3.10 conda activate GPTSoVits pwsh -F install.ps1 --Device CU128 --Source HFLinux / macOS 用户git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128 --source HF--device可选CU126 / CU128 / CPU / MPSmacOS--source可选HF / HF-Mirror / ModelScope国内网络建议选镜像源。脚本会自动下载依赖与全部预训练模型成功后即可跳过下方模型准备步骤。也可参考 Docker 与 docker-compose.yaml 使用容器化部署。三、数据准备1 分钟语音如何加工成训练集微调质量的 80% 取决于数据。推荐流程录音 → 去伴奏 → 自动切分 → 自动转写 → 校对。1. 录音建议时长 1~2 分钟安静环境、普通话/目标语言朗读语速自然覆盖不同情绪与语调2. WebUI 内一键处理打开 WebUIpython webui.py后在数据集处理工具页签依次使用UVR5 人声分离若音频带背景音乐先用 tools/uvr5/vr.py 剥离出纯人声自动切分调用 tools/slicer2.py 按静音把长音频切成短句自动转写ASR支持 tools/asr/funasr_asr.py、tools/asr/fasterwhisper_asr.py 等多种引擎批量生成歌词/文本标签文本校对在文本标注页逐一检查并修正错字再导出最终得到一批短音频 对应文本对放入训练集目录即可。四、S1 阶段训练 GPT 语义模型在 WebUI 1-GPT 训练页签下操作特征提取后台依次执行GPT_SoVITS/prepare_datasets/1-get-text.py文本 G2P、分词GPT_SoVITS/prepare_datasets/3-get-semantic.py提取语义特征开始训练点击训练后实际运行 GPT_SoVITS/s1_train.py基于 Lightning 训练配置位于 GPT_SoVITS/configs/s1.yaml超参数建议新手照抄即可批次大小batch size显存 ≥8G 选 8不足则降到 4训练轮数epochs1 分钟数据跑 8~15 个 epoch观察 TensorBoard 曲线loss 平稳下降即可提前停止产物GPT_weights_v2/*.ckpt中的 GPT 模型文件。五、S2 阶段训练 SoVITS 声码器进入 WebUI 2-SoVITS 训练页签选择刚训好的 GPT 权重SV 特征提取执行 GPT_SoVITS/prepare_datasets/2-get-sv.py用 GPT_SoVITS/eres2net/ERes2NetV2.py 提取说话人特征向量点击训练实际运行 GPT_SoVITS/s2_train.py或 v3 版本 GPT_SoVITS/s2_train_v3.py配置位于 GPT_SoVITS/configs/s2.json常见坑提示⚠️S2 训练内存占用高建议 16G 以上内存GPT 与 SoVITS 都要选同一个说话人实验名显存不足可在 WebUI 顶部关闭半精度或调小 batch产物SoVITS_weights_v2/*.pth中的声码器文件。六、推理体验让专属音色开口说话训练完成后有三种使用方式WebUI 合成在0-前置数据集处理工具 → 1C-推理页签上传参考音频5 秒左右输入文本即可合成支持跨语言命令行合成GPT_SoVITS/inference_cli.pyAPI 服务api.py零样本 / 少样本合成接口api_v2.py新版接口支持多模型切换、批量合成、字幕对齐等python api_v2.py -a 127.0.0.1 -p 9880 -c GPT_SoVITS/configs/tts_infer.yaml 小贴士推理时参考音频选一段无背景音乐、情绪匹配目标文本的短句合成效果最自然。七、常见问题清单问题解决建议相似度不够高数据加到 3~5 分钟训练前确认已 UVR5 去噪合成有杂音/电流声检查切分是否残留静音/混响重跑 S2训练 OOM显存不足调小 batch size或启用半精度训练中文标签乱码校对 ASR 文本时注意多音字参考 GPT_SoVITS/text/tone_sandhi.py 的调变规则八、总结掌握 GPT-SoVITS 音色微调的核心路径准备 1 分钟干净人声 → UVR5 去伴奏 → 自动切分ASR 打标 → S1 训练 GPT → S2 训练 SoVITS → WebUI/API 推理。全程 WebUI 可视化操作新手半天即可跑通。更多细节可查阅 docs/cn/README.md 与更新日志 docs/cn/Changelog_CN.md。现在就去克隆那个只属于你的 AI 声音吧【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价