资讯动态

1分钟语音数据克隆你的声音:GPT-SoVITS 少样本语音合成完全指南

发布时间:2026/8/30 10:36:11 来源:尧图企业网站定制
1分钟语音数据克隆你的声音GPT-SoVITS 少样本语音合成完全指南【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个开源的声音克隆与文本转语音项目核心卖点是把语音克隆的数据门槛压到了极低1 分钟录音就能微调出像模像样的个人音色模型5 秒参考音频则可以直接零样本合成。它自带完整的 WebUI从音频切分、降噪、ASR 打标到训练、推理全链路图形化零基础用户也能跑通。核心能力速览零样本 TTS输入 5 秒人声参考立刻能把任意文本合成为该音色。不用训练、即开即用适合快速验证音色效果。少样本微调用约 1 分钟训练数据微调模型音色相似度和真实感显著提升。一次投入长期拥有自己的声音。跨语言推理支持中文、英文、日文、韩文、粤语。可以用中文录音训练再用它读英文文本。一体化 WebUI内置人声分离、自动切片、多语言 ASRFun-ASR-Nano / SenseVoice / FunASR和文本校对数据集制作不用手工标注。推理速度快v2 ProPlus 在 4090 上 RTF 约 0.0141400 词约 4 分钟音频推理仅 3.36 秒M4 纯 CPU 上 RTF 0.526 也可实时。多版本模型可选v2Pro / v3 / v4 各有取舍v4 修复了 v3 的金属音伪影并原生输出 48k 音频可按音质与硬件成本选择。从零部署三个平台的启动步骤Windows最省事下载官方整合包解压双击go-webui.bat即可启动模型、依赖全部预装好全程零命令行。这是新手推荐路径。Linux克隆仓库git clone https://link.gitcode.com/i/c98b08b5a9599fc90a344d9cf1b3bc1c后执行三行命令创建 Python 3.10 conda 环境并激活然后运行bash install.sh --device CU128 --source ModelScope --download-uvr5。脚本会自动装依赖并下载预训练模型到GPT_SoVITS/pretrained_models。macOS同样是 conda 环境加bash install.sh设备参数选MPS或CPU。注意官方说明 Mac GPU 训练质量偏低因此默认走 CPU 路线macOS 下还需brew install ffmpeg。启动后进入 WebUI运行python webui.py浏览器打开后按1-GPT-SoVITS-TTS页签做训练1C-inference页签做推理。Docker 用户也可以直接用docker compose拉起 docker-compose.yaml 中的服务。功能实操5 秒零样本合成打开推理 WebUI上传一段 5 秒左右的参考音频粘贴文本选择语言点击合成。十几秒后你能听到一段音色明显模仿参考音频的语音——这是不训练任何模型时的开箱体验适合快速试听不同参考音色的差异。1 分钟微调出专属模型进入训练页签填入一段 1~3 分钟的原始录音路径点切片把长音频切成短片段如果底噪大跑一次内置降噪然后点 ASR 自动生成文本标注在校对页面修正错字最后切到训练页签开始微调GPT 和 SoVITS 两个模型依次训完。之后切回推理页签加载刚训好的模型你会发现合成音色比零样本阶段贴合得多情绪也更自然。用 WebUI 制作训练集如果你手里只有一段带 BGM 的录音先在 tools/uvr5/ 入口做人声/伴奏分离提取干净人声再走上面的切片-ASR-校对流程。整条原始音频 → 可用数据集的链路都不需要离开浏览器。落地场景短视频与直播内容生产为固定栏目训练一个节目声音后续每期口播文本直接合成省去反复进棚用不同参考音频快速试听 2~3 个候选音色选定后再用 1 分钟数据微调定型跨语言特性可以让中文原稿直接产出英文、日文版本用于多地区分发本地化配音与有声内容把已录好的母语干声作为参考为译文生成同音色配音保持角色声音统一有小说改朗读需求时一个角色一个微调模型一人多角互不串音合成速度足够快长文本可以批量跑适合整章整部的连续生产个人数字资产与辅助应用为自己训练一个模型用于语音备忘、家庭语音助手定制音色给游戏 Demo、原型动画快速配出占位级角色语音家人声音留档用高质量录音训练模型作为数字语音纪念调优与避坑录音底噪大、合成有杂音→ 先跑内置降噪或 tools/uvr5/ 人声分离再用安静环境重录。参考音频质量直接决定零样本上限。合成出来有金属音→ 确认模型版本配套v3 的金属音问题在 v4 已修复见 V4 Release Notes不要混用不同版本的 checkpoint 与代码。1 分钟数据效果不够稳→ 官方建议 3~5 分钟更佳且覆盖不同语气与停顿训练集文本标注务必逐条校对ASR 错字会原样教给模型。显存不够 / 推理慢→ GPU 支持时开半精度is_half降显存CPU 场景可关注项目说明中的 CPU 优化推理方案批量合成时控制单批文本长度。中文合成有读错的多音字→ G2PW 模型是中文 TTS 必需的组件确认GPT_SoVITS/text下模型完整英文/日文前端在 v2 起已优化遇到读法异常先检查文本预处理环节。macOS 上训练质量差→ 这是官方已知的限制Mac GPU 训练效果明显低于其他设备日常用 CPU 推理没问题训练建议放到 Windows/Linux 或云端。生态与扩展tools/uvr5/人声/伴奏分离与去混响MDX-Net 和 bs-roformer 两套算法模型放tools/uvr5/uvr5_weights。tools/asr/多引擎语音识别FunASR、Fun-ASR-Nano、SenseVoice、Faster Whisper支持中英文日韩粤语自动检测。GPT_SoVITS/prepare_datasets/数据集自动化工具链负责文本提取、HuBERT 特征、语义 token 生成。tools/audio_sr.py 与 tools/AP_BWE_main/音频超分辨与 24k 到 48k 带宽扩展提升最终音质。GPT_SoVITS/f5_tts/、GPT_SoVITS/eres2net/Flow 骨干与说话人验证网络支撑 v2Pro 系列的高保真架构。api_v2.py 与 inference_cli.pyHTTP API 和命令行入口方便把合成能力嵌进自己的应用。tools/i18n/13 种语言界面翻译WebUI 可直接切换。未来方向从仓库 Todo List 看后续会补充更精细的情感控制或提供预训练的情感 GPT 模型、不同尺寸的轻量与增强 TTS 模型、多说话人模型混合model mix以及 SoVITS 输入从离散 token 转向 GPT 词表概率分布的实验。基础模型也在持续扩容预训练数据已从 2k 小时扩到 5k 小时可以期待零样本相似度继续走高。开始你的声音克隆GPT-SoVITS 把拥有自己的 AI 声音这件事从专业项目变成了下午就能完成的操作整合包双击启动、1 分钟录音训练、5 秒样本试听全程图形界面。MIT 许可意味着它可以自由用于个人和商业场景社区的多语言文档与 Colab 脚本也降低了求助成本。最好的音色样本就在你自己手机里现在录 1 分钟让 GPT-SoVITS 把它变成随时可用的声音资产。立即访问 项目仓库开始体验。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价