资讯动态

GPT-SoVITS 六大版本怎么选:v1/v2/v3/v4/v2Pro 完整对比与显存需求指南

发布时间:2026/9/15 20:21:53 来源:尧图企业网站定制
GPT-SoVITS 六大版本怎么选v1/v2/v3/v4/v2Pro 完整对比与显存需求指南【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个开源的少样本 TTS 与声音克隆工具TTS 即文本转语音——给它 1 分钟人声就能训出相似度很高的专属语音模型。项目迭代到现在已经积累了 v1、v2、v3、v4、v2Pro、v2ProPlus 六个版本它们的预训练规模、输出采样率、显存需求、音色表现各不相同选错了要么练不动要么效果打折。这篇文章不按版本讲故事而是先让你对着五个典型场景对号入座锁定版本再用一张总表看清六者在语种、采样率、显存、音色风格上的全部差异最后附上版本切换和权重管理的实操细节。看完后你可以直接回答三个问题我的显卡该跑哪个版本、训练入口文件是哪个、不同版本的模型能不能混用。先看你的场景五类需求直接定版本选型的第一原则不是哪个版本新而是你的硬件和训练素材配哪个版本。下面是五种常见处境对应的结论依据放在后面的总表里。你的处境推荐版本一句话理由纯新手、显卡低配只想先跑通流程v2社区教程和模型分享最多显存最省显卡 ≥12GB追求音质上限v4原生 48kHz 输出且修掉了 v3 的金属音训练音频是手机录音、带底噪v2 或 v2Prov3/v4 对平均音质一般的语料反而不友好直播、实时合成等对速度敏感v2ProPlusRTF 极低并支持流式推理手上已有 v3 训好的项目升级到 v4作者定位 v4 就是 v3 的直接替代基本无脑升⚠️ 如果你的显存只有 8GB 却想用 v3唯一的路径是 LoRA 微调一种只训练少量附加参数、而非全部参数的轻量训练方式8GB 即可跑通全量微调则约需 14GB开启梯度检查点可压到 12GB。六大版本差异总表下面这张表是全文信息密度最高的一块建议截图保存。各版本完整的演进记录可查官方日志 docs/en/Changelog_EN.md 与中文文档 docs/cn/README.md。维度v12024 年初v22024.08.21v32025.02.28v42025.04.22v2Pro / v2ProPlus2025.06支持语种中/英/日在 v1 基础上新增韩语、粤语同 v2同 v2同 v2预训练语料约 2k 小时约 5k 小时更大规模同 v3同 v3输出采样率32kHz32kHz24kHz可超分48kHz32kHz显存要求低低高LoRA 8GB 起高中等音色来源偏整个训练集偏整个训练集偏参考音频偏参考音频偏整个训练集低质量训练集表现尚可较好不推荐不推荐较好教程/生态丰富度多最多多中快速积累中两个概念先解释清楚偏参考音频 vs 偏整个训练集前者指合成音色更像你提供的那段参考音频对参考音频质量敏感后者指音色更像整批训练素材的平均水平对平均音质一般的素材更宽容。可超分v3 原生只出 24kHz 音频部分用户会觉得闷项目内置了 24k→48k 的音频超分功能来缓解见 tools/audio_sr.py而 v4 从源头解决了这个问题。三条技术路线看懂版本背后的取舍把六个版本按底模架构分成三族差异逻辑一下就通了。老一代 v1/v2低成本通用款v1 是 2024 年初的开山之作2k 小时预训练只覆盖中、英、日三语但硬件门槛最低老显卡、低显存机器都能跑适合作为体验 1 分钟克隆的入门款。它现在已属历史版本不再有新特性投入新项目不建议首选。v2 在 2024.08.21 发布四项升级全部来自官方 V2 更新说明新增韩语、粤语预训练语料从 2k 小时扩到 5k 小时换了全新文本前端多音字和中英混读更准对低质量参考音频的合成效果明显改善。加上社区生态最成熟v2 至今是第三方教程和模型分享的主流底座。新一代 v3/v4架构升级吃掉显存v3 是一次架构级换代2025.02.28 发布收益集中在三点音色相似度更高少样本甚至零样本不训练直接推效果都有明显提升GPT 部分更稳定重复、漏字更少更容易合成带情绪的表达新增 LoRA 训练把微调显存需求降到约 8GB。代价同样明确原生 24kHz 输出、对训练集音质要求更高、音色更贴参考音频。v42025.04.22 发布是对 v3 两个痛点的定向修复一是修掉非整数倍上采样引入的金属音二是改为整数倍上采样并原生输出 48kHz声音闷糊的问题随之消失。作者明确表态 v4 是 v3 的直接替代已在用 v3 的项目升 v4 基本无损。v2Pro 家族新底模 旧成本2025 年 6 月发布的 v2Pro/v2ProPlus 是目前综合表现最好的性价比款性能超过 v4但硬件成本和推理速度回到 v2 水平。v2ProPlus 的 RTF实时率即合成 1 秒音频所需的秒数越低越快实测为 4060Ti 约 0.028、4090 约 0.014合成 1400 词约 4 分钟音频仅需 3.36 秒。它的音色行为与 v1/v2 同族——贴合整个训练集而非只贴参考音频所以平均音质一般的训练集反而更适合它。另外这一系列支持流式推理实现见 GPT_SoVITS/stream_v2pro.py。版本切换与权重管理实操结论先行各版本模型互不通用但底模和目录都帮你隔离好了切换成本主要在重新训练。每个版本训练出的 GPT/SoVITS 权重存放在独立目录里映射关系统一登记在 config.py版本权重目录v1SoVITS_weights/GPT_weightsv2SoVITS_weights_v2/GPT_weights_v2v3SoVITS_weights_v3/GPT_weights_v3v4SoVITS_weights_v4/GPT_weights_v4v2ProSoVITS_weights_v2Pro/GPT_weights_v2Prov2ProPlusSoVITS_weights_v2ProPlus/GPT_weights_v2ProPlus因为目录互相隔离你可以在同一环境里同时保留多个版本的模型切换时不互相干扰。怎么启动不同版本的主 WebUI入口是 webui.py不带参数时进入当前版本v2 及以上带参数可指定 v1python webui.py v1训练入口按版本独立别拿错脚本v1/v2 → GPT_SoVITS/s2_train.pyv3/v4 → GPT_SoVITS/s2_train_v3.pyv3 的 LoRA 训练 → GPT_SoVITS/s2_train_v3_lora.py推理端各版本预训练权重路径如 v2Pro 的s2Gv2Pro.pth、v4 的s2Gv4.pth统一注册在 GPT_SoVITS/TTS_infer_pack/TTS.py 的默认配置中推理参数模板在 GPT_SoVITS/configs/tts_infer.yaml在推理 WebUI 里可以手动切换版本。服务端部署时v3/v4 可导出为 TorchScript 加速脚本位于 GPT_SoVITS/export_torch_script_v3v4.py。高频问题 FAQQ1v2 训的模型能直接拿到 v4 上推理吗不能。GPT/SoVITS 权重按版本分目录管理跨版本不通用想换版本就重新训练底模预训练权重复用即可。Q2为什么 v3 听起来比 v4闷v3 原生 24kHz高频信息本身有损失v4 改用整数倍上采样并原生输出 48kHz高频更完整同时消除了金属音。Q3显存只有 8GB能玩 v3 吗可以走 LoRA 微调路线。v3 官方支持 8GB 显存完成 LoRA 训练这也是 v3 系列对低显存用户最友好的入口全量微调约 14GB开梯度检查点可压到 12GB。Q4怎么确认自己下载的是哪个版本的预训练权重查看GPT_SoVITS/pretrained_models/目录s2G488k.pth对应 v1gsv-v2final-pretrained/对应 v2s2Gv3.pth对应 v3gsv-v4-pretrained/对应 v4v2Pro/对应 v2Pro 系列。 拿到不确定的权重文件时先用这个目录对一遍再开始训练。Q5v1 还值得用吗只作为低配机器的历史存量方案。v1 属于历史版本没有新特性投入同样低显存的新项目更推荐显存需求相近但生态更成熟的 v2。✅结语三句话记住选型规则低配先跑 v2高配直接 v4追求性价比与速度选 v2ProPlus——如果你的训练音频质量一般就把 v3/v4 换成 v2 或 v2Pro。按这个顺序对照上面的总表和权重目录GPT-SoVITS 的版本选择问题就可以一次定下来。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价