ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

GPT-SoVITS 声音克隆六大版本终极选型指南:v1/v2/v3/v4/v2ProPlus 一分钟选对

2026/9/15 18:27:10 拓冰建站 浏览量
GPT-SoVITS 声音克隆六大版本终极选型指南:v1/v2/v3/v4/v2ProPlus 一分钟选对 GPT-SoVITS 声音克隆六大版本终极选型指南v1/v2/v3/v4/v2ProPlus 一分钟选对【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一款少样本语音合成与声音克隆工具1 分钟人声即可训练出高相似度专属音色。但它的 GPT-SoVITS 版本一多——v1、v2、v3、v4、v2Pro、v2ProPlus 共六个——新手经常不知道 GPT-SoVITS 版本怎么选。这篇文章不绕弯子先给你可直接套用的决策清单再展开讲每个版本背后的取舍最后把切换、训练、部署的实操一次讲清。结论先行按场景直接抄作业不确定 GPT-SoVITS v4 和 v2Pro 区别时对照下表 30 秒定版你的情况直接选一句话理由显卡显存低、第一次跑通流程v2教程最多、显存最省社区教程基本都基于它显卡 ≥12GB、要音质上限v448kHz 原生输出无金属音是 v3 的完全替代训练音频是手机录音、有底噪v2 或 v2Pro对平均音质一般的语料更友好直播 / 实时 TTS要快v2ProPlusRTF 实测 4060Ti 约 0.028、4090 约 0.014且支持流式推理手上已有 v3 项目直接升 v4官方定位就是 v3 的无损替换 记住三句话低配跑 v2高配上 v4要速度要性价比选 v2ProPlus。下面的内容解释为什么这么选。一分钟看懂版本差异表六版本横向对比这张表浓缩了发布时间、能力与代价看完基本可以定版维度v1v2v3v4v2Pro / v2ProPlus发布时间2024 年初2024.08.212025.02.282025.04.222025.06支持语种中/英/日韩/粤同 v2同 v2同 v2预训练语料2k 小时5k 小时更大规模同 v3同 v3输出采样率32kHz32kHz24kHz可超分48kHz32kHz显存门槛低低高LoRA 8GB 起高中等音色取向贴训练集贴训练集偏参考音频偏参考音频贴训练集低质语料表现尚可较好不推荐不推荐较好生态成熟度多最多多中快速积累中两条主线看懂这张表音质线v2 → v3/v4 换用新架构相似度、情绪表现力上台阶但 v3 只输出 24kHz 偏闷v4 用整数倍上采样修复金属音并原生 48kHz。性价比线v2Pro 系列把性能做到超过 v4硬件成本却拉回 v2 水平。版本深度解读按用途分三组而不是按序号数第一组现在就能上手的 v2 与 v2Pro / v2ProPlusv2是生态最完整的版本相比 v1 新增韩语、粤语预训练语料从 2k 小时扩到 5k 小时文本前端重写后多音字和中英混读更准对低质量参考音频也明显更稳。绝大多数第三方教程和模型分享都基于它。所以你应该新手第一次训练选 v2遇到问题最容易搜到答案。v2Pro / v2ProPlus2025 年 6 月发布是当前综合评分最高的一档性能超过 v4但推理速度和显存占用回到 v2 水平v2ProPlus 速度实测4060Ti RTF 约 0.0284090 约 0.0141400 词约 4 分钟音频只需 3.36 秒和 v1/v2 同族音色贴合整个训练集而非单条参考音频平均音质一般的训练集照样能训支持流式推理入口见 GPT_SoVITS/stream_v2pro.py所以你应该做直播、语音助手、批量生产这类实时场景直接上 v2ProPlus训练集质量一般又想要更好效果选 v2Pro。第二组高配旗舰 v3 与 v4v32025.02.28 发布是架构级升级三个提升很实在音色相似度明显变高少样本甚至零样本不训练直接推效果都更好GPT 更稳定重复、漏字更少带情绪的表达更容易合成新增 LoRA 训练微调显存约 8GB全量微调约 14GB开梯度检查点可压到 12GB代价有两个原生 24kHz 输出部分人听感偏闷项目内置了 24k→48k 音频超分见 tools/audio_sr.py对训练集音质要求更高且音色更偏参考音频。所以你应该只把 v3 当作 v4 的前身来理解新项目直接跳过。v42025.04.22 发布就是冲着 v3 这两个痛点来的修复非整数倍上采样导致的金属音原生输出 48kHz闷糊问题彻底消失作者明确说 v4 直接替代 v3。所以你应该显卡 12GB 起步、追求音质上限就选 v4已经在用 v3 的项目升级 v4 基本无脑。第三组历史版本 v1v1 是开山之作2k 小时预训练中/英/日三语混合硬件要求最低老显卡低显存也能跑。它现在没有任何新特性投入保留的意义只是先体验 1 分钟克隆和存量老模型。所以你应该除非维护旧项目否则新项目不要从 v1 开始。切换版本与部署实操这些细节最容易被忽略训练产物按版本隔离互不干扰。各版本的 SoVITS 权重分别存在SoVITS_weights、SoVITS_weights_v2、_v3、_v4、_v2Pro、_v2ProPlus六个目录GPT 权重同理映射逻辑在 config.py。同一套环境可以同时保留多个版本的模型。按版本启动与训练。主 WebUI 入口是 webui.py当前默认版本为 v2Pro想跑 v1 就用python webui.py v1训练脚本按版本分流v1/v2/v2Pro/v2ProPlus 走 GPT_SoVITS/s2_train.pyv3/v4 走 GPT_SoVITS/s2_train_v3.pyv3 的 LoRA 微调见 GPT_SoVITS/s2_train_v3_lora.py。各版本预训练权重文件对应关系。都在GPT_SoVITS/pretrained_models/下版本SoVITS 底模文件v1s2G488k.pthv2gsv-v2final-pretrained/s2G2333k.pthv3s2Gv3.pthv4gsv-v4-pretrained/s2Gv4.pthv2Pro / v2ProPlusv2Pro/s2Gv2Pro.pth/v2Pro/s2Gv2ProPlus.pth这些路径统一注册在 GPT_SoVITS/TTS_infer_pack/TTS.py 的默认配置里推理参数模板在 GPT_SoVITS/configs/tts_infer.yamlv2Pro 系列还有独立的 GPT_SoVITS/configs/s2v2Pro.json 和 GPT_SoVITS/configs/s2v2ProPlus.json。推理 WebUI 里可直接切换模型版本不用重启。服务端部署加速。v3/v4 可导出 TorchScript 加速脚本是 GPT_SoVITS/export_torch_script_v3v4.py。 各版本完整演进记录见官方更新日志 docs/cn/Changelog_CN.md总览文档见 docs/cn/README.md。高频疑问 FAQQ1v2 训练的模型能在 v4 上推理吗不能。权重按版本分目录管理跨版本不通用换版本要重新训练底模预训练权重可以复用不用重下。Q2为什么 v3 听起来比 v4 闷v3 原生 24kHz高频信息有损失v4 改用整数倍上采样并原生输出 48kHz金属音也一并消除。Q3显存只有 8GBv3 还能用吗能走 LoRA 微调路线即可。官方支持 8GB 显存完成 v3 的 LoRA 训练这是 v3 系列对低显存用户最友好的入口。Q4怎么确认自己下载的预训练权重是哪个版本看GPT_SoVITS/pretrained_models/目录里的文件名对照上文预训练权重文件对应关系表格即可。Q5v2Pro 和 v2ProPlus 到底差在哪Plus 是更快的档位实测 RTF 4060Ti 约 0.028、4090 约 0.014适合实时场景显存一般且对延迟不敏感时v2Pro 足够。最后收个尾显存吃紧选 v212GB 以上追音质选 v4实时和性价比选 v2ProPlus。版本之间训练产物隔离、底模可复用试错成本很低——拿一条 1 分钟音频把候选版本各推一遍耳朵选出来的答案不会错。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考