ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

GPT-SoVITS 声音克隆教程:1 分钟录音练出你的专属 48kHz TTS 音色

2026/9/7 8:18:40 拓冰建站 浏览量
GPT-SoVITS 声音克隆教程:1 分钟录音练出你的专属 48kHz TTS 音色 GPT-SoVITS 声音克隆教程1 分钟录音练出你的专属 48kHz TTS 音色【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS先说结论GPT-SoVITS是一个开源的少样本 TTS文本转语音项目——你给它5 秒参考音频它就能零样本克隆你的音色再喂1 分钟干净人声做微调相似度会再上一个台阶。v4 版本直接输出48kHz采样率音频覆盖中、英、日、韩、粤五种语言。接下来我带你按先听到声音 → 再把环境装齐 → 最后调优的顺序走一遍全程你只需要照着做。 零样本音色克隆步骤5 秒音频直接出声音这节解决怎么最快听到第一句合成语音的问题。装好环境之后下一节会讲最短路径如下运行python webui.py浏览器打开9874端口的 WebUI在推理页把一段5 秒左右、无背景音的参考音频拖进去选语言、填文本点合成等几秒就能试听。这一步不需要任何训练5 秒样本直接出声足够你先验证整条链路是否跑通。对短视频口播、播客这类场景这一步产出的声音就已经能直接拿去用了——48kHz 成品无需再升采样。想正式占住一个音色再看下一节往后的微调流程。️ 环境与安装install.sh 参数怎么选这节解决装不装得上、模型文件放没放对的问题。环境门槛conda Python 3.10NVIDIA 显卡需CUDA 12.6 或 12.8对应CU126/CU128同时兼容ROCmA 卡、MPSApple 芯片和纯CPU。一条命令装完git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS bash install.sh --device CU128 --source HF安装后自查清单--device按你的硬件填CU126/CU128/ROCM/MPS/CPU--source填模型下载源HF/HF-Mirror/ModelScope国内网络选ModelScope更稳想顺带拉 UVR5 人声分离权重追加--download-uvr5打开 GPT_SoVITS/pretrained_models/ 目录核对v4 需要gsv-v4-pretrained/s2Gv4.pth和vocoder.pth都在缺哪个补哪个执行python webui.py能打开 9874 端口即成功。️ 从 5 秒到 1 分钟训练闭环攒出专属音色这节解决如何把零样本的像变成微调后的就是你的问题。1 分钟干净人声就能训出相似度明显更高的专属音色而 GPT-SoVITS 的预训练语料也从 2k 小时扩到了5k 小时所以少样本微调的效果比上一代好不少。完整闭环在 WebUI 里一站做完人声分离素材里带 BGM 时先用 tools/uvr5/ 的 UVR5 把vocals 抠出来降噪底噪大的录音跑一遍 tools/cmd-denoise.py自动切分长音频按静音切成短片段ASR 标注多语言 ASR 自动转出文本标签校对即可微调选版本、设轮数开训产出自己的 S1/S2 权重。支线旧音频翻新。影视二创、老录音修复也走这条链——先分离、再降噪然后用新音色重新合成一段干净的替代配音原素材不用动。⚙️ 48kHz 高音质原理与版本选择这节解决v4 凭什么更干净、我该选哪个版本、显存不够怎么办的问题。为什么 v4 更干净v3 的声码器上采样链里有非整数倍信号对齐会出现毛刺听感就是那种滋滋的金属声v4 的 GPT_SoVITS/configs/s2v2ProPlus.json 里upsample_rates是10×8×2×2×2全是整数倍——好比变速箱里每级齿轮都严格啮合不再打齿。声码器 BigVGAN 由此直接产出 48kHz 音频取代了 v3 的 24kHz。结构上仍是两段式GPT 管语义和韵律SoVITS 管声学细节。推理速度v2ProPlus 在 RTX 4090 上 RTF 约0.014约 1400 词4 分钟语料的文本 3 秒出头合成完毕。决策表你的情况建议训练集音质好、追求高频干净v4训练集一般、想要更稳v2Pro 系列按官方说法音质接近 v4占用和速度等同 v2显存吃紧关闭半精度用 FP32 跑较新显卡、想更快更省显存保持半精度GPT_SoVITS/configs/tts_infer.yaml 中is_half默认 true纯 CPU用 GPT_SoVITS/export_torch_script.py 导出优化模型再推理纯 CPU 跑长文本时把文本分段合成参考音频控制在5 秒左右即可。️ 问题速查合成异常怎么排查这节解决卡住了怎么办的问题每条都给出可直接执行的动作。问音色下拉框是空的一个模型都选不到答预训练模型没放对位置。检查 GPT_SoVITS/pretrained_models/ 里有没有对应版本的.pth/.ckpt缺了重新下载。问启动时提示没找到显卡自动退回 CPU答通常是驱动或 CUDA 缺失。装好 NVIDIA 驱动后重启如果确实只有 CPU就显式--device CPU别让它猜。问合成出来有金属音答多半还在用 v3 权重或旧的上采样配置。换 v4 并重新下载vocoder.pth再试。问v3/v4 训出来反而不如 v2答v3/v4 对数据质量更敏感。先把素材分离、降噪做干净再训或者干脆切到 v2Pro 系列。问Mac 上训的模型质量偏低答已知现象官方建议 Mac 用户改用 CPU 模式训练。问训练/推理显存溢出答先关半精度改 FP32还不行就换显存更大的卡。CPU 只适合少量数据试跑别当主力训练机。✅ 动手前最后两步这节给你两个立即可执行的动作把体验闭环走完。先做 5 秒零样本按第一节流程跑一次确认音频进、语音出链路通畅不碰任何训练再做 1 分钟微调准备 1 分钟干净人声走一遍第四节闭环把微调前后的相似度对比听出来——差异会比预想的更明显。最后提醒升级版本前扫一眼 docs/en/Changelog_EN.md里面的更新记录能帮你避开已知问题、用上新能力。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考