ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

10分钟语音跑通RVC:Retrieval-based-Voice-Conversion-WebUI变声模型从零训练实战

2026/9/4 11:36:34 拓冰建站 浏览量
10分钟语音跑通RVC:Retrieval-based-Voice-Conversion-WebUI变声模型从零训练实战 10分钟语音跑通RVCRetrieval-based-Voice-Conversion-WebUI变声模型从零训练实战【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI下称 RVC是一个基于 VITS 的变声框架你只需要准备 10 分钟以上的低底噪语音就能训练出一个 RVC 变声模型训练完成后用自己的声音文件即可推理出目标音色。本教程带你从零走到模型能出声并顺手排掉新手最常踩的几个坑。动手前你需要什么先说适用人群和最终效果你有一台带显卡的电脑N 卡、A 卡、I 卡均可仓库提供了对应依赖或者一台租用来的 GPU 服务器。你有一段 10 分钟左右、音质较高、底噪较低的说话录音人声不用带伴奏。跑通后你会得到两样东西weights文件夹下约 60MB 以上的.pth模型文件和logs/实验名下added_开头的.index索引文件。前者负责音色后者负责检索时防止音色泄漏——RVC 用 top1 检索把输入源特征替换成训练集特征就是靠它实现的。准备清单Python 版本大于 3.8README 环境配置的第一条要求一份 10~50 分钟的训练集录音推荐时长 10 分钟起步文件放在路径不含空格、不含括号、不含中文的目录里显卡显存FAQ 里提到 4GB 显存还有救2~3GB 的显卡建议直接放弃训练只做推理已安装 ffmpeg 和 ffprobe或准备安装见下文约 1 小时的整块时间其中训练本身通常只用几分钟到几十分钟大头在环境安装。最短路径先跑起来如果你用的是 Windows最短路径是下载官方整合包RVC-beta.7z解压后双击go-web.bat浏览器里 WebUI 会直接打开。如果你是 Linux / macOS 用户或者想自己装环境本教程后续都基于这条路按下面 4 步走5 分钟内应该能看到 WebUI 页面获取代码git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI安装依赖以 N 卡为例pip install torch torchvision torchaudio pip install -r requirements.txt下载预训练资产hubert、rmvpe、pretrained、uvr5 等脚本会自动放到assets/对应目录python tools/download_models.py启动 WebUIpython infer-web.py启动成功后浏览器会自动打开 Gradio 页面。你能看到「模型推理」「伴奏人声分离去混响去回声」「训练」「ckpt处理」几个选项卡就算跑起来了。此时还没有自己的模型先用仓库自带示例音频走一遍「单次推理」确认推理链路正常再进入训练。逐步配置详解安装步骤基础环境按显卡分流所有平台通用的第一步是装 PyTorchpip install torch torchvision torchaudioWindows 系统 Nvidia Ampere 架构RTX 30 系的机器经验上需要指定 CUDA 版本pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117然后按显卡选依赖文件四个文件仓库里都有装错一般表现为推理时报设备相关错误pip install -r requirements.txt # N卡 pip install -r requirements-dml.txt # A卡/I卡A 卡 Linux ROCm 用requirements-amd.txtI 卡 Linux IPEX 用requirements-ipex.txtROCm 驱动和环境变量如HSA_OVERRIDE_GFX_VERSION的配置细节见 README 的 AMD 章节这里不展开。macOS 用户可以直接执行sh ./run.sh装依赖。不习惯 pip 的话也可以用 Poetry 装注意 Python 建议 3.7~3.10其他版本在llvmlite0.39.0上会冲突。资产与模型文件ffmpeg 和 assetsffmpeg 是绕不开的依赖RVC 靠它读音频和写 filelist。Ubuntu/Debian 执行sudo apt install ffmpegmacOS 执行brew install ffmpegWindows 用户把ffmpeg.exe和ffprobe.exe放到项目根目录即可。模型资产部分核心是运行python tools/download_models.py上一步已执行过它会下载assets/hubert/hubert_base.pt——特征提取用assets/rmvpe/rmvpe.pt——RMVPE 音高提取模型参数用于解决哑音问题assets/pretrained下的 G/D 系列底模32k/40k/48kassets/uvr5_weights下的 UVR5 人声分离权重。想训 v2 模型还需要额外下载assets/pretrained_v2目录。另外可以顺手确认一下assets/里有没有Synthesizer_inputs.pth这类文件缺失会导致启动或推理阶段报错。启动验证WebUI 打开了算不算成功算但只算一半。真正的验证标准是浏览器能打开 WebUI五个选项卡含「Onnx导出」「FAQ」都渲染正常没有红色报错控制台没有 Traceback 滚过去在「模型推理」→「单次推理」里选一个自带示例 pth、一条示例音频点开始推理后几秒内能在待推理音频位置看到合成波形。三者都满足说明设备、ffmpeg、预训练资产全部就位可以放心进「训练」选项卡。跑起来之后验证效果与常见坑训练流程一句话版在「训练」选项卡里填训练集目录、实验名点一键训练等它完成数据集处理、F0 提取、特征提取、训练、训练索引。成功后weights/实验名.pth和logs/实验名/added_*.index会出现回到「模型推理」刷新音色选这两个文件推理你自己的音频。训练集时长怎么定官方 FAQ 推荐 10~50 分钟音质高、底噪低、音色有个人特色时5~10 分钟也能出效果低于 1 分钟不建议尝试。total_epoch方面音质差的训练集 20~30 轮足够高音质长数据可以调到 200。新手最常遇到的 5 个问题统一按现象 → 原因 → 解法整理完整版可对照 docs/cn/faq.md现象原因解法ffmpeg error / utf8 error大概率不是 ffmpeg 本身的问题而是音频路径带空格、() 等符号或中文路径在写 filelist.txt 时编码出错训练集目录改成纯英文、无空格路径训练结束没有added_索引文件训练集太大内存版 add 索引卡住用批处理 add 索引或临时再点一次训练索引按钮一键训练后紧跟着的报错显示 Training is done. The program is closed. 即模型已训成后面的报错是假的忽略即可别误删产物分享/推理模型报 f0、tgt_sr 等 key 不存在把logs下几百 MB 的实验状态 pth 直接拿去推理了分享用weights下 60MB 的 pth added_*.index必要时在「ckpt处理」做小模型提取Cuda error / out of memory显存不够4GB 以下显存基本放弃训练训练缩小 batch size推理缩小configs/config.py末尾的x_pad、x_query、x_center、x_max另外两个小坑浏览器显示 Connection Error 通常是控制台窗口被你关了Expecting value: line 1 column 1 (char 0) 一般是系统代理干扰关掉全局代理包括服务端的 http_proxy再试。结尾下一步做什么跑通单次推理后建议先做两件事挑一段 30 秒左右的干净人声做测试音频在「模型推理」里把index_rate和音高偏移都调到中间值听一遍效果建立基线满意后试试「批量推理」处理一整首歌或者进「ckpt处理」用 ckpt-merge 把两个模型融合出新音色这是 RVC 玩法里成本最低的一条进阶路径。数据量够、模型稳定之后再去折腾实时变声go-realtime-gui.bat也不迟。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考