ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

RVC 本地变声:4 条命令跑通语音转换训练与推理

2026/9/2 12:30:40 拓冰建站 浏览量
RVC 本地变声:4 条命令跑通语音转换训练与推理 RVC 本地变声4 条命令跑通语音转换训练与推理【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI如果你手上有十几分钟的录音想把它变成一个能用的语音转换模型又不想把音频数据交给任何在线服务RVCRetrieval-based-Voice-Conversion-WebUI就是为此准备的一个基于 VITS 的语音转换框架一个网页界面点几下就能在本地完成从训练到推理的完整流程。开工前确认你的环境Python 3.8 以上版本Windows / Linux / macOS 均可N 卡需配 CUDAA 卡 / I 卡走 DirectML 路线系统装有 ffmpeg音频读取和解码依赖它显存 4G 起步4G 以下基本只能放弃训练详见 FAQ Q8没有 N 卡也不是死路A 卡 / I 卡用户改用requirements-dml.txt装依赖即可Linux 下的 AMD ROCm 和 Intel IPEX 也各有一份独立依赖清单。把 RVC 变声服务拉起来4 条命令第 1 步拉取仓库git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI第 2 步装 PyTorch 和项目依赖顺手装上 ffmpeg。全部装完后pip show fairseq能查到版本即成功pip install torch torchvision torchaudio pip install -r requirements.txt sudo apt install ffmpegWindows 用户把 ffmpeg.exe 放到根目录即可用 Poetry 管理依赖也可以见仓库 README。第 3 步下载训练和推理所需的预训练模型hubert、v1/v2 底模、UVR5 分离模型等。仓库自带下载脚本跑完看到All models downloaded!即成功python tools/download_models.py第 4 步启动 WebUI浏览器会自动打开 7865 端口python infer-web.py第一次完整任务从录音到转换后的音频第 1 步准备数据收集 10~50 分钟低底噪的人声音频推荐值见 FAQ Q10全部放进同一个文件夹注意只读一层目录、不递归子文件夹。第 2 步打开 WebUI 的预训练选项卡填入实验名和数据文件夹勾选是否考虑音高想唱歌就勾上点一键训练。预期看到控制台依次走完数据预处理、音高/特征提取、模型训练、索引训练结束时logs/实验名/下会多出一个added_*.index文件。没看到索引文件就再点一次训练特征索引FAQ Q2。第 3 步切到模型推理选项卡选择刚训练好的模型上传一段想变声的音频.wav 格式最稳音高提取算法选 RMVPE效果最好且比 crepe_full 快点转换按钮。预期听到输出音频的音色已换成训练集的声音。到这里你已经拥有一个可以在本地反复变声的私有 RVC 模型训练集也从未离开过你的机器。真正影响结果的几个配置total_epoch训练轮数训练集底噪大就调低到 20~30再高也带不上音质音质高、时长长则可以拉到 200音色会更稳。batch_size调大训练更稳、每步更省时间但吃显存显存报 OOM 时优先砍它。index_rate推理时的检索混合比例调到 1 基本杜绝推理源音色泄漏但音质上限被训练集锁死调到 0 则不借用检索保护音色可能被底模带偏。显存档位程序按显存自动切换 fp16 / fp32 和推理批处理参数手动干预时改 configs/config.py 末尾的 x_pad、x_query、x_max 即可# 6G 显存fp16对应档位小显存会自动降到 5G 档 x_pad 3 x_query 10 x_center 60 x_max 65翻车时查这里ffmpeg error / utf8 error→ 多半不是 ffmpeg 的锅是音频路径带空格、括号或中文 → 换纯英文无空格路径。Cuda out of memory→ 显存不够 → 训练调小 batch_size推理调小 config.py 里的 x_max 等参数。Expecting value: line 1 column 1 (char 0)→ 局域网代理或全局代理在干扰 Gradio → 关掉代理后重启。一键训练结束但没有 added 开头的索引→ 训练集太大卡住了索引步骤 → 重新点一次训练特征索引。Windows 报 llvmlite.dll 加载失败→ 缺 VC 运行时组件 → 装上 Visual C Redistributable 后重启FAQ Q16。更多问题直接翻 docs/cn/faq.md基本都覆盖到了。接下来可以延伸的方向批量处理整个文件夹的音频tools/infer/ 下有一批独立推理脚本不用开网页。想把变声能力嵌进自己的程序启动 api_240604.py 得到 HTTP 接口请以官方文档为准。想改转换链路本身模型结构、UVR5 分离、音高提取核心代码集中在 infer/modules/vc/ 和 infer/lib/。做完这一步你就拥有了一个完全私有、可反复训练的本地语音转换流水线——训练集多长、换成谁的声音都由你自己说了算。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考