ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

RVC变声器实战指南:10分钟录音快速训练专属音色

2026/9/20 12:23:59 拓冰建站 浏览量
RVC变声器实战指南:10分钟录音快速训练专属音色 RVC变声器实战指南10分钟录音快速训练专属音色【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVC 是一个基于检索的开源变声器你给它 10 到 50 分钟的目标人声录音它训练出一个音色模型之后任何音频输入都会以这个音色重新输出。给视频配音、游戏角色换声、翻唱换声的内容创作者和爱好者用它最省事。你的机器能不能跑4GB 显存起步先对门槛再决定要不要花时间显存 4GB 是底线。config.py 启动时会读显卡显存低于 4GB 直接退回 CPU 训练3GB、2GB 的老卡按官方 FAQ 的建议是放弃Python 3.12 x64Ubuntu 推荐 24.04Windows 装好 3.12 就能用系统内存要够切分和音高提取靠 CPU 多进程干内存吃紧就把CPU 进程数调低不够的出路租一张带 4GB 以上显存的云 GPU或者换卡。CPU 能训但慢一个量级只适合跑通流程。素材怎么备录音决定模型上限素材质量决定模型能学到什么这步不可逆——录砸了之后怎么调参都补不回来。总时长 10 到 50 分钟官方 FAQ 建议录音干净、底噪低、音色有辨识度时5 到 10 分钟也够环境安静底噪尽量小背景噪音会被模型当成音色的一部分学进去语速、语调、情绪有变化别只念一种腔调模型靠多样样本覆盖不同发音状态单条片段几十秒到一两分钟即可过长的录音在自动切分和内存占用上都是负担格式统一转成 WAV 就行采样率不用纠结训练时会自动重采样到选定档位。装环境、拉底模、点火拉代码、建虚拟环境Python 版本必须是 3.12 x64git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m venv .venv # Windows 激活 .venv\Scripts\activateLinux/macOS 用 source .venv/bin/activate激活后按显卡装依赖产物是可正常 import torch 的环境# CPU / AMD / IntelWindows 下自动走 DirectML pip install -r requirments_cpu_py312.txt # NVIDIA 50 系以外先装 CUDA 11.8 的 torch再装依赖 pip install torch2.7.1cu118 torchaudio2.7.1cu118 --index-url https://download.pytorch.org/whl/cu118 --extra-index-url https://pypi.org/simple pip install -r requirments_cu118_py312.txt # NVIDIA 50 系把上面两行的 cu118 换成 cu128依赖文件换 requirments_cu128_py312.txt装 ffmpeg切分、转码、重采样全靠它# Ubuntu sudo apt install ffmpeg # macOS brew install ffmpegWindows 也可以把 ffmpeg.exe、ffprobe.exe 两个文件直接放进项目根目录。下载预训练底模README 给出的hf download命令就是干这个的把 hubert_base 特征编码器、rmvpe 音高模型、pretrained 和 pretrained_v2 底模放进 assets/ 目录路径结构别改缺底模训练和推理都起不来。启动训练网页python webui.py浏览器自动打开 7865 端口的训练页无桌面的服务器加--noautoopen手动访问Windows 也可以直接双击 go-webui.bat。只动这几个数轮数、间隔、批次参数建议取值依据总轮数底噪大20~30干净且时长足可到 200底噪大的数据训太多轮模型会把噪音一起学进去FAQ Q9保存间隔每 10 轮存一个点间隔小才能逐个试听挑出最早的达标点避免过拟合批次大小用页面默认值OOM 往下调默认按显存自动估算调到 1 还 OOM 就是显存不够表外两项也顺手设好采样率选 48k 对应 v2 底模是官方 configs 里质量上限最高的一档音高提取选 rmvpe它是 InterSpeech 2023 的开源人声音高模型速度快占用小harvest 对男低音更稳但很慢pm 适合歌声输入时提速。确认训练集文件夹路径、填实验名后面找模型全靠它点一键训练。流程依次跑切分、音高提取、Hubert 特征提取、训练全程日志写在 logs/实验名/ 下训练与索引导入脚本在 train/ 目录。训完别急着关先补索引再调推理参数先点训练索引用 faiss 把训练特征聚成检索库产物是 logs/实验名/ 下 added_ 开头的 .index 文件。一键训练结束没生成索引多半是训练集太大卡住了这一步重按一次即可FAQ Q2。索引决定输出保留多少训练集音色跳过它音质可能不差相似度打折。推理端重点调检索特征占比index rate范围 0 到 1默认 0.75调高接近 1音色完全锚定训练集不漏底模音色但音质被训练集锁死调低到 0不做检索保护音质可能更好音色泄露会回来训练集优质且时长足时这个值反而不重要模型自己就不太引用外部音色变调是整数半音12 升八度、-12 降八度保护滑条默认 0.33专门防清辅音和呼吸声撕裂输出有电音时往高调。离开网页批量和实时批量转换不用开网页。一键训练跑通后控制台会打印出切分和训练对应的完整命令行照抄改参数就能脱离网页重跑想自己写批量脚本训练入口是 train/train.py处理流程入口是 train/preprocess.py。实时变声双击 go-realtime_gui.bat 启动入口代码在 realtime_gui.py。官方给出的延迟是端到端 170ms换 ASIO 输入输出设备能压到 90ms但后者非常依赖声卡驱动支持普通 USB 声卡别期待这个数字。打开推理页挑一个保存点模型把录音里没用过的一段音频扔进去转换。音色对上了整条链路就跑通了。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考