ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

RVC 变声器:10 分钟语音数据训练专属音色的实操指南

2026/9/1 8:46:01 拓冰建站 浏览量
RVC 变声器:10 分钟语音数据训练专属音色的实操指南 RVC 变声器10 分钟语音数据训练专属音色的实操指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI想让游戏里的 Boss 用你自己的声线说话RVCRetrieval-based-Voice-Conversion-WebUI就是一个为此而生的 RVC 语音转换工具只要 10 分钟以内的目标人物语音就能训练出一个可实时推理的音色模型。项目定位基于 VITS 架构的语音转换Voice Conversion把输入音频的声音替换成目标音色框架WebUI 形式提供不需要写代码核心卖点是数据少也能训10 分钟语音即可完成一轮有效训练对比同类项目动辄需要小时级素材门槛低一个量级用检索retrieval机制从目标说话人特征库里召回音色特征能显著减少音色泄漏输出里混入输入说话人特征的问题训练、推理、音高提取、UVR5 伴奏人声分离全链路内置一个项目覆盖从素材处理到成品输出的完整流程支持 v1 / v2 两代模型v2 采样率下移、结构更稳是默认选项 装好并跑起来环境要求Python 3.83.8–3.10 均可FFmpeg 在 PATH 中建议 NVIDIA 显卡≥6GB 显存CPU 可跑但训练很慢安装Windows 用 conda 或 venv 建好 3.8 环境后git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt启动方式Windows双击go-web.batLinux./run.shmacOS./run.sh会自动设置 MPS 相关环境变量通用python infer-web.py --port 7865首次启动会自动下载预训练底模启动后浏览器打开 7865 端口三个关键入口训练填实验名、数据目录依次点处理数据 → 特征提取 → 训练模型 → 训练特征索引单次推理 / 批量推理选音色和索引文件上传音频或直接出结果配置configs/config.py 管设备和精度configs/config.json 指向各版本采样率配置一般不用动 核心工作流从素材到出音数据准备把目标音色的素材放进一个文件夹比如logs/你的实验名/src单声道、干净录音。质量标准如下项目建议值说明采样率48kHz训练目标采样率可选 32k/40k/48k48k 上限最高格式WAV无压缩、单声道MP3 也行但会有编码损失片段时长5–10 秒/段长音频可先用内置的 UVR5 页签做人声分离再切片底噪环境安静有底噪先做降噪底噪会直接学进模型总量 10–20 分钟足够素材越多越稳。训练配置训练页签里真正影响效果的参数不多对照下表选即可参数推荐值适用情况total_epoch训练轮数10–20默认 20数据质量高 10 轮左右即可收敛数据偏少或偏脏可加到 30同时把保存频率调小多留几个 ckpt 挑batch_size1–8按显存6GB 显存从 2–4 起步数据超过 50 条且显存够就提到 8收敛更快目标采样率40k48k 音质上限更高但更吃显存40k 是默认折中是否带音高指导是唱歌必须开纯语音也可开开了能转调版本v2默认 v2v1 只用于兼容老模型点一键训练会串联执行处理数据、特征提取、训练模型和索引四步。产物在logs/你的实验名/下.pth模型和assets/indices/.index索引文件。音高提取算法怎么选音高提取算法负责从音频里算出每个时刻的音调F0训练和推理时都要选一个算法精度速度推荐场景rmvpe / rmvpe_gpu高中高GPU 版最快默认选择精度和速度平衡最好harvest最高慢对音高极端敏感的精细场景dio中快CPU 差但语音质量高的场景提速pm低最快输入歌声、追求低延迟的场合默认 rmvpe_gpu 不改也能跑只有多卡时才需要额外配置 rmvpe 卡号。推理与调优单次推理页签里最影响输出的三个参数Index Rate检索特征占比0–1默认 0.75越大越贴近目标音色。音色不像目标人就调高到 0.8–0.9听感过于塑料、丢失细节就往 0.6 回调Protect保护气息和齿音0–0.5默认 0.33听感发闷、气息丢失时调高齿音过脆或音色发散时调低Filter RadiusF0 平滑0–7默认 3音高曲线抖动、有电流感时调大跟不准旋律细节时调小另外两个基础项升降调semitone0 为原调和输出采样率选 0 跟随输入。批量推理页签参数一致换成目录进目录出。 两个典型落地场景场景一AI 歌手输入准备目标歌手的干净人声 15–30 分钟先用 UVR5 页签从歌曲里分离出人声切成 5–10 秒片段执行步骤训练时是否带音高指导必须选是total_epoch 给 20推理时选同一音高算法升降调按音域差设置比如男转女 12得到输出把你唱的 Demo 或分离后的人声传入输出目标音色演唱的版本。唱腔不像就优先调 Index Rate而不是重训场景二游戏角色配音输入准备你自己或配音演员的台词素材 10–20 分钟覆盖角色需要的语气范围喊麦、低语、怒音执行步骤按默认参数训练推理时对每条台词用批量推理页签整目录转换需要更贴近时把 Index Rate 提到 0.8得到输出整组目标音色台词文件可直接挂进引擎。实时互动场景可参考tools/rvc_for_realtime.py的实现思路❓ 高频问题速查训练到一半爆显存CUDA OOMbatch_size 减到 1–2仍不行就目标采样率降到 40k老卡1060/1070/1080 等程序会自动切 fp32属正常现象不是故障。输出音色像输入而不像目标音色索引文件没选对或 Index Rate 太低。确认索引文件和模型同源Index Rate 提到 0.8–0.9 再听。听起来有杂音、电流声先查训练素材底噪推理端把 Filter Radius 调到 4–5 平滑音高曲线采样率输出选 0 跟随输入别强行降采样。训练完找不到模型文件模型在logs/实验名/logs/实验名/下的G_*.pth索引在assets/indices/。只保存了最新 ckpt 的话旧轮次会被覆盖想留多个就关仅保存最新。转调后声音变形严重输入和目标音域差太大是主因用升降调把差值控制在 ±7 个半音内差太多就换更接近的目标素材再训。CPU 下训练/推理太慢CPU 模式可以跑通但不实用特征提取和训练建议至少用 6GB 显存的 N 卡只有推理环节可接受 CPU。FFmpeg 相关报错确认ffmpeg -version能输出PATH 里能找到Windows 也可把 ffmpeg.exe 放进项目根目录。 进阶方向批量工作流tools/infer_batch_rvc.py和infer_cli.py提供无界面的命令行批量转换适合脚本化流水线模型融合在训练时加载别人的预训练底模 G 继续训或用 ckpt 处理页签把多个 ckpt 按比例融合能互补两个模型的优劣显存与性能低显存卡自动切 fp32 并下调检索相关参数x_pad/x_query 等见 configs/config.py多卡可配置 rmvpe 分卡并行对推理延迟敏感可导出 ONNXtools/export_onnx.pyRVC 用 10 分钟素材换一条属于你的 AI 声线成本几乎只有等待时间。去准备 10 分钟干净录音跑你的第一个音色模型吧。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考