
10 分钟干净人声RVC 本地部署变声新手零门槛完整上手【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI给一段录音换个配音你今天要做的事给一段 3 分钟录音换个配音今天用 RVC 本地部署变声就能完成只需 10 分钟干净人声做训练数据。RVC 是基于 VITS 的开源音色转换框架。⚡ 先给结论数据质量 数据数量。官方 FAQ Q10 写明训练集推荐 10~50 分钟精简且音色有个人特色时 5~10 分钟也 OK仓库作者本人经常这么练。 新手最容易误入的误区以为要上传音频。网上大量 AI 克隆服务要求上传音频并绑账号而它全程本地音频从进硬盘到出结果不经过任何第三方服务器。读完这篇你能独立跑完预处理 → 训练 → 推理全流程并知道效果不理想时往哪里调。一句话总结10 分钟干净人声是底线数据质量比数量更决定音色还原度。变声前确认这三件事硬件、数据、系统确认项要求最低显存4G 以上可训练走 32k 配置2~3G 基本无解A 卡 / I 卡 / 纯 CPU 可跑但速度慢训练数据10~50 分钟人声低底噪前提下音色统一、有特色可缩到 5~10 分钟系统支持Windows / LinuxUbuntu 24.04 推荐/ macOS需 Python 3.12 x64是否联网装依赖、下预训练模型需联网训练与推理本身可完全离线 新手最常被忽略的准备项预训练模型必须手动下载并放进指定目录——assets/hubert_base/、assets/rmvpe/、assets/pretrained/、assets/pretrained_v2/、assets/uvr5_weights/路径要求见 README.md 的模型与运行目录。漏下任何一个启动后推理直接报错。Windows 用户还需把ffmpeg.exe、ffprobe.exe放到项目根目录。一句话总结硬件、数据、系统三件事确认完就可以开始装了。从下载到第一次出结果两条路径快车道零命令行≤3 步下载整合包解压到无中文、无空格的目录双击启动脚本仓库内对应 go-webui.bat浏览器自动打开网页按数据预处理 → 训练模型 → 推理音频三个选项卡顺序操作即可。完整车需要二次开发时走这条git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI # 克隆 RVC 源码仓库 cd Retrieval-based-Voice-Conversion-WebUI # 进入项目根目录 python -m pip install torch torchaudio # 安装 PyTorch 与音频库 python -m pip install -r requirments_cu118_py312.txt # 按显卡安装依赖N 卡老系选 cu118 python webui.py # 启动网页界面默认监听 7865 端口⚡ 不同显卡对应不同依赖清单不要混装N 卡选requirments_cu118_py312.txt或requirments_cu128_py312.txtRTX 50 系用 cu128CPU、A 卡、I 卡选requirments_cpu_py312.txtWindows 走 DirectML。 两个新手必踩的坑其一漏下预训练模型界面能打开但推理报错补齐assets/下模型与 ffmpeg 即可其二训练集里混进极小的残片音频会报 tensor size 不匹配——按 docs/cn/faq.md Q17 的思路去wavs16k文件夹删掉文件大小显著偏小的片段再点训练。常用参数速查表参数推荐值说明采样率新手 32k / 进阶 48k32k 显存占用小48k 高频细节更好训练轮次 total_epoch底噪大 20~30 / 音质好可达 200FAQ Q9 原话底模带不动低音质训练集索引相似度 index rate0.8~1.0调 1 音色最干净调 0 完全放弃检索保护音高偏移 f0up_key男转女 12 / 女转男 -12以像对方平时说话的调子为准一句话总结整合包 3 步出结果源码多两步但环境完全可控。变声效果不对从听感开始的三步排查Step 1 听——先用 4 条可感知的验收标准过一遍结果音高起伏是否跟随源音频走F0 正常换气声是否自然保留没有被切得生硬长句音色是否稳定、不跳变有没有电音、电流声、吞字。Step 2 查——哪条不达标第一步就去查对应的参数音高不跟源音频 → 查音高偏移 f0up_key 是否给错方向或幅度不对换气声不自然 → 查切片参数是否切得太碎、是否漏做 UVR5 分离长句音色跳变 → 查索引文件是否真的训练出来了应有added_开头的.index有电音、电流声 → 查显存是否不够、采样率是否相对显卡偏高。Step 3 调——按下面数值范围拧索引相似度 0.8 → 1.0轮次 20~30 起步音质好加到 200男转女偏移 12、女转男 -12显存紧张就把 48k 换 32k。三条最高频现象 → 排查 → 调整链路结果里有一丝原说话人的声音音色泄漏第一步查索引相似度是不是没拉满 调整方向index rate 调到 1.0仍泄露就补 10 分钟以上数据重训音色不够像目标人物第一步查total_epoch 是不是太低 调整方向加到 200 左右男转女 12、女转男 -12音质发闷、底噪明显第一步查训练集本身底噪是不是就大 调整方向先用 UVR5 对训练集降噪再切分底噪大时轮次别超 30⚡ 显存 ≤4G 的卡1060 3G 等直接走 32k 配置程序会按 configs/config.py 里的device_config自动降精度、缩切割参数不需要手动改。 中途换采样率接着训不行——会直接报 tensor size 不匹配的错FAQ Q18。要换采样率请换新实验名从头训。一句话总结先用速查表定起点再按现象拧索引相似度与轮次用 4 条听感标准验收。它凭什么敢用 10 分钟数据检索工序RVC 解决的核心问题是为什么传统变声模型容易让原说话人的音色漏进结果里它的办法像翻译查词典遇到不确定的词不凭手感猜而是翻开标准词典抄释义——当前片段的音色特征直接换成训练集里检索到的特征。各模块在链路里只做一件事UVR5内置人声分离把源音频拆出纯人声与伴奏切片 重采样人声切成 1~4 秒小片段统一重采样到 16kHzRMVPE提取音高轮廓 F0即语调起伏HuBERT提取内容特征即说了什么infer/hubert.pytop1 检索拿当前片段特征去训练集索引里查最相似的一条替换当前音色特征索引由 train/train_index.py 训练生成训练完记得点训练索引VITS 声码器把替换后的特征合成波形输出 48kHz 结果。top1 检索替换音色就是它区别于普通 VITS 的设计音色从哪来变得确定无疑音色泄漏被掐断——这正是它敢用 10 分钟数据的底气所在。没有索引就没有检索效果会明显变差。一句话总结RVC 分离 → 提特征 → 检索替换 → 声码器合成检索工序就是低数据量的底气。从能玩到能用三件进阶的事实时变声入口源码 realtime_gui.pyWindows 双击go-realtime_gui.bat进界面。官方标注端到端延迟 170ms使用 ASIO 输入输出设备可压到 90ms适合游戏与直播场景。命令行 / 接口化调用docs/cn/faq.md Q7 给出了不经网页的训练与推理命令推理参数包括音高偏移f0up_key、索引相似度index_rate、模型路径model_path把推理脚本接进自己的配音流程只需几十行代码。模型融合WebUI 的 ckpt 选项卡里有 ckpt-merge 入口把两个音色模型直接融合成新嗓音。⚡ 想融合两个音色做新嗓音时ckpt-merge 不需要重新收集数据。 实时模式对声卡驱动敏感普通 USB 声卡延迟会明显高于官方数据先用默认配置跑通再折腾硬件。代码是 MIT 协议见 LICENSE但声音的授权不归代码协议管克隆谁的声音就需要谁本人明确同意。公开分发模型和结果时建议保留一份书面同意记录冒充他人身份、虚假带货这类用法请主动绕开。一句话总结实时、命令行、模型融合三件套让工具从能玩变成能用授权永远走在技术前面。跑完这三步它就正式成为你工作流的一部分用 10 分钟人声跑通你的第一个音色模型按 FAQ Q7 的参数建一条命令行推理工作流批量处理整个目录把推理接口或实时界面接进你自己的应用里。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考