
几秒录音克隆出你的声音OpenVoice 语音克隆指南与本地部署避坑【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice你有一段 10 秒的干净录音想让它替你念一段新台词OpenVoice 语音克隆就是干这个的上传参考音频它提取音色再用这个音色合成新内容。本地跑要一块显存 4GB 起步的 GPU没有卡就用官方在线服务完全免安装。谁维护、能不能商用三句话讲清MIT 与 MyShell 联合开源核心作者来自 MIT 和清华大学。V1、V2 都是 MIT 协议商用免费2024 年 4 月起生效。官方定位是技术不是产品它给引擎和权重稳定封装交给在线服务或你自己。 先跑通再研究在线 5 分钟出第一句克隆语音最省事的验证路径是零安装的在线服务本地部署放第二步。打开 MyShell 的 Workshop 建一个 Bot在 Setting 里打开 Voice (TTS) 开关再到组件广场 Widget Center 里选 TTS 标签挑一个基础音色先试听回到 Bot 页面点 Create上传 5~10 秒的干净人声做参考音频输入要朗读的文字几秒后就能下载结果。语言入口有英式英语、美式英语、中文、日语、韩语、西班牙语、法语等 9 种参考音频本身不限语言本地最小路径Linux GPUPython 3.95 行命令装完conda create -n openvoice python3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .V1 权重放checkpointsV2 放checkpoints_v2然后跑python -m openvoice_app --share起本地 Gradio 页面浏览器打开就能试。V2 还要补装 MeloTTS 相关依赖照 使用文档 的 V2 小节来。 它是怎么做到的先念词再换嗓子一句话先让基础 TTS 按你指定的风格念出台词再把音色换成参考人的语气节奏不动。整个过程像给影视剧换配音第一步临时配音员基础 TTS 模型按你设定的情感、语调、节奏念完台词第二步系统把参考录音压成一枚声音指纹音色特征向量把一段声音压缩成的可比对特征第三步用这枚指纹替换临时配音员的嗓子。念的是你要的内容听上去像参考的那个人。效果预期能做到与做不到对照能做到做不到5~10 秒干净人声即可克隆出同音色朗读只搬音色情感和口音不在克隆范围内情感、语调、节奏可与音色独立调节想换口音或情绪得换基础 TTS 模型换参考音频没用V2 原生覆盖中、英、日、韩、西、法 6 种语言支持跨语言零样本克隆参考音频不达标噪音、多人、过短时结果会明显跑偏参考音频可以是任意语言基础 TTS 模型不支持的语言无法直接输出 翻车自救按现象查这份清单启动就报找不到模型现象跑 Gradio 或 demo日志提示 checkpoint 加载失败。原因权重没解压到指定目录。解法V1 解压到checkpoints/V2 解压到checkpoints_v2/重跑即可。首次运行卡住日志停在 Downloading现象第一次处理音频长时间无响应日志出现 silero-vad 的下载提示。原因音色提取脚本openvoice/se_extractor.py里的人声检测组件首次调用要联网拉模型。解法断网机器请手动下载 zip解压放进本机 torch 缓存目录~/.cache/torch/hub/下对应文件夹。生成的声音不像、音质发飘现象克隆结果和参考人差异明显或有杂音。原因参考音频不达标或命中了旧缓存。解法逐项排查背景噪音、多人同说、时长过短、长静音段参考文件换个名字或删掉processed缓存目录再试。V2 装完跑不起来现象主包装好了V2 的 demo 报缺依赖。原因V2 额外依赖 MeloTTS 相关组件。解法按 使用文档 V2 小节的命令补齐后再跑。显存不足或直接 OOM现象本地推理起不来报 CUDA out of memory。原因推理需要 GPU显存 4GB 起步。解法转官方在线服务或换带卡机器再部署。什么时候选它三种人选的选型建议只想出结果不想装环境直接用在线服务5 分钟内拿到克隆音频。本地那一整套对你是负资产跳过。要把克隆嵌进产品或 App选 OpenVoice 的理由有两点音色与情感解耦情绪、节奏能单独控制MIT 协议商用零授权成本。V2 还能覆盖 6 种语言够多数出海产品用。在同类项目之间对比只要多语言朗读纯 TTS 模型更省事。需要固定音色 独立调风格或者拿中文录音输出日语这种跨语言零样本开源方案里 OpenVoice 是少数能做的。可先跑 demo_part1.ipynb 看风格控制再跑 demo_part3.ipynb 看 V2 多语言效果。收尾一个值得抄的设计把音色和风格拆成两条独立流水线是 OpenVoice 最值得借鉴的思路只做配音不做模型的话在线服务加 MIT 协议已经够你当天接入。延伸阅读使用文档、常见问题、核心源码【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考