
Chatterbox 完全指南开源零样本声音克隆与 23 语言语音合成5 分钟跑通【免费下载链接】chatterboxSoTA open-source TTS项目地址: https://gitcode.com/GitHub_Trending/chatterbox7/chatterbox如果你需要把一段视频旁白换成某个特定人的声音或者想在自有服务器上部署一个低延迟语音机器人商业 API 的按字计费和数据外发问题往往是第一道坎。Chatterbox 是 Resemble AI 开源的 TTS文本转语音模型家族用一段十几秒的参考音频就能克隆说话人音色并朗读任意文本覆盖 23 种语言家族中还提供 Turbo、Nano、Multilingual V3 等不同定位的型号。为什么值得试试整个家族免费开源、可本地自托管核心是零样本声音克隆不需要训练十几秒样本即可锁定音色。每个生成文件还会自动嵌入 PerTh 不可感知水印在 MP3 压缩、剪辑后仍可检测方便内容溯源。最新的 Multilingual V3 在保持 0.5B 参数规模的同时提升了跨语言的说话人相似度并保持口音稳定幻觉与重复输出也更少。快速上手一条命令装完安装只有一条命令依赖版本已锁在 pyproject.toml 中pip install chatterbox-tts几行代码就能生成第一段音频device 支持 cuda、mps、cpuimport torchaudio as ta from chatterbox.tts import ChatterboxTTS model ChatterboxTTS.from_pretrained(devicecuda) wav model.generate(Hi, this is a zero-shot voice cloning demo.) ta.save(test.wav, wav, model.sr)这是 500M 参数的英语版生成中文等其他语言用下一节的 Multilingual 模型给 generate 传 audio_prompt_path 即可克隆任意指定音色。核心功能实操零样本声音克隆把参考音频路径传给 generate 的 audio_prompt_path 参数输出就会贴近该说话人的音色。参考片段的语言最好与目标文本一致其情绪和语速也会影响成品具体调节见后面的调参速查。多语言合成一个 language_id 切换 23 种语言Multilingual 模型覆盖中、英、法、日、韩、西、阿拉伯语等 23 种语言传语言标签即可切换from chatterbox.mtl_tts import ChatterboxMultilingualTTS model ChatterboxMultilingualTTS.from_pretrained(devicecuda, t3_modelv3) wav model.generate(你好今天天气真不错。, language_idzh)对特定市场需要更稳的语言表现时可以选 Single Language Pack 的专用微调模型包含中文、拉美西语、西班牙西语、巴西葡语、葡萄牙语和印地语 6 个。Chatterbox-Turbo低延迟语音代理与副语言标签Turbo 是面向低延迟场景的 350M 英语模型把解码器从 10 步蒸馏成 1 步计算量和显存占用明显更低。它原生支持副语言标签——文本里直接写[laugh]、[cough]、[chuckle]就能在音频里加入自然的笑声、咳嗽声非常适合客服类对话代理。Chatterbox-NanoCPU 上跑实时语音合成Nano 与 Turbo 同架构参数进一步压到 110M在 8 核 CPU 上可达约 3 倍实时速度通过 nanoTrue 参数加载适合端侧部署和显存紧张的环境。语音转换手里有一段录音、想换成目标人声时src/chatterbox/vc.py 里的 VC 功能可以直接处理用 set_target_voice 载入目标说话人样本再调用 generate(audio..., target_voice_path...) 即可。它的思路是先抽取原音频的语音 token再用目标音色参考特征重新合成输出同样自动带水印。调参技巧速查exaggeration情感强度默认 0.5戏剧化表达提到 0.7 以上但会略微加快语速。cfg_weight参考贴合度默认 0.5参考说话人语速快时降到 0.3 左右改善节奏戏剧化风格建议同样取 0.3。语言切换参考音频语言与目标语言标签不匹配时输出容易带上参考音频的口音介于此可把 cfg_weight 临时设为 0。Turbo/Nano不支持 cfg_weight 和 exaggeration传入会被自动忽略。完整参数对照见 example_tts.py 与 example_vc.py。适合谁用游戏与视频配音每个角色用自己的样本生成音色前后一致旁白还可叠加情感控制。多语言本地化同一位说话人一次产出 23 种语言的配音重点市场再换成 Single Language Pack 微调版。语音代理产品Turbo 延迟低、显存占用小适合生产级在线服务Nano 覆盖端侧场景。有合规要求的团队所有输出自动嵌入可检测水印音频来源可追溯。一段参考音频加几行代码声音生成链路就能在自己机器上跑起来——可以先运行 example_tts.py 里的第一组示例再按需求在模型家族里挑选合适的型号。【免费下载链接】chatterboxSoTA open-source TTS项目地址: https://gitcode.com/GitHub_Trending/chatterbox7/chatterbox创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考