
VoxCPM22B语音合成模型靠几秒录音能克隆出你的声音吗【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM一段文字要读得像人声你需要一个语音合成工具。VoxCPM2就是干这个的把文字变成48kHz音频或者用几秒参考音频克隆音色。这是个开源的无令牌化多语言语音合成项目支持30种语言和9种中文方言。 快速上手五分钟拿到第一段音频环境要求确认系统要求Python ≥ 3.10且 3.13、PyTorch ≥ 2.5.0、CUDA ≥ 12.0。模型约占 8GB 显存CPU 也能跑只是慢。一条命令安装pip install voxcpm首次调用from_pretrained会自动下载 VoxCPM2 权重2B 参数训练数据超过 200 万小时。生成第一段语音from voxcpm import VoxCPM import soundfile as sf model VoxCPM.from_pretrained(openbmb/VoxCPM2, load_denoiserFalse) wav model.generate( text欢迎使用VoxCPM2多语言语音合成演示。, cfg_value2.0, inference_timesteps10, seed42, ) sf.write(demo.wav, wav, model.tts_model.sample_rate)拿到的是 48kHz 音频。在 RTX 4090 上 RTF 约 0.3配合 Nano-vLLM 推理引擎可压到 0.13 左右实时够用。 能力篇三种常用玩法只给文本直接合成什么时候用日常朗读、字幕配音、批量播报。直接传文本即可不用标注语言英文、日语、四川话都能读模型自己从内容推断语调和韵律。上面的快速上手代码就是这个场景。不录音、靠文字描述设计声音什么时候用手上没有参考音频但想要一种特定气质的人声。把音色描述放在文本开头的括号里性别、年龄、语气、情绪都可以写wav model.generate( text(年轻女性温柔甜美)您好我是AI语音助手。, cfg_value2.0, seed42, ) sf.write(voice_design.wav, wav, model.tts_model.sample_rate)拿一段录音复刻音色什么时候用有目标人物的录音想让 ta 说新内容。两种模式示例音频仓库里就有可直接使用# 可控克隆传参考音频可用括号加风格描述 wav model.generate( text(稍快语速愉快语气)这是语音克隆演示。, reference_wav_pathexamples/reference_speaker.wav, seed42, ) sf.write(clone.wav, wav, model.tts_model.sample_rate) # 极致克隆再传参考音频的转写文本还原度最高 wav model.generate( text这段话用同一音色读出来。, prompt_wav_pathexamples/reference_speaker.wav, prompt_text参考音频的转写文本, reference_wav_pathexamples/reference_speaker.wav, )前者克隆音色还能单独调语速和情绪后者从参考音频续写连节奏和情绪都尽量保留。入口都在 examples/ 目录。 原理篇不切令牌怎么把话说出来传统 TTS 像用乐高积木砌墙每个声音先被切成规格统一的积木块离散令牌再拼起来拼接处难免有缝。VoxCPM2 更像 3D 打印直接在连续空间里输出语音不先切块细节不丢。整条流水线可以想象成一家餐厅文本是订单模型是后厨分四道工序对应到代码里的四阶段管线 LocEnc → TSLM → RALM → LocDiTLocEnc局部编码器把音频编码成连续潜在表示。参考音频和生成的音频都在这个潜在空间里对话这是克隆能接得上的前提。TSLM基于 MiniCPM-4 的语言模型读文本定下语调、节奏和语义走向。RALM生成残差声学表征补齐音色等声学细节。LocDiT扩散变换器把潜在表示解码成 48kHz 音频。底层 AudioVAE V2 负责编解码16kHz 的参考音频可以直接出 48kHz不用外接超分模型。对做决策有用的结论就两条不离散化所以没有量化误差克隆更像真人潜在空间里做扩散所以高码率输出是顺带的。主接口实现在 src/voxcpm/core.pygenerate()是统一入口。️ 调参与避坑篇参数推荐值与常见故障排查参数推荐值参数作用推荐值cfg_value引导强度越高越贴文本2.0贴不住文本时提到 3.0inference_timesteps扩散采样步数越多质量越好但越慢10追求质量用 20–30seed随机种子固定后结果可复现任意整数max_len生成音频长度上限token 数4096默认device运行设备auto优先 CUDA其次 MPS最后 CPU常见故障排查现象安装或首次运行报 CUDA / torch 相关错误 →原因PyTorch 版本和机器 CUDA 不匹配 →解法先nvidia-smi看驱动支持的 CUDA 版本再装对应版本的 torch。现象CUDA out of memory →原因2B 模型约占 8GB 显存余量不足 →解法VoxCPM.from_pretrained(openbmb/VoxCPM2, load_denoiserFalse, devicecpu)慢但能跑通。现象同一句音色设计或克隆两次结果不一样 →原因官方说明这两类功能的跨次生成存在随机波动 →解法固定 seed生成 1–3 次留最满意的一条。现象克隆出来的声音不像本人 →原因参考音频太短或有背景噪音 →解法换一段完整、干净的录音并改用极致克隆同时传prompt_wav_path和prompt_text。 继续深入如果你有 5–10 分钟自己的录音可以用 LoRA 微调让模型适配特定说话人。数据是 jsonl 格式每行一个音频路径加文本见 examples/train_data_example.jsonl训练配置在 conf/voxcpm_v2/voxcpm_finetune_lora.yaml默认 LoRA 秩 32、学习率 1e-4python scripts/train_voxcpm_finetune.py \ --config_path conf/voxcpm_v2/voxcpm_finetune_lora.yaml其他入口README_zh.md中文文档含三个版本的参数、显存和 RTF 对比app.py本地 Web 演示python app.py后打开 8808 端口scripts/train_voxcpm_finetune.py微调入口SFT 和 LoRA 都支持src/voxcpm/cli.py命令行实现voxcpm --help可看 design、clone、batch 全部子命令社区讨论飞书群扫码进群先把快速上手的代码跑通听一遍第一段 demo.wav。觉得音色不合适就换能力篇第二个场景用一句话让它重新设计。代码和权重都是 Apache-2.0商用的路是通的。【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考