
ClearerVoice-Studio 完整上手攻略AI 语音降噪、人声分离与音质增强一次搞定【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio如果你正在寻找一款开箱即用的AI 语音处理工具那么 ClearerVoice-Studio 值得你花三分钟看完这篇文章。它是一个开源的 AI 语音处理工具箱内置了当前业界领先的预训练模型覆盖语音降噪、人声分离、音质超分、目标说话人提取等常见任务。无论你是完全不懂编程的普通用户还是需要二次开发的工程师都能在很短的时间内跑通它的完整流程。本文将带你从零开始先安装再跑通第一个例子然后逐个拆解它的核心能力最后介绍进阶的自定义训练与音质评估方法。文末还附上了常见问题速查表方便你随时回来查阅。为什么你需要一个这样的工具设想一个很常见的场景你在会议室里录了一段 40 分钟的访谈回来一听空调声、键盘声、窗外车流声全混进了人声里更糟的是两个人的声音交叠在一起后期想剪都无从下手。这类问题传统上要么靠昂贵的音频后期软件手动处理要么干脆放弃。而 ClearerVoice-Studio 的思路很简单用训练好的 AI 模型把清人声这件事变成一次函数调用。你不用理解信号处理原理也不用调一堆参数几行代码就能拿到干净的结果。项目整体由三大组件构成覆盖用、训、评三个环节组件面向人群作用ClearVoice所有用户推理入口加载预训练模型直接处理音频Train研究人员、开发者训练与微调框架支持多种模型架构SpeechScore需要量化音质的人一站式语音质量评估工具包五分钟跑通第一个案例安装步骤最省事的方式是直接用 pip 安装pip install clearvoice如果你想基于源码进行二次开发或者想参考项目里的演示代码可以克隆仓库后以可编辑模式安装git clone https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio cd ClearerVoice-Studio/clearvoice pip install --editable .一个小提醒如果你要处理的音频不只是 WAV还包括 MP3、AAC、FLAC、OGG、M4A、OPUS、WMA 等格式建议先装好 FFmpeg模型才能正确解码这些格式。首次运行安装完成后进入 clearvoice 目录运行演示脚本python demo.py如果你希望每一步都看得明明白白可以换成带详细注释的版本python demo_with_more_comments.py脚本会把 samples 目录里的示例音频喂给预训练模型处理结果直接写到输出文件里。第一次运行时模型权重会自动下载单个模型约 100MB~500MB之后就可以离线使用了。核心能力逐个拆解语音增强三款降噪模型怎么选语音增强是最常用的功能专门对付有背景噪音的录音。ClearVoice 内置了三款预训练模型侧重点各不相同模型采样率特点FRCRN_SE_16K16kHz处理速度快适合对实时性有要求的场景MossFormerGAN_SE_16K16kHz效果与速度比较均衡的高质量选择MossFormer2_SE_48K48kHz全频带处理保留更多声音细节音质上限最高使用示例非常直观from clearvoice import ClearVoice # 创建语音增强处理器 myClearVoice ClearVoice(taskspeech_enhancement, model_names[MossFormer2_SE_48K]) # 方式一处理单个文件返回波形后自行写入 output_wav myClearVoice(input_pathsamples/input.wav, online_writeFalse) myClearVoice.write(output_wav, output_pathsamples/output_enhanced.wav) # 方式二整个目录批量处理自动写入输出目录 myClearVoice(input_pathsamples/path_to_input_wavs, online_writeTrue, output_pathsamples/path_to_output_wavs)除了单文件和目录两种调用方式它还支持通过 .scp 清单文件指定一批要处理的音频方便接入已有数据管线。语音分离把混在一起的声音拆开当录音里有多个说话人同时发声语音分离功能可以把每个人的声音单独拎出来。项目给出的实验数据很能说明问题模型LRS2_2Mix (16kHz)WSJ0-2Mix (8kHz)Libri2Mix (8kHz)Conv-TasNet10.615.312.2MossFormer2_SS_16K15.522.016.7调用方式和增强几乎一模一样myClearVoice ClearVoice(taskspeech_separation, model_names[MossFormer2_SS_16K]) output_wav myClearVoice(input_pathsamples/input_ss.wav, online_writeFalse) myClearVoice.write(output_wav, output_pathsamples/output_separated.wav)分离结果会按说话人拆成多路输出方便你逐条对轨处理。语音超分辨率让旧录音返老还童老录音往往采样率低、声音发闷。语音超分辨率也叫频带扩展能把 16kHz、24kHz、32kHz 的低清音频升级到 48kHz 高音质听感改善非常明显。处理流程是输入低质量音频 → 模型做频带扩展与细节恢复 → 输出 48kHz 的高质量音频。myClearVoice ClearVoice(taskspeech_super_resolution, model_names[MossFormer2_SR_48K]) output_wav myClearVoice(input_pathsamples/input_sr.wav, online_writeFalse) myClearVoice.write(output_wav, output_pathsamples/output_sr_48k.wav)值得注意的是这个功能对带噪音频同样有效。你可以先做一次增强去噪再做超分辨率两段代码串联起来即可得到又干净又高清的结果。目标说话人提取从视频里锁定特定的声音如果你手里的素材是视频而且想只保留其中某个人的声音可以使用目标说话人提取功能。它结合画面中的口型、人脸等信息从混合音频中精准抽出目标说话人的声音非常适合处理多人访谈、课堂录像等场景。进阶玩法一用 Train 训练自己的模型预训练模型的效果虽好但如果你面对的是特定场景比如直播间、工厂车间、特定语种的录音微调一个自己的模型往往效果更佳。项目为此提供了完整的训练框架覆盖语音增强、语音分离、语音超分辨率、目标说话人提取等任务。训练流程大致是先用数据生成脚本造出带噪或带混响的训练数据再从 FRCRN、MossFormer2 等架构中挑选模型调整训练配置最后用 SpeechScore 评估效果。数据生成脚本train/data_generation/speech_enhancement/训练配置文件train/speech_enhancement/config/train/针对目标说话人提取项目还额外支持以参考语音、人脸口型、身体姿态甚至脑电信号为条件的多种提取方式研究空间很大。进阶玩法二用 SpeechScore 量化音质处理完到底变好了多少与其靠耳朵猜不如用客观指标说话。SpeechScore 提供了涵盖 PESQ、STOI、DNSMOS、SI-SDR 等近 20 项主流评估指标其中像 DNSMOS、NISQA、DISTILL_MOS 这类无参考指标甚至不需要干净对照音频就能打分。from speechscore import SpeechScore # 初始化评估器指标可按需增删 mySpeechScore SpeechScore([PESQ, STOI, DNSMOS, SISDR]) # 单文件评估对比降噪前后 scores mySpeechScore(test_pathaudios/noisy.wav, reference_pathaudios/clean.wav, windowNone, score_rate16000, return_meanFalse)它也支持传入两个目录做批量对比返回每个指标的平均分方便你在多个模型之间横向比较。详细说明见 speechscore/README.md。提升处理体验的几个实用建议硬件配置怎么选不同的使用方式对硬件要求差别很大供你参考使用场景建议配置基础推理4GB 以上 GPU 显存可跑通大多数预训练模型模型训练8GB 以上显存支持常规批量训练大规模批处理16GB 以上显存可并行处理多个任务处理长音频的技巧超过 5 分钟的长音频建议这样做分段处理把音频切成 30~60 秒的片段再送入模型稳定性更好批量处理用目录批处理方式一次喂入多个片段省去反复调用监控内存处理过程中留意 GPU 显存占用避免长音频导致内存溢出格式兼容性速查WAV原生支持无需额外依赖MP3 / AAC / FLAC / OGG 等需要 FFmpeg 支持视频文件目标说话人提取支持 AVI、MP4、MOV、WEBM 等常见格式常见疑问速查问完全不懂编程能用吗答可以。安装后照着上面几段代码抄一遍就能完成处理演示脚本里也已经写好了完整示例。问支持哪些操作系统答Windows、macOS、Linux 都支持安装过程一致。问处理效果怎么量化答用 SpeechScore 即可它提供近 20 种客观指标其中包含无需参考音频的无参考评分。问能处理实时音频流吗答目前以文件处理为主但配合分段处理可以实现准实时的效果。问模型文件会不会很大答单个预训练模型约 100MB~500MB首次使用时自动从 HuggingFace 下载之后可离线使用。现在就可以动手了到这里你已经掌握了 ClearerVoice-Studio 从安装到实战的完整路径。接下来的行动清单很简单跑一遍 demo装好后先运行python demo.py用自带的示例音频感受降噪与分离效果换成自己的音频把样例路径替换成你自己的录音体验真实场景动手训练如果你有特定场景需求按 Train 目录的文档尝试微调模型量化对比用 SpeechScore 给处理前后的音频打分确认提升幅度从一个恼人的噪音问题开始到拥有一整套可复用的语音处理流程ClearerVoice-Studio 帮你在知道和会用之间铺了一条最短的路。现在就打开终端让第一段干净的声音响起吧。【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考