ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

别再为杂音头疼:ClearerVoice-Studio 帮你一站式搞定语音降噪、人声分离与音质升级

2026/8/19 18:52:50 拓冰建站 浏览量
别再为杂音头疼:ClearerVoice-Studio 帮你一站式搞定语音降噪、人声分离与音质升级 别再为杂音头疼ClearerVoice-Studio 帮你一站式搞定语音降噪、人声分离与音质升级【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio你有没有经历过这样的崩溃瞬间——会议录音里空调声比人声还大翻遍剪辑软件也救不回来访谈录了两个小时结果两个人声音叠在一起根本没法听或者翻出一段老录音音质糊得像是隔着棉被说话这些问题单靠传统软件修要么效果有限要么操作复杂到让人直接放弃。而今天要介绍的开源工具 ClearerVoice-Studio就是冲着让 AI 帮你把烂录音变干净这件事来的。它是一套 AI 语音处理工具包集成了语音降噪、说话人分离、语音超分辨率、目标说话人提取等能力预训练模型开箱即用从普通用户到算法研究者都能找到适合自己的打开方式。一句话说清它是什么ClearerVoice-Studio 由三个组件构成分工明确ClearVoice面向所有人的推理平台装好就能用负责实际处理音频Train面向研究者和开发者的训练框架支持模型微调与重新训练SpeechScore语音质量评估工具包内置 16 种评估指标帮你量化效果好还是不好它的定位很直接把学术界最前沿的语音处理模型封装成几行 Python 代码就能调用的服务。你不用懂深度学习也能享受到 SOTA业界最先进模型的处理效果。从安装到跑通第一个效果最快 3 步先别被开源项目预训练模型这些词吓到上手路径其实很短。第一步安装最简单的方式是直接用 pip 安装pip install clearvoice如果你想跟着源码学习和二次开发也可以克隆仓库后以可编辑模式安装git clone https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio cd ClearerVoice-Studio/clearvoice pip install --editable .第二步处理你的第一个音频新建一个 Python 文件粘贴下面这段代码from clearvoice import ClearVoice # 创建语音增强处理器48kHz 全频带模型 myClearVoice ClearVoice(taskspeech_enhancement, model_names[MossFormer2_SE_48K]) # 处理单个音频文件返回波形数据 output_wav myClearVoice(input_pathsamples/input.wav, online_writeFalse) myClearVoice.write(output_wav, output_pathsamples/output_enhanced.wav)运行后output_enhanced.wav就是降噪后的结果。模型权重会在第一次调用时自动下载你不需要手动准备任何东西。第三步跑官方演示仓库自带了演示脚本想快速看效果可以这样cd ClearerVoice-Studio/clearvoice python demo.py想深入了解每个调用细节可以换成python demo_with_more_comments.py脚本里每一段都附了注释。常见报错提示如果你处理的是 MP3、AAC、FLAC 等非 WAV 格式可能报格式不支持的错误。这是因为工具依赖 FFmpeg 做格式转换。Ubuntu/Debian 下执行sudo apt install ffmpegmacOS 下执行brew install ffmpeg装完就好。四个核心能力逐个说透1. 语音降噪把嘈杂录音里的噪音墙拆掉这是大多数人最需要的功能。无论你是录播客、拍视频还是做会议纪要背景噪音风扇、键盘、马路声都是最常见的杀手。ClearVoice 提供了三个降噪模型按需选择模型采样率适合场景FRCRN_SE_16K16 kHz追求速度的实时处理场景MossFormerGAN_SE_16K16 kHz效果与速度平衡的常规选择MossFormer2_SE_48K48 kHz高音质全频带处理适合正式作品调用方式完全一致只需要换模型名myClearVoice ClearVoice(taskspeech_enhancement, model_names[MossFormerGAN_SE_16K])在业界公认的 VoiceBankDEMAND 测试集上MossFormerGAN_SE_16K 的 PESQ感知语音质量分越高越好从带噪音频的 1.97 提升到 3.47DNS-Challenge 测试集上更是从 1.58 提升到 3.57。这个数字是什么概念1.97 属于能听到但很吃力3.4 以上已经是听起来清晰自然的水平。2. 语音分离把混在一起的两个人拆开双人对话录音、多人访谈、双声道混合的素材——想单独提取某一方的声音这就是语音分离的用武之地。调用它只需要指定任务和模型myClearVoice ClearVoice(taskspeech_separation, model_names[MossFormer2_SS_16K]) output_wav myClearVoice(input_pathsamples/input_ss.wav, online_writeFalse) myClearVoice.write(output_wav, output_pathsamples/output_separated.wav)处理结果会生成两个文件分别对应两个说话人的声音。官方在多个基准上的表现如下SI-SNRi 为信干比提升数值越大分离越干净模型LRS2_2Mix (16kHz)WSJ0-2Mix (8kHz)WHAM! (8kHz)Conv-TasNet10.615.312.7SepFormer13.520.414.4MossFormer2_SS_16K15.522.017.4注意一个细节MossFormer2_SS_16K 是一个统一模型没有针对每个测试集单独重新训练却依然在多数指标上与专门调过的模型持平甚至领先含金量很足。3. 语音超分辨率给老录音补细节采样率低的音频听起来闷、糊、缺高音细节。超分辨率也叫频带扩展能把低分辨率音频升级到 48kHz相当于给声音重画缺失的高频信息。myClearVoice ClearVoice(taskspeech_super_resolution, model_names[MossFormer2_SR_48K]) output_wav myClearVoice(input_pathsamples/input_sr.wav, online_writeFalse) myClearVoice.write(output_wav, output_pathsamples/output_sr_48k.wav)官方测试显示把 16kHz 音频经超分处理后LSD对数谱距离越低越好从 2.80 降到 1.93如果先降噪再超分效果会更好——这也提示我们复杂音频可以像流水线一样把多个模型串起来用。4. 目标说话人提取看视频认人只留他的声音这是最有黑科技感的一个能力。给定一段包含多人的音视频以及你想提取的那个人的画面模型会结合人脸信息只输出目标说话人的声音。myClearVoice ClearVoice(tasktarget_speaker_extraction, model_names[AV_MossFormer2_TSE_16K]) myClearVoice(input_pathsamples/path_to_input_videos_tse, online_writeTrue, output_pathsamples/path_to_output_videos_tse)支持 AVI、MP4、MOV、WEBM 等常见视频格式。做访谈剪辑、多人大讨论的后期处理时这个功能能省下大量手动对齐音轨的时间。效果好不好用 SpeechScore 量化说话听起来好像干净了是主观感受但做研究或交付项目时你需要客观数字。SpeechScore 就是干这个的它一口气集成了 16 种评估指标包括大家熟悉的 PESQ、STOI、DNSMOS、SI-SDR、SNR 等。from speechscore import SpeechScore import pprint mySpeechScore SpeechScore([PESQ, STOI, DNSMOS, SISDR]) scores mySpeechScore(test_pathaudios/noisy.wav, reference_pathaudios/clean.wav, windowNone, score_rate16000, return_meanFalse) pprint.pprint(scores)如果你只有处理后的音频、没有干净参考比如评测别人的模型也能用 NISQA、DNSMOS、DISTILL_MOS 这类非侵入式指标不需要参考音频就能打分。写论文、对比模型、验收供应商的算法时这一套工具非常趁手。进阶玩法与避坑指南批量处理长音频一个目录下的所有音频一条调用就能全部处理完myClearVoice(input_pathsamples/path_to_input_wavs, online_writeTrue, output_pathsamples/path_to_output_wavs)超过 5 分钟的长音频建议先切成 30~60 秒的片段再批量跑既方便监控进度也避免显存峰值过高。把模型嵌入自己的流程如果你在写训练或推理管线不想走文件读写可以直接传 NumPy 数组。参考仓库里的demo_Numpy2Numpy.py输入[batch, length]的数组输出同样是数组无缝对接你自己的代码。硬件门槛推理场景下 4GB 以上显存的 GPU 就能跑大多数模型要做训练或微调建议 8GB 以上。没有 GPU 也不是不能用只是慢一些。格式兼容性原生支持 WAV 和 FLAC装好 FFmpeg 后MP3、AAC、OGG、M4A、WMA 等格式都可以直接处理单双声道和 16/32 位精度都支持。新手常踩的三个坑忘了装 FFmpeg处理非 WAV 格式时报错——提前装好省得排查把输入采样率搞错——每个模型有对应的采样率要求48kHz 模型就别喂 8kHz 音频必要时先用 librosa 重采样第一次运行要下载模型权重网络不好会卡很久——耐心等或者提前从 ModelScope 手动下载好放到./clearvoice/checkpoints关于这个项目你可能还想问问完全不懂编程能用吗答能。安装后用示例代码改一改文件路径就能跑demo 脚本都是现成的。实在不想碰代码也可以先到 HuggingFace 或 ModelScope 的在线 Demo 上体验效果。问模型权重需要自己下载吗答不用。推理时框架会自动从 HuggingFace 拉取模型如果自动下载失败手动从 ModelScope 下载后放到指定目录即可。问我能用这个训练自己的模型吗答可以。Train 组件提供了语音增强、分离、超分辨率和目标说话人提取的完整训练与微调脚本配置在train/目录下按 README 准备数据就能跑。问效果好坏怎么跟别人对比答用 SpeechScore 在相同测试集上算同一组指标数字说话最公平。仓库里已经给出了多个模型在标准测试集上的完整评测表格。问项目还在活跃维护吗答很活跃。项目持续更新新增了超分辨率任务、多格式支持、NumPy 接口还不断补充新的评估指标社区也提供了官方交流群。现在去处理你的第一段录音ClearerVoice-Studio 的价值在于它把过去只有实验室里才跑得动的语音处理技术变成了一条pip install就能上手的路径。不管是给视频素材降噪、拆开双人对话、抢救老旧录音还是给模型打分做对比它都能一站搞定。下一步很简单装好环境拿手边那段不满意的录音跑一次亲耳听听前后的差别。你会惊讶于困扰了你好久的杂音问题原来可以这么轻松地解决。如果训练、微调或深度定制是你真正需要的仓库里的train/目录也为你敞开了大门。无论是入门体验还是深度研究都欢迎你加入这个项目一起把 AI 语音处理做得更好用。【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考