ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

15 分钟上手 faster-whisper:4 倍速语音转文字完整指南

2026/9/5 23:30:46 拓冰建站 浏览量
15 分钟上手 faster-whisper:4 倍速语音转文字完整指南 15 分钟上手 faster-whisper4 倍速语音转文字完整指南【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper如果你要把会议录音、课程音频批量转成带时间戳的文字faster-whisper 值得看一眼它用 CTranslate2 引擎重写了 OpenAI Whisper在相同准确率下速度最高快 4 倍还支持 99 种语言自动识别。它凭什么值得你花几分钟速度快且快得有数据官方基准里GPU 上 13 分钟音频用 large-v2 模型faster-whisper 跑 1 分 03 秒openai/whisper 要 2 分 23 秒再开batch_size8批处理只要 17 秒。CPU 上 int8 量化后small 模型 13 分钟音频 51 秒跑完。省内存同样 GPU 场景int8 量化把显存占用从 4525MB 压到 2926MB小显存卡也能跑大模型。免装 FFmpeg和 openai/whisper 不同它用 PyAV 解码音频FFmpeg 的库直接打包在 pip 依赖里装好就能读 mp3、m4a、wav 等各种格式。装好它一条命令跑通环境要求Python 3.9 或更高纯 CPU 即可运行有 NVIDIA GPU 则需 CUDA 12 cuBLAS cuDNN 9不需要单独安装 FFmpeg安装只需一条命令# 一条命令安装 faster-whisper会自动带上 CTranslate2、PyAV 等依赖 pip install faster-whisper首次按模型名如large-v3加载时会自动从 Hugging Face 下载对应的 CTranslate2 模型之后就有本地缓存了。挑对参数使用场景 → 推荐配置使用场景模型 (model_size)设备 (device)精度 (compute_type)其他建议快速出稿、实时性优先tiny / smallcpuint8准确率换速度适合草稿日常通用转录small / mediumcudafloat16平衡之选最高精度、长音频large-v3cudafloat16显存吃紧时换 int8_float16小显存 GPU≤8GBlarge-v3cudaint8_float16显存约为 fp16 的 2/3追求更快的高精度turbo即 large-v3-turbocudafloat16专为该库优化见下文批处理批量处理多个长音频turbocudafloat16用 BatchedInferencePipeline batch_size另外两个高频开关比换模型见效更快vad_filterTrue启用内置的 Silero VAD自动裁掉超过 2 秒的静音段长音频转录明显提速还能减少静默处的幻觉文字。word_timestampsTrue输出词级时间戳做字幕、高亮定位时要用。最常用的调用方式长这样from faster_whisper import WhisperModel # 在 GPU 上用 FP16 加载 large-v3 模型 model WhisperModel(large-v3, devicecuda, compute_typefloat16) # 转录音频开启 VAD 静音过滤返回带时间戳的分段结果 segments, info model.transcribe(meeting.mp3, beam_size5, vad_filterTrue) print(f检测到的语言{info.language}概率 {info.language_probability:.2f}) for seg in segments: # 注意segments 是生成器必须遍历才会真正开始转录 print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})注意segments是生成器不调用for或list()它不会开始干活这是新手最容易卡住的一点。把它用进你的工作流周一上午一场 1 小时的产品评审会。会后录音直接丢给脚本用 small 模型加vad_filterTrue几分钟后拿到带时间戳的逐段文字语言自动检测成中文把时间戳去掉标点整理一下就是会议纪要的底稿。周三下午处理一整个学期的课程录音。十几门课、每门几小时单条跑太慢。用BatchedInferencePipeline包一层WhisperModel设batch_size16GPU 上吞吐量能拉开一个量级跑完把结果写成 SRT 或 LRC 字幕文件直接挂到视频上。周五晚上给播客加双语字幕。开启word_timestampsTrue拿到每个词的起止时间按词做卡拉 OK 式逐词高亮字幕遇到专业术语识别不准就在initial_prompt里塞一段含这些词的文本来引导。踩坑先读我现象原因解法GPU 上加载报 cuBLAS/cuDNN 相关错误最新版 ctranslate2 只支持 CUDA 12 cuDNN 9老环境降级CUDA 11 装ctranslate23.24.0CUDA 12 cuDNN 8 装ctranslate24.4.0显存不足 / OOMFP16 大模型显存占用高换int8_float16或 CPU 的int8或换 small/medium 模型转录速度上不去CPU 或低配卡单条逐段推理利用率低长音频用BatchedInferencePipelinebatch_sizeCPU 上可设OMP_NUM_THREADS控制线程数静默段出现重复、无意义的幻觉文字模型在没声音处硬编内容开启vad_filterTrue必要时调vad_parameters里的min_silence_duration_ms调用 transcribe 后像没反应返回的 segments 是生成器遍历或list(segments)才会真正执行转录想对比速度但结果不一致各家默认 beam_size 不同这里默认是 5对比时固定 beam_size、线程数、WER 相近的配置再比时间再往前一步参数不够用时直接看WhisperModel.transcribe的完整签名hotwords、temperature、condition_on_previous_text等选项都在里面faster_whisper/transcribe.py 是最全的参考。调静音过滤行为可以看 faster_whisper/vad.py想确认支持哪些语言代码faster_whisper/tokenizer.py 里的语言表是最准的。此外仓库还自带 benchmark/ 下的 WER 与速度基准脚本以及把自有 Whisper 权重包括微调过的转成 CTranslate2 格式的转换入口做领域定制模型时会用到。收尾现在就装好它拿一段手头最烦的录音试跑一次比读十篇评测都有数。源码入口在 faster_whisper/测试用例参考 tests/更多细节以官方文档为准。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考