ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

语音转文字快 4 倍:faster-whisper 上手笔记

2026/9/5 22:52:18 拓冰建站 浏览量
语音转文字快 4 倍:faster-whisper 上手笔记 语音转文字快 4 倍faster-whisper 上手笔记【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper上周三开了三小时的会录音还躺在硬盘里手动整理纪要要耗掉整个下午——而这件事每周都要重来一遍。faster-whisper 就是冲着这类场景去的它是基于 CTranslate2 推理引擎对 OpenAI Whisper 的重实现核心功能就是语音转文字而且速度足够快普通笔记本也能跑得动。 三步跑通pip install faster-whisper第二步八行代码转出第一段文字from faster_whisper import WhisperModel # 加载 base 模型首次运行自动下载 model WhisperModel(base, devicecpu, compute_typeint8) segments, info model.transcribe(meeting.mp3) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})注意segments是个生成器真正开始转写是在你遍历它的时候。有 NVIDIA 显卡的话改两个参数就行devicecuda, compute_typefloat16运行前先装依赖pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*。 它解决什么问题带时间戳的转写剪视频字幕、回看会议录音时你得知道每句话出现在第几秒。每个 segment 自带 start/end 时间戳不用再手工对齐。词级时间戳做卡拉 OK 字幕、歌词对齐这种精细活时开启word_timestampsTrue就能精确到每个词。静音过滤长音频里可能一半是沉默。打开vad_filter它内置的 Silero VAD 会自动跳过非语音片段算力不浪费在背景音上。多语言识别与翻译外語讲座、跨国访谈不用先确认语言它会自动检测设置tasktranslate还能把语音内容直接翻成英文文本。⚡ 性能到底快多少官方基准里同一张 GPU 转写 13 分钟音频原始 openai/whisper 要 2 分 23 秒faster-whisper 1 分 03 秒最快可达约 4 倍速度再开 8-bit 量化加批处理能压到 16 秒左右显存占用也省了一大块。 进阶与生态GPU 环境新版 ctranslate2 只支持 CUDA 12 cuDNN 9CUDA 11 用户可降级ctranslate23.24.0CUDA 12 配 cuDNN 8 用4.4.0批处理推理BatchedInferencePipeline可直接替换WhisperModel.transcribebatch_size16下速度再上一个台阶模型转换ct2-transformers-converter命令可以把任意 Transformers 兼容的 Whisper 模型含自微调模型转成 CTranslate2 格式源码入口转写主逻辑在 faster_whisper/transcribe.pyVAD 默认参数在 faster_whisper/vad.py贡献本地装pip install -e .[dev]跑pytest tests/验证后再提 PR许可证MIT✅ 今晚就试一段拿回开头那段三小时的会议录音跑一次 base 模型的转写——CPU 上几分钟GPU 上更短纪要连时间戳一起就出来了。如果打算把它接进自己的服务从transcribe()的参数表读起那里就是全部能力的入口。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考