ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Buzz 离线转录:基于 Whisper 的本地语音转文字完整指南

2026/9/6 15:09:37 拓冰建站 浏览量
Buzz 离线转录:基于 Whisper 的本地语音转文字完整指南 Buzz 离线转录基于 Whisper 的本地语音转文字完整指南【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款开源的离线音频转录工具基于 OpenAI Whisper 模型让你的语音转文字全部在本机完成不需要上传到任何云端服务。导入音频或视频文件、对着麦克风实时录音它都能生成带时间戳的文字并支持翻译成其他语言、导出 SRT 字幕。项目速览Buzz 由开发者 Chidi Williams 维护采用 MIT 协议开源任何人都可以自由使用和修改。技术栈方面它用 Python PyQt6 构建桌面界面核心转写能力交给 Whisper 及其多种社区实现。它定位很明确把语音转文字这件通常需要依赖云服务的事变成你在自己电脑上离线就能干完的活。它是怎么工作的简单来讲Buzz 的链路是输入 → 处理 → 输出三步。输入可以是 MP3、WAV、FLAC 等音频文件也可以是 MP4、MKV 等视频文件视频会自动提取音轨处理阶段由你选定的 Whisper 后端Whisper.cpp、Faster Whisper、Hugging Face 模型等在本地跑完可选启用 CUDA 或 Vulkan 加速输出则是带时间戳的转写文本支持导出 TXT、SRT、VTT 三种格式。任务会在主界面排成队列逐个处理每个文件一条记录进度一目了然。装好它跑通第一个任务安装路径按平台选最短的那条Windows从官方发布渠道下载安装程序遇到 SmartScreen 提示时选择更多信息→仍要运行即可程序未签名。macOS下载 dmg 安装也可以brew install --cask buzz。LinuxFlatpak 或 Snap 都支持flatpak install flathub io.github.chidiwilliams.Buzz一条命令搞定。开发者装好 ffmpeg、用 Python 3.12 环境执行pip install buzz-captions然后python -m buzz启动也可以克隆仓库git clone https://gitcode.com/GitHub_Trending/buz/buzz后从源码运行。跑通第一个任务的流程启动 Buzz点导入媒体文件或按 Ctrl/CmdO选一个音频文件。在任务行里确认三件事任务类型转录/翻译、语言、模型大小。点运行等队列跑完状态列会显示成功。双击该行打开转录查看器直接导出 TXT 或 SRT。按场景用而不是按功能记场景一处理手头已有的文件。这是最常用的路径。除了手动导入你还可以开启文件夹监视把待处理文件扔进指定目录Buzz 发现新文件就自动创建转录任务适合一次性处理一批会议录音或播客。视频文件不用先拆音轨直接导入即可。场景二对着麦克风实时转。打开实时录音窗口选好麦克风和语言点 Record 就开始逐句转写默认有 20 秒的转录间隔来对齐文字与语音。它还有一个演示窗口模式适合在做演讲时把实时字幕投到大屏上。场景三跨语言翻译。任务类型选翻译Buzz 会先把语音转成原文再翻译成目标语言也可以配置 OpenAI 兼容的 API 来做质量更高的 LLM 翻译跨国会议记录和外语学习都适用。场景四对转写结果做精细编辑。转录查看器支持按时间戳跳转、播放控制、语速调节和文本搜索转写不对的地方可以直接改字段落能拆分、合并还能拖拽调整片段的起止时间。处理完再导出 SRT/VTT字幕就能直接丢进剪辑软件。让效果更好的几个办法模型按设备选CPU 或老机器用 Tiny/Base有独立显卡再上 Large-V3速度和质量之间自己权衡。知道语言就手动指定手动选定语言比自动检测更准也更快。专业内容加初始提示在高级设置里填一段包含术语的示例文本模型遇到专有名词时会明显更听话。录音环境能安静就安静底噪大时语速过快、发音含糊的内容再大的模型也救不回来。能上 GPU 就上 GPUNvidia 卡走 CUDA其他显卡用 Whisper.cpp 后端的 Vulkan 加速大文件转写速度差距很大。高频问题转得太慢怎么办先换小一号的模型Tiny/Base再确认启用了 GPU 加速Whisper.cpp 后端对 CPU 机器的表现通常更好。支持哪些格式音频MP3、WAV、FLAC、OGG 等视频MP4、AVI、MKV 等导入后自动提取音轨。能批量处理吗可以。一次导入多个文件会各自生成独立任务排队执行文件夹监视模式则能全自动处理新放进来的文件。不联网还能用吗能。模型首次会下载到本地之后转写、翻译模型自带的翻译全程离线只有配置了外部 API 的 LLM 翻译功能才需要网络。Windows 安装时报警告正常吗正常。程序未做签名SmartScreen 提示时选更多信息→仍要运行即可。给想动源码的人Buzz 的代码组织比较清晰主要模块都在 buzz/transcriber/ 下各类后端Whisper.cpp、Faster Whisper、OpenAI API 等一个文件一个实现界面在 buzz/widgets/转录数据存取在 buzz/db/SQLite DAO 模式。它带了一套插件系统AI 摘要、自动分段、DOCX 导出等都在 buzz/plugins/ 里想加自己的后处理逻辑可以看 plugins/base.py。MIT 协议意味着你可以放心地二次开发或商用。写在最后Buzz 解决的其实是一个很朴素的问题在不把隐私数据交给任何云服务的前提下把声音变成可以搜索、编辑、翻译的文字。如果你手上有需要整理的会议录音、播客或视频素材装一个试一次基本就能感受到本地 Whisper 转录的便利。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考