ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Buzz 离线语音转文字完全指南:免费开源的 Whisper 转录工具如何快速上手

2026/9/6 23:34:21 拓冰建站 浏览量
Buzz 离线语音转文字完全指南:免费开源的 Whisper 转录工具如何快速上手 Buzz 离线语音转文字完全指南:免费开源的 Whisper 转录工具如何快速上手【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz会议录音、采访音频、课程视频,文字稿整理起来费时费力;交给云端转录服务,又担心隐私泄露、按量收费。Buzz 是一个免费开源的离线语音转文字工具,基于 OpenAI 的 Whisper(一个开源的语音识别模型)在你的个人电脑上完成转录和翻译,音频全程不离开你的设备。这篇文章带你从零开始把它用起来。三大平台安装 Buzz 离线转录工具根据你的系统选一种方式即可。macOS到官方发布页下载.dmg文件,双击安装。Intel 和 Apple Silicon 芯片都支持。Windows下载官方安装包运行。注意:程序未签名,安装时系统会弹出安全警告,选择更多信息→仍要运行即可继续。Linux两种方式任选:# Flatpak flatpak install flathub io.github.chidiwilliams.Buzz # Snap sudo snap install buzz开发者备选:从 PyPI 安装pip install buzz-captions python -m buzz这种方式要求 Python 3.12 环境,并需提前装好 ffmpeg(一款常用的音频处理工具)。详细步骤见 官方安装文档。三步完成第一次音频转录装好后打开主界面,整个流程只有三步:导入文件:点击工具栏的按钮,或按Ctrl/Cmd O,选择音频或视频文件,也可以直接导入 YouTube 链接。配置任务:选择任务类型(转录原文,或翻译成英文)、指定语言、选一个模型。建议手动指定语言——自动检测可能出错,而指定语言通常能提升准确率。点击 Run:任务进入队列,完成后双击该行打开转录结果,导出为 TXT、SRT 或 VTT 格式。几个容易忽略的实用选项:Initial prompt(初始提示词):在高级设置里填入容易拼错的人名、专业术语,模型会把它们写对。Word-Level Timings(逐词时间戳):开启后每个字都有时间戳,之后可重新合并为字幕。Extract speech:先分离出人声再转录,对嘈杂音频有效。模型选型速查:Whisper 类型与模型大小怎么选Buzz 内置四种Whisper 类型(即同一模型的四种实现),性能差别很大,先选类型再选大小:Whisper 类型特点适合谁Whisper.cppC 实现,速度快、省内存,支持 Vulkan 加速,可用任意品牌 GPU 甚至纯 CPU大多数人的首选,尤其 Mac 用户Faster Whisper比原版快得多,内存占用更低拥有 NVIDIA 显卡且显存 ≥ 6GB 的用户Whisper(原版)准确但慢,吃内存有充足内存、追求原味的用户HuggingFace支持海量第三方模型(如 Parakeet、Qwen3-ASR)需要特定语言定制模型的用户模型大小方面,可选 tiny、base、small、medium、large 五档:越小越快、越省资源,但准确率越低;越大越准,但越吃硬件。官方 FAQ 还提到几个细节:Large-V3精度通常最高但偶有幻觉(生成音频里不存在的词);Turbo则在速度和精度之间取平衡。最稳妥的办法是拿自己的音频把几个候选都试一遍。模型在偏好设置里下载和管理,Whisper.cpp 类型还支持下载量化版本(如 q5)进一步提速:进阶玩法:实时转录、说话人识别与插件️ 麦克风实时转录在底部选好语言、质量档位和麦克风,点 Record 即可。转录结果可开在演示窗口里投屏给会议或演讲用。官方文档特别提醒:实时转录比较吃资源,建议用 Whisper.cpp 类型 小模型,否则可能跟不上说话速度。说话人识别转录完成后,在结果查看页点击Identify speakers,Buzz 会把不同发言人的句子标上标签,你可以试听片段、把标签改成真名,还能把同一个人的连续句子合并成一段。插件系统(1.4.5 版本)在 Help → Plugins 里开关、排序、配置插件,内置的有:AI 摘要(调 OpenAI 兼容接口生成摘要)、字幕重排(把逐词时间戳重组为字幕分句)、导出 DOCX、DeepFilterNet 降噪、跳过已转录文件等。插件源码在 buzz/plugins/,照着内置插件写一个自己的也不难。命令行批量处理Buzz 自带 CLI,适合脚本化和批量任务,例如用 Whisper.cpp 的 small 模型转录并直接导出 SRT 字幕:buzz add --task transcribe --model-type whispercpp --model-size small --srt /path/to/audio.mp4全部参数见 CLI 文档。常见问题排查转得太慢怎么办?换更小的模型,或改用 Whisper.cpp 类型(它甚至能在集成显卡的笔记本上跑准实时)。NVIDIA 显卡用户可考虑 Faster Whisper(需 ≥6GB 显存)。详见 FAQ。模型存哪里?Linux 在~/.cache/Buzz,macOS 在~/Library/Caches/Buzz,Windows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。也可以在 偏好设置 → Models 里点Show file location直接打开。Buzz 能完全断网使用吗?能。在联网电脑上下载好模型,把模型文件夹整体拷到离线机器的相同位置即可;仓库里还有 scripts/download-models.py 可批量准备模型缓存。启动或转录时崩溃?多半是模型下载不完整:在 偏好设置 → Models 删除后重新下载。另外 Buzz 要求 CPU 支持 AVX2 指令集,非常老的电脑无法运行。麦克风报错 PaErrorCode-9999?检查系统隐私设置是否允许 Buzz 访问麦克风(Windows:设置 → 隐私 → 麦克风),或临时关闭杀软试试。写在最后Buzz 把 Whisper 的语音转文字能力完整地搬到了本地:免费、开源、离线运行,文件转录、实时转录、说话人识别、插件扩展一应俱全。现在就按上面的步骤装一个,导入你最久没整理的那段录音,看看多久能拿到文字稿。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考