ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Buzz 离线语音转录:把本地音频转成可编辑字幕的桌面工具

2026/9/7 9:25:17 拓冰建站 浏览量
Buzz 离线语音转录:把本地音频转成可编辑字幕的桌面工具 Buzz 离线语音转录把本地音频转成可编辑字幕的桌面工具【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款运行在个人电脑上的离线语音转录工具基于 OpenAI Whisper 模型能把本地音频、视频文件转写成文字并翻译成目标语言。它适合需要在本机处理录音、制作字幕、整理访谈内容的新手、内容创作者和研究人员——处理过程不经过云端服务器结果直接保存在本机。从录音文件到字幕文件的操作流程Buzz 的主界面是一个任务队列把文件拖入或点击「」导入右侧可逐行选择模型和任务类型转录或翻译随后状态列显示排队、进行中含百分比或已完成耗时。任务完成后双击结果会打开转录查看器每句文字带起止时间戳底部有播放进度条可逐句定位、搜索、调整播放速度。查看器顶部提供 View、Export、Translate、Resize 四个入口导出支持 TXT、SRT、VTT 三种格式。对字幕创作者Resize 入口能调整字幕粒度可设定目标字幕长度按时间间隔合并Merge by gap、按标点分割Split by punctuation、按最大长度分割适合把过密的短字幕整理成可读性更好的段落。本地离线安装步骤不同平台的入口不同普通用户建议直接用官方安装包开发者可以走源码或 PyPI。平台安装方式需要注意macOS下载.dmg安装包支持 Intel 与 Apple SiliconWindows下载安装程序程序未签名安装时需选择「仍要运行」LinuxFlatpak 或 Snap见下方命令开发者 / 源码pip安装或克隆仓库需先装好 ffmpeg、使用 Python 3.12Linux 下两条命令任选其一flatpak install flathub io.github.chidiwilliams.Buzzsudo snap install buzz源码方式适合需要最新功能的用户克隆后安装运行git clone https://gitcode.com/GitHub_Trending/buz/buzz pip install buzz-captions python -m buzz无网络环境下如何配置 Buzz 模型Buzz 的离线前提是「模型已在本机」。若目标机器没有网络可以在联网机器上先下载好模型再整体拷贝到离线机器相同位置。模型缓存目录因系统而异Linux 在~/.cache/BuzzmacOS 在~/Library/Caches/BuzzWindows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。在 Buzz 里也可从菜单打开 Preferences → Models下载任意一个模型后点「Show file location」会直接打开存放模型的文件夹方便确认与拷贝。仓库中scripts/download-models.py脚本可用来预生成一批离线模型缓存适合批量准备环境。提示*.En后缀的模型只识别英语其他语言请使用不带后缀的模型离线环境要提前把目标语言对应尺寸的模型都备好。不同硬件下的模型选择Buzz 内置多种 Whisper 后端同一份音频可换不同后端与模型尺寸跑速度、内存、准确率的取舍不同后端适合的硬件特点WhisperOpenAI 原版内存充足准确但偏慢、占内存多Faster WhisperNvidia 显卡显存 ≥ 6GB速度最快、占用更低Whisper.cpp任意显卡、核显或纯 CPU最省资源Mac 与集显推荐Hugging Face需自定义模型支持多语言及多种自定义 ASR 模型模型尺寸从tiny到large尺寸越小越快、越易出错越大越准、越吃硬件。large、large-v2、large-v3、turbo各有取向官方文档给出的建议是「用自己语言的实际音频测一遍」再定。按目标快速选追求速度、硬件一般whispercppbase/small。有 Nvidia 显卡、追求准确fasterwhispermedium/large。需要特定语言或自定义模型huggingface类型并指定模型 ID。进阶能力与适用边界实时录音转录从麦克风实时转写可开启独立演示窗口用于现场实时转录会持续占用算力长时录音对硬件要求较高。文件夹监控在 Preferences 的 Folder Watch 中指定目录新放入的音频会自动进入转录队列适合批量处理。说话人识别可对转录结果区分不同发言人会增加额外计算。降噪预处理转录前可先做语音分离extract-speech适合背景嘈杂的录音。命令行buzz add支持--model-type、--model-size、--srt/--vtt、--prompt、--word-timestamps等参数可写脚本批量处理详见docs/docs/cli.md。插件内置 AI 摘要、自动字幕调整等插件可在界面中启用。常见限制与排查建议CPU 太老Buzz 要求 CPU 支持 AVX2很老的机器无法运行启动阶段可能直接报错。转得太慢先换更小的模型或换 Whisper.cpp 后端有 ≥6GB 显存的 Nvidia 显卡可换 Faster Whisper。麦克风报错如 PaErrorCode-9999多半是系统权限或安全软件拦截检查系统麦克风权限并临时关闭可能干扰的程序。崩溃常见原因是模型文件下载不完整到 Preferences → Models 删除后重新下载仍不行可在「About Buzz」里「Show logs」查看日志。实时模式卡把「Append and correct」换成更省资源的「Append below」或降低模型尺寸。适合谁使用什么情况下不建议使用Buzz 适合在本机处理录音与视频、需要导出字幕或纯文本、希望数据不上传云端的用户尤其是字幕创作者、访谈/会议整理者、对隐私敏感的专业人士。不太适合期望「一键云端、秒出结果」且不愿在本地准备模型的用户硬件过老无 AVX2、内存不足的机器需要把大量识别任务卸载到远端、本地只负责展示的场景——这类需求可改用其 OpenAI API 后端但那样就不再是纯离线。下一步建议先做三件事确认是否匹配确认本机 CPU 支持 AVX2在目标语言下用tiny/base模型试跑一段真实音频观察速度与准确率确认需要导出的格式TXT/SRT/VTT和导出路径设置符合工作流。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考