ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Buzz 离线语音转文字:免费本地 Whisper 转录完整上手指南

2026/9/20 10:37:29 拓冰建站 浏览量
Buzz 离线语音转文字:免费本地 Whisper 转录完整上手指南 Buzz 离线语音转文字免费本地 Whisper 转录完整上手指南【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款跑在你自己电脑上的音频转录工具基于 OpenAI Whisper 离线完成语音转文字和多语言翻译音频不出本机全程免费不上传任何数据。它帮你解决什么问题你有没有过这些时刻会议录音攒了一堆想转成文字却发现在线服务要么要注册、要么按量收费视频要做字幕但又不想把素材传到别人的服务器上有些音频涉及敏感内容根本不能离开本地。Buzz 就是为这些场景准备的。它在本地调用 Whisper 家族模型完成转录后端可选 Whisper、Whisper.cpp、Faster Whisper、Hugging Face 模型等多个桌面形态MIT 许可证你想怎么用都行。装好跑通第一遍用图形界面的你直接去下载页拿对应平台的安装包。Windows 用户注意一点安装包没有做代码签名安装时系统会弹安全警告点更多信息再选仍要运行就行属于正常现象。macOS 用户现在需要 Apple Silicon 机型Intel 的 Mac 只能用到 1.4.5 及更早版本。Linux 用户最省事一条 Flatpak 命令flatpak install flathub io.github.chidiwilliams.Buzz想从源码或 PyPI 装的开发者前提是本机装好 ffmpeg。Python 环境下执行pip install buzz-captions python -m buzz装完打开应用导入一个音频文件选好语言和模型点运行第一次转录的完整流程就走通了。习惯命令行的你一条buzz add就能指定后端、模型和输出格式buzz add -m whispercpp -s medium -l zh --srt meeting.mp3不打开窗口也能跑加上--hide-gui参数即可后面讲自动化时会再用到。三种用法按需选姿势一把文件丢进桌面界面。这是最顺手的用法几个要点值得知道支持近百种语言语言栏留空则自动检测适合混杂或不确定语种的内容转录结果可导出 TXT、SRT、VTT 三种格式SRT/VTT 能直接进剪辑软件转录查看器支持搜索、播放控制、倍速播放点哪段播哪段想区分谁说了什么用说话人识别功能把发言人标注开某个片段时间戳对不齐用片段调整工具手动微调起止时间批量处理可以把目录设为监视文件夹新文件落进去自动建任务转录姿势二开麦克风实时转。主界面切到实时录音模式选好麦克风就能边说边出字。出字不是瞬时的系统默认有一段缓冲延迟来保证文字和语音对得上。现场演讲或活动演示时还能单独弹出一个演示窗口把实时文字投出来。转录的同时也可以指定目标语言做翻译说完直接得到译文。姿势三命令行加监视目录做自动化。buzz add的参数基本覆盖界面里的所有选项-m选后端whisper、whispercpp、fasterwhisper、huggingface、openaiapi-s选模型大小-l指定语言-t translate切换到翻译任务输出格式用--srt、--vtt、--txt控制。1.4.6 版本起支持一次传多个文件排队处理也能用通配符把整个文件夹的录音丢进去再用--output-directory把产物统一放到字幕目录buzz add --srt --output-directory ./subtitles recordings/*.mp4这样就能写进脚本或 CI 流程夜里跑一批早上收字幕。两个场景走一遍场景 A给已有视频出字幕。导入视频文件Buzz 会自动抽音轨你不用自己转格式。任务选转写语言按内容指定知道是中文就直接选 zh别用自动检测更准模型按机器性能选 small 或 medium运行。跑完后打开转录查看器核对时间戳哪里不对就调整最后导出 SRT 或 VTT。产出物是一个能直接拖进剪辑软件的字幕文件安静环境下录的内容基本不用人工精校。场景 B会议边录边转。切到实时录音模式选好会议麦克风开始录音底部面板实时出字。结束后保存这条转录如果人多跑一遍说话人识别把发言者分开再按需翻译成目标语言归档。产出物是一份带时间戳、区分了发言人、可翻译成任意语言的文字记录。性能与避坑如果转录速度慢得离谱先想两件事模型是不是选大了小机器直接用 tiny 或 base。后端是不是没吃到 GPU换 Whisper.cpp 后端并启用加速N 卡走 CUDA其他显卡走 Vulkan速度差距非常明显。如果专有名词、术语总被识别错去高级设置里填初始提示initial prompt把术语和背景塞进去给模型上下文。另外确定音频语言时手动指定别交给自动检测能省掉一部分误判。如果 Windows 安装时报安全警告不用慌安装包本身没签名更多信息→仍要运行就是标准解法。如果 PyPI 装的版本 GPU 不生效多半是因为默认装的是 CPU 版 torch。按 README 的说明改装带 CUDA 后缀的 torch 和对应运行库N 卡才能跑起来。二次开发入口想接新转录后端看 buzz/transcriber/ 目录Whisper、Whisper.cpp、Faster Whisper、Hugging Face 各占一个文件照着写一个实现接口即可。插件机制在 buzz/plugins/内置的 AI 摘要、DOCX 导出、自动调整字幕时长都在这想加自定义后处理就从这里入手。命令行完整参数一览在 docs/docs/cli.md。更多使用细节看 docs/docs/ 里的文档跑批任务遇到问题或者有想要的功能直接去项目 Issues 提维护者更新很勤。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考