ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Buzz 离线语音转文字完整指南:3个场景搞定音频转文字

2026/9/7 10:05:46 拓冰建站 浏览量
Buzz 离线语音转文字完整指南:3个场景搞定音频转文字 Buzz 离线语音转文字完整指南3个场景搞定音频转文字【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款开源的离线语音转文字工具基于 OpenAI Whisper 模型把转录与翻译全部放在你本机完成支持文件导入、麦克风实时录音和 TXT、SRT、VTT 等格式导出。本文按三个典型场景走通完整流程。 安装 BuzzWindows、Mac、Linux 各走一条路按你的系统选一条路macOS下载.dmg安装包直接装。Windows下载安装包应用未签名首次运行会有警告选更多信息 → 仍要运行即可。Linux走 Flatpak 或 Snap。PyPI需要 Python 3.12 并预装 ffmpeg执行pip install buzz-captions后用python -m buzz启动。首次运行要下载 Whisper 模型。若目标机器完全离线可把联网机器上的models目录Linux 默认在~/.cache/Buzz复制到离线机器相同位置仓库里的 scripts/download-models.py 就是为准备离线模型缓存写的。flatpak install flathub io.github.chidiwilliams.Buzz # 或 Snap sudo snap install buzz 场景一把采访录音批量转成文字Buzz 主界面是任务列表每个音频占一行显示状态、所用模型和导出路径。第一次转录的三步操作菜单文件 → 导入媒体文件或按Ctrl/Cmd O选择 MP3、WAV、MP4 等文件。选任务转录或翻译成英文、语言和模型点运行。状态变为 Completed 后双击该行打开转录查看器。右侧选项里还能设置导出格式TXT/SRT/VTT、开启Word-Level Timings生成逐字时间戳或勾选Extract speech先抽取人声再转录提升嘈杂录音的准确率。模型尺寸与后端怎么选尺寸从 tiny 到 large越小越快、误差越多日常用small起步通常够用。后端按硬件选Whisper官方实现准确但慢、吃内存。Whisper.cppC 实现独立显卡、核显甚至纯 CPU 都能跑。Faster Whisper需要 6GB 以上显存的 Nvidia 显卡。HuggingFace支持自定义模型和 MMS 多语言模型家族。另外两个细节高级设置里的Initial prompt可填入容易拼错的人名、术语减少专名词误识别已知语种时手动指定语言比自动检测更稳。 场景二讲座或会议的实时转录切到录音界面选好任务、语言、模型和麦克风点Record即开始文字随讲话滚动输出。转录模式有三种追加在下方、追加在上方、追加并纠正持续修正上一句尾部负载更高。做现场活动时可打开演示窗口把实时文字用大字号投到第二块屏幕。实时转录还能把文本文件持续导出方便接进 OBS 等直播工具。两条经验提示实时转录负载大优先Whisper.cpp加小模型base 及以下。环境嘈杂时调高静音阈值低于阈值的声音直接不转。 场景三把转录稿变成能用的字幕转录查看器支持搜索、播放和倍速调整可以边听音频边逐段核对、修改边界。字幕分段调整原始分段对字幕来说往往太长。Resize 功能把词级分片重新组合成字幕长度的段落按标点拆句、按静音间隔合并、限定单条字幕最大长度。前提是转录时开启了词级时间戳。 用插件扩展转录流水线1.4.5 起内置插件系统菜单Help → Plugins里可启用/停用、拖拽调整执行顺序。自带的几个覆盖了常见需求AI Summary转录后用 OpenAI 兼容 API 生成摘要。DeepFilterNet转录前先去除背景噪音。Enhanced Language Detection对未知语种文件自动检测语言。Skip Already Transcribed同目录已有.srt/.txt的文件直接跳过。Export to DOCX一键导出 Word 文档。插件源码在 buzz/plugins/ 目录读它的结构就能照着写自己的插件。⌨️ 命令行与文件夹监控的批量自动化文件多时用buzz add命令行buzz add --task transcribe --model-type whispercpp --model-size small \ --prompt 录音中常出现 AlphaGo 这个词 --srt --vtt interview.mp3加--hide-gui可隐藏主窗口后台运行完整参数说明见 docs/docs/cli.md。整目录批处理可以写个循环for f in *.mp3; do buzz add --hide-gui $f; done偏好在 Folder Watch 选项卡里还能设监控目录放入的音频自动排队转录配合跳过插件就不会重复跑。⚡ 速度不够时先做这 3 件事换小一号的模型或改用 Whisper.cpp 后端显存紧张时选q_5这类量化版本。设置环境变量BUZZ_WHISPERCPP_N_THREADS调线程数16 线程笔记本设为8约有 15% 提速设得再高反而变慢。老显卡比 CPU 还慢或有兼容问题设BUZZ_FORCE_CPUtrue强制 CPU显存不够用BUZZ_REDUCE_GPU_MEMORYtrue做 8bit 量化。另外注意Buzz 要求 CPU 支持 AVX2非常老的机器跑不起来。下一步行动按你的系统装好 Buzz挑一段短音频完成第一次转录。下载与硬件匹配的模型试一次实时录音并打开演示窗口。文件量大时把 CLI 循环命令和文件夹监控配好让机器自己跑。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考