ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Buzz 离线语音识别实战:三步从录音到文字稿

2026/9/7 15:34:52 拓冰建站 浏览量
Buzz 离线语音识别实战:三步从录音到文字稿 Buzz 离线语音识别实战三步从录音到文字稿【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz周五下午三点一段 40 分钟的访谈录音躺在桌面上明天上午十点要交文字稿。你把文件拖进Buzz——这是一款离线语音识别桌面应用语音转文字全程在本机推理音频不经过任何外部服务。这篇上手文章按真实操作顺序讲装、导入、出稿、导出。数据去哪了离线语音识别到底离在哪把音频交给云端服务它要先上传、再排队、再推理、再回传整条链路都压在网络和别人的机器上。Buzz 的路径不同模型文件先下载到你的电脑之后音频由本地进程读入、切块、逐段推理结果直接写回本地文件。本质上这是一次 Whisper 本地部署转录阶段没有任何出站请求。唯一必须联网的环节是第一次取模型。选定模型尺寸后会有下载进度下完缓存在本机断网照样能跑转录。我们测试时关着 WiFi 跑 base 模型一切正常。从下载到第一段文字本地语音转文字全流程四种 Buzz 安装方式各一句话带过。Windows 用户从 SourceForge 拿安装包应用未签名会弹拦截点更多信息再仍要运行。macOS 下载 .dmg把图标拖进 Applications 即可。Linux 有两条路flatpak install flathub io.github.chidiwilliams.Buzz sudo snap install buzzPython 方向适合习惯命令行的人先装好 ffmpeg再用 Python 3.12 环境pip install buzz-captions python -m buzz装完第一次打开按 File 菜单里的 Import Media File或 CtrlO选一个音频文件。表单里任务默认 Transcribe语言可以先留空让它自动检测模型先选 base点 Run。任务列表里出现一行进度条从 0 爬起状态变成 Completed 后双击这一行第一段转录文字就出现在眼前。这条 Buzz 使用教程的主线到此走通剩下的都是围绕它的展开。跟着一段 40 分钟会议录音走完全流程导入界面里把导出格式从默认的 TXT 改成 SRT语言直接填 zh模型保持 base。点 Run 回到主界面任务列表里这一行开始滚动百分比文件、模型、状态各占一栏。模型选择藏在导入表单的下拉框里也可以进偏好设置统一改默认值后端可选 whisper、whisper.cpp 等尺寸从 tiny 到 large 排开。想改底层行为的话转录引擎实现在 buzz/transcriber/。等待时间取决于硬件。我们测试时 base 模型在普通 CPU 上处理 40 分钟音频花了十几分钟换 tiny 能压到一半以内代价是专有名词更容易听错。进度条走完状态列变成 Completed。双击列表行转录查看器打开片段表格每行带起止时间戳点哪行音频就跳到哪里文字单元格可以直接改播放器还能调速核对细节很方便。查看器代码在 buzz/widgets/transcription_viewer/。导出前先看字幕长度。点 Resize 弹出调整面板设每条字幕的最大长度如果导入时勾了词级时间戳还能按标点拆分、按静音位置合并。离线字幕生成到这一步基本定型。最后点导出SRT文件落在你设定的输出目录丢给剪辑软件就能直接用。到这里一次完整的会议录音转文字收尾导入、出稿、改字、调字幕、导出全程没有一步走网络。模型怎么选一张表说清模型大小速度准确率适合场景Tiny最小最快基础实时转录、低配机器Base较小快良好日常会议、快速出稿Medium中等中等优秀专业转录、正式稿件Large最大较慢最高关键录音、深度研究拿不准就先跑 Base日常够用稿子要当证据用再上MediumLarge 留给非跑不可的场合。进阶批量、自动跑、命令行如果你要一次处理一批文件导入时多选即可任务列表里各跑各的互不阻塞。如果你不想每次都手动点 Run去偏好设置打开文件夹监视把录音落盘目录指给它新文件出现就自动入队转录设置界面长这样。如果你在写脚本或挂定时任务CLI 是另一条入口常用写法buzz add --model-type whispercpp --model-size base --language zh --srt meeting.mp4命令定义在 buzz/cli.py参数和 GUI 一一对应。如果你要区分谁说了什么转录查看器里有 Identify speakers 按钮识别完可以把同一人的句子合并、把自动标签改成真名。AI 摘要、自动调整字幕、DOCX 导出这类则属于插件放在 buzz/plugins/在插件对话框里按需启用。容易踩的几个坑Windows 安装包未签名安装时点更多信息→仍要运行否则装不上。首次用到某个模型尺寸要联网下载一次base 只有一百多 MBlarge 有好几个 GB别一上来就点 Large。两小时以上的录音建议先切段整段跑既慢又吃内存中途断电等于白跑。语言尽量手动指定自动检测偶尔跑偏官方文档也建议直接选语言。PyPI 方式装的版本要先装好 ffmpeg并且用 Python 3.12其他版本容易在依赖上翻车。明天要交的那份稿子现在就能开始把 40 分钟的录音丢进 Buzz模型选 Base语言填 zh导出 SRT。跑完顺手点一下 Resize把过长的字幕行拆开。初稿到手后过一遍人名和术语剩下的就是排版的事了。更多细节在官方文档里。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考