ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Buzz 离线音频转录实战:Whisper 驱动的语音转文字指南

2026/9/10 13:39:27 拓冰建站 浏览量
Buzz 离线音频转录实战:Whisper 驱动的语音转文字指南 Buzz 离线音频转录实战Whisper 驱动的语音转文字指南【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是基于 OpenAI Whisper开源语音识别模型的离线音频转录工具在个人电脑上完成语音转文字与翻译音频文件不离开本机。本文覆盖安装、首次运行与高频工作流目标是半小时内跑通核心功能。项目定位与适用场景Buzz 解决的核心问题是把本地音视频转成文字同时不向任何云端上传数据。与在线转录服务相比它把全部计算放在本地硬件上与纯命令行方案相比它提供了完整的图形界面、任务队列和结果编辑器。适合的场景不太适合的场景不能外发的敏感音频会议、采访依赖远程 API 毫秒级响应的业务批量生成视频字幕与会议文稿无 AVX2 指令集支持的超老硬件内网、野外等完全离线环境多人同时编辑同一份转录结果从安装到第一次成功运行环境检查清单CPU 需支持 AVX2 指令集过老的处理器无法运行。通过 PyPI 安装时需要 Python 3.12 及以上版本以及系统级 ffmpeg。内存建议 8GB 以上GPU 可选但能明显提速。macOS 同时支持 Intel 与 Apple Silicon 机型。分平台安装步骤Windows从官方发布渠道SourceForge下载安装包程序未签名安装时选择“更多信息 → 仍要运行”。macOS下载 .dmg 文件后双击安装。LinuxFlatpakflatpak install flathub io.github.chidiwilliams.BuzzLinuxSnapsudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzzPyPIpip install buzz-captions之后用python -m buzz启动。三步跑通第一次转录菜单 File → Import Media File或 CtrlO导入一段音频或视频。在导入表单中设置任务Transcribe、语言建议显式选择而非自动检测和模型首次使用会先下载模型。选择导出格式 TXT/SRT/VTT点击 Run等待状态变为 Completed。双击任务行打开转录查看器即可试听、搜索并导出结果。 功能全景输入 → 处理 → 输出输入侧格式、来源与实时录音支持 ffmpeg 可解码的音视频如 mp3、mp4、wav、m4a、flac。支持粘贴 YouTube 等 URL 直接导入1.2.0 起。麦克风实时录音并附带演示窗口适合演讲时投屏显示。文件夹监控Folder Watch可让新文件落盘后自动进入任务队列。处理侧模型后端与硬件加速四种本地后端Whisper原版精确但吃内存、Faster WhisperNVIDIA 显卡 6GB 显存以上推荐、Whisper.cppC 实现任意 GPU 或纯 CPUMac 首选、HuggingFace支持 MMS 等 1000 多种语言的模型。也可在偏好中配置 OpenAI 兼容 API把计算放到远端。加速路径CUDANVIDIA、Apple Silicon、Vulkan可走核显。可选前处理说话人分离用于多人对话提准确率说话人识别在结果中标注发言人。输出侧导出格式与命名模板支持导出 TXT、SRT、VTT两种常见字幕格式查看器菜单还可导出 JSON。导出文件名支持模板变量input_file_name、task、language、model_type、model_size、date_time详见 docs/docs/preferences.md。开启 Word-Level Timings 后生成词级时间戳再配合字幕重排工具整理段落。两个高频工作流工作流一录音 → 纪要 → 归档选择语言与较小模型点击 Record 开始实时转录。打开 Presentation Window把实时文字投到大屏。结束后在转录查看器中修正专有名词。按统一命名模板导出 TXT 到归档目录。提示实时模式建议用 Whisper.cpp 加 base/small 模型“Append and correct”会回改上一句、对算力要求更高普通会议用追加模式即可。工作流二视频 → 字幕 → 导出 导入 MP4 并勾选 Word-Level Timings。用 medium 模型转录完成后打开结果。点击工具栏 Resize按间隔合并、按标点分割重排字幕。导出 SRT 或 VTT。提示在偏好中把默认导出文件名设为{{ input_file_name }}.srt批量任务可保持命名一致。⚙️ 性能与质量调优模型选择对照表场景推荐配置资源占用效果快速草稿 / 实时录音Whisper.cpp base 或 smallCPU 或核显即可速度快准确率够用日常会议文稿Whisper.cpp 或 Faster Whisper medium约 3GB 内存或 6GB 显存速度与准确率平衡专业存档Faster Whisper Large-V38GB 以上内存、6GB 以上显存准确率最高纯 CPU 环境Whisper.cpp q_5 量化模型8GB 内存量化省内存速度看 CPU硬件适配要点NVIDIA 显卡Linux 需装好 CUDA 12、cuBLAS、cuDNN 才能启用加速Windows 安装包已自带 CUDA 支持。无 NVIDIA 或 Mac选 Whisper.cpp走 Vulkan 或 Apple Silicon 路径。线程数可用环境变量BUZZ_WHISPERCPP_N_THREADS调整默认取核心数的一半。常见问题速查现象原因处理启动或转录时崩溃模型下载不完整在偏好 → Models 中删除后重新下载录音报错 PaErrorCode-9999系统隐私设置拦截麦克风在系统设置中允许 Buzz 使用麦克风转录速度慢模型过大或未用上 GPU换小模型、启用 GPU 或改用量化模型GPU 未生效缺少 CUDA 12安装 CUDA 12或改用 Whisper.cpp离线机器无法下载模型机器没有网络从在线机器复制模型缓存目录或用scripts/download-models.py预置平台补充Linux确认已安装libportaudio2、gettext、ffmpeg缺库时录音与导出会失败。Windows安装包未签名属正常现象GPU 加速依赖 CUDA 12旧版驱动会自动回落到 CPU。 自动化与扩展能力命令行批量转录命令行与 GUI 共享同一任务系统完整参数见 docs/docs/cli.mdbuzz add -m whispercpp -s small -l zh --srt --vtt ./meeting.mp4 buzz add --task translate -l fr -m whispercpp --txt ./interview.mp3插件机制插件1.4.5 起在 Help → Plugins 中开关、排序和配置典型内置插件AI Summary调用 OpenAI 兼容 API 为长转录生成摘要。Resize Transcript把词级结果自动重组为字幕长度分段。Skip Already Transcribed已有结果时跳过批量重导不重复计算。自研插件可参考 buzz/plugins/ 目录中的结构与钩子写法。与外部工具集成文件夹监控新文件落盘即自动开始转录适合夜间批处理。实时转录文本流可边生成边写入 txt 文件接入 OBS 等直播工具。OpenAI 兼容 APIBase URL 可指向 Ollama 等自托管服务用于摘要与翻译。 数据与隐私数据流向音频、中间结果与转录文件全部保存在本机磁盘。本地化程度除首次下载模型或可选的 API 模式外处理全程不依赖网络。离线可用模型缓存目录可整体复制到离线机器Linux 下位于~/.cache/Buzz。开源可审查MIT 协议转录与数据逻辑可逐行审查。Buzz 把导入、模型选择、转录、字幕编辑与导出收进同一个界面适合把“录音到文稿”沉淀成固定流程。可从 README.md 查看各平台安装入口再按需要扩展工作流。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考