ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Buzz 离线转录实战指南:从第一条录音到 SRT 字幕文件

2026/9/6 15:40:51 拓冰建站 浏览量
Buzz 离线转录实战指南:从第一条录音到 SRT 字幕文件 Buzz 离线转录实战指南从第一条录音到 SRT 字幕文件【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款开源的离线语音转文字工具基于 OpenAI Whisper 在个人电脑上本地完成音频转录与翻译适合不想把录音上传云端、需要免费语音转文字和离线字幕生成的人。全文按真实任务组织先跑通第一次转录再讲清模型与硬件的取舍然后覆盖视频字幕、会议实时记录和整批文件处理每一步都给出可直接照做的设置。 转录第一条录音安装 Buzz 并跑通首次离线转录第一次使用建议按下面的顺序完成大约三分钟。安装方式按系统选择macOS: 下载 .dmg 安装支持 Intel 与 Apple SiliconWindows: 下载安装程序首次运行遇警告时点更多信息→仍要运行Linux: 使用 Flatpak 或 Snap 安装源码/脚本场景:pip install buzz-captions后运行python -m buzz如果习惯命令行环境安装命令如下pip install buzz-captions python -m buzz导入并转录一个文件的工作流点工具栏图标或按 CtrlO 导入音频/视频文件选择任务转录或翻译与模型明确指定语言不建议依赖自动检测点运行等待状态变为已完成双击任务行打开转录结果 模型选型按硬件平衡速度、精度与内存Whisper 模型从 tiny 到 large 是典型的速度—精度—内存取舍选错模型是转录慢的第一原因Tiny约 75MB: 速度最快基础精度适合实时转录Base约 142MB: 速度较快精度良好适合日常使用Small约 466MB: 速度中等精度优秀适合专业转录Medium约 1.5GB: 速度较慢精度高适合高精度需求Large约 3.1GB: 速度最慢精度最佳适合专业级应用硬件加速按你的设备选择Nvidia 显卡: 选择 Whisper / Faster Whisper 后端启用 CUDA 加速Apple Silicon: 使用 Mac 原生加速路径核显/多数独立显卡: 选择 Whisper.cpp 后端走 Vulkan 加速纯 CPU 设备: 选 Whisper.cpp线程数默认为核心数的一半两个值得调的进阶项通过环境变量设置详见文档目录内存吃紧: 选 Whisper.cpp 的 q_5 等量化版本或开启 GPU 内存压缩CPU 转录偏慢: 调整BUZZ_WHISPERCPP_N_THREADS一般不超过核心数一半模型在偏好设置 → 模型页统一下载和删除首次使用某个模型会自动提示下载。 为视频生成 SRT 字幕逐词时间戳与字幕重排Buzz 导出字幕分三种格式TXT纯文本、SRT 与 VTT带时间轴。制作字幕的关键是先在转录表单里开启逐词时间戳否则后续无法按句子智能重排。字幕制作流程导入视频文件MP4 等视频格式同样支持任务表单里开启逐词时间戳明确指定语言完成后打开转录点Resize进行字幕重排设置字幕最大长度、是否按标点断句可再延长显示时长导出 SRT 或 VTT 文件直接用于剪辑软件重排时如果源音频还在本机工具会分析静音点来优化断句位置。两个提升准确率的小技巧初始提示词: 在高级设置里填入人名、术语减少专有名词误拼语音提取: 开启Extract speech可先把人声分离出来再转录适合嘈杂录音 会议实时转录麦克风录音与演示窗口Buzz 除了处理文件也支持从麦克风实时转录适合会议、访谈、讲座现场。录音开始后文字会持续生成并可以同步翻译成其他语言。实时模式的三个要点追加位置: 可选新句子加在底部、顶部或追加并纠错模式演示窗口: 全屏展示转录文字方便观众跟随也支持无障碍场景实时导出: 开启后文字边生成边写入 TXT 文件可接入其他应用注意追加并纠错模式会回改上一句的识别结果对硬件要求更高设备一般时选前两种模式。硬件不够时把模型换成 Tiny 或 Base 也能保证流畅度。️ 批量转录文件夹监控与命令行脚本处理整个音频文件夹有两种方式。图形界面里在偏好设置中开启文件夹监控指定目录后新放入的音频会自动排队转录配合跳过已转录插件重复导入同一批文件不会重跑模型。脚本和自动化场景则用命令行。一条命令即可完成转录并导出字幕buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt audio.mp3常用参数-l: 指定语言代码如en、zh-p: 附加初始提示词-t: 指定任务transcribe或translate--txt/--srt/--vtt: 指定导出格式后处理方面Buzz 内置插件帮助 → 插件 中管理能补齐流程缺口AI 摘要接 OpenAI 兼容 API 生成会议纪要、导出 DOCX、转录后自动字幕重排、DeepFilterNet 降噪预处理等。插件可拖拽调整执行顺序也可以按自己的需求开发。建议从你手头最典型的一个任务开始先把一条真实录音完整跑通转录 → 查看 → 导出再按硬件情况把模型调到位最后才上文件夹监控和命令行批量处理。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考