ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

3步跑通本地语音识别:whisper.cpp 免费转写音频完整入门指南

2026/8/30 14:05:15 拓冰建站 浏览量
3步跑通本地语音识别:whisper.cpp 免费转写音频完整入门指南 3步跑通本地语音识别whisper.cpp 免费转写音频完整入门指南【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp想象一下一份两小时的会议录音躺在你的邮箱里而你需要找到其中被提到的一句话。whisper.cpp 语音识别项目正是为这类场景准备的它是 OpenAI Whisper 模型的 C/C 移植版在你自己的电脑上就能把音频变成文字全程离线、不花钱数据也不会离开你的机器。它的实现相当轻量没有繁重的第三方依赖普通 CPU 就能跑起来官方还提供了 Go、Java、JavaScript、Ruby 等语言的绑定想把语音转写嵌进自己的应用里随时可以动手。项目速览项目说明定位Whisper 语音识别模型的本地推理引擎C/C 实现技术栈纯 C/C内置 ggml 数学库无运行时依赖许可协议MIT可放心用于商业项目硬件要求无 GPU 也能跑Apple Silicon 与 NVIDIA 显卡可进一步提速适合人群需要离线转写的开发者、办公人员、内容创作者三步跑出第一条结果第一步把源码拿下来。git clone https://gitcode.com/GitHub_Trending/wh/whisper.cpp cd whisper.cpp这一步只是把项目完整地取到本地然后进入目录后面所有命令都在这里执行。第二步下载模型并完成编译。sh ./models/download-ggml-model.sh base.en cmake -B build cmake --build build --config Release第一行下载约 142 MiB 的 base.en 模型后两行负责编译成功后会在 build/bin 下生成 whisper-cli 等可执行文件。第三步转写一段示例音频。./build/bin/whisper-cli -m models/ggml-base.en.bin -f samples/jfk.wav把项目自带的样例录音丢进去终端就会输出带时间戳的英文文本。到这里你的第一条本地语音识别结果就跑通了它能应付哪些场景会议记录。把录音文件直接交给 whisper-cli它会输出逐句带时间戳的文字稿想翻哪句就跳哪句比反复回放原声高效得多。视频字幕。给命令加上 -osrt 参数识别结果会直接写成 SRT 字幕文件拖进剪辑软件就能用为视频批量补字幕的活儿一下子就轻松了。更多命令行玩法可以看 examples/cli/ 里的源码。️实时转录。仓库里的 whisper-stream 工具每 500 毫秒采一次麦克风并持续转写相当于随身带了一台直播字幕机试试这条命令感受一下./build/bin/whisper-stream -m models/ggml-base.en.bin -t 8。另外还有一个离线语音助手示例 whisper-command对着麦克风喊预设指令就能控制设备。模型与参数怎么选你的目标建议要快tiny磁盘仅 75 MiB速度最快日常通用推荐base.en速度和准确率比较均衡要准small466 MiB或 medium1.5 GiB主要是中文选不带 .en 的多语言模型并用 -l zh 指定语言内存不够换 -q5_0 量化模型体积更小精度损失很小记住还有一个常用参数-t 设置线程数填成 CPU 的物理核心数通常最合适比如 -t 8。各平台一句话说明Windows用 MSYS2 或 MinGW 环境构建即可官方也持续在维护构建流程。macOSApple Silicon 上默认走 Metal 跑 GPU开箱体验最好。Linux最省心装好 CMake 和编译器就能开工。避坑指南当编译时提示缺少依赖。实时转录和语音助手两个示例依赖 SDL2装上它再重新构建就行Debian 系系统安装 libsdl2-dev 并在 CMake 时加上 -DWHISPER_SDL2ON 即可。当直接丢 mp3 进去报错。whisper-cli 只认 16 位 WAV 文件先用 ffmpeg 转一下格式再跑ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav当识别结果不准。先换更大的模型试试中文录音记得用 -l zh 指定语言。如果原录音本身底噪大、人声模糊再大的模型也救不回来优先换一段干净的音频。当模型下载慢或失败。检查一下网络也可以手动把对应的 ggml 文件放进 models/ 目录注意文件名要和 -m 参数传的一致全部模型清单见 models/README.md。当运行速度不及预期。可以换更小的模型或用量化版本树莓派之类的轻量设备tiny 是最稳妥的选择。⚠️ 最后想说的是语音识别这件事whisper.cpp 把它免费、离线、可控地交到了你手里。现在就跑起来把那堆长录音变成可以搜索的文字吧。【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考