ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Sherpa-onnx v1.10.45 更新解析:FireRedASR 语音识别模型接入 12 种语言 API,这些改动值得升级

2026/9/12 12:04:38 拓冰建站 浏览量
Sherpa-onnx v1.10.45 更新解析:FireRedASR 语音识别模型接入 12 种语言 API,这些改动值得升级 Sherpa-onnx v1.10.45 更新解析FireRedASR 语音识别模型接入 12 种语言 API这些改动值得升级【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx一句话结论如果你需要在中英文混合、带口音的口语场景下跑离线识别sherpa-onnx v1.10.45 值得升级——本版本把 FireRedASR 语音识别模型AED 架构encoder/decoder 双文件提供 int8 量化 ONNX正式引入框架并在 Go 绑定和 RTF 指标计算上修掉了两处坑。只做 TTS、标点恢复或与 FireRedASR 无关的功能可暂缓。这次升级你能拿到什么FireRedASR 进入 sherpa-onnxAED 模型中英文混合场景是强项v1.10.45 的主体工作是把 FireRedASR 模型导出并集成进框架。它属于 AEDAttention-based End-to-End路线识别流程由 encoder decoder 两个 ONNX 文件驱动随包附带的模型包如sherpa-onnx-fire-red-asr-large-zh_en-2025-02-16默认给出 int8 量化版本兼顾推理速度与精度。仓库里实际可用的示例覆盖了它最常见的几种用法离线整段识别文件python-api-examples/offline-fire-red-asr-decode-files.py、c-api-examples/fire-red-asr-c-api.c基于 CTC 解码的变体适合低延迟、逐帧出字的场景python-api-examples/offline-fire-red-asr-ctc-decode-files.py、cxx-api-examples/fire-red-asr-ctc-cxx-api.cc模拟流式识别cxx-api-examples/fire-red-asr-ctc-simulate-streaming-microphone-cxx-api.ccRust 端还额外给了模拟麦克风流式的写法rust-api-examples/examples/fire_red_asr_ctc_simulate_streaming_microphone.rs测试音频里还准备了四川、天津、河南等方言样例见 Python 示例文件头部的test_wavs注释方便你直接评估口语与口音的识别表现。API 覆盖到了什么程度这次不是只补一个 C 接口而是把 FireRedASR AED 模型铺到了框架支持的主流语言上CHANGELOG 中对应的提交为 #1865#1880语言 / 平台参考位置C、Python首发python-api-examples/offline-fire-red-asr-decode-files.pyC API / CXXc-api-examples/fire-red-asr-c-api.c、cxx-api-examples/fire-red-asr-cxx-api.ccJava / KotlinAndroidjava-api-examples/NonStreamingDecodeFileFireRedAsr.javaC# / Swift / DartiOS、Flutterdotnet-examples/offline-decode-files/Program.csGo / Pascalgo-api-examples/non-streaming-decode-files/main.go、pascal-api-examples/non-streaming-asr/fire_red_asr.pasJavaScriptNode.js 与 WebAssemblynodejs-examples/test-offline-fire-red-asr.js、nodejs-addon-examples/test_asr_non_streaming_fire_red_asr.jsRustrust-api-examples/examples/fire_red_asr_ctc.rs也就是说从桌面、服务器到手机和浏览器基本都能直接调用不需要自己拼 FFI。稳定性与细节修了什么坑Go 绑定实例看似创建成功的隐患被堵上了本版本修复了一个比较隐蔽的问题#1860某些情况下 Go 端调用会返回一个看起来创建成功的实例但其底层 C 结构体实际初始化失败。后果是后续往这个半残实例上读写数据时可能触发非法内存访问且现象往往延迟到几行代码之后才暴露排查成本高。修复后创建失败会如实报错不会再把坏实例交回给你。如果你在用 Go 做服务端 ASR这条修复基本算必升项。RTF 指标计算的拼写错误被修正#1861实时因子RTF识别耗时 / 音频时长越小越快的计算里有一处拼写错误会导致跑 benchmark 时记录的指标失真。修正后你看到的 RTF 数字才可信。日常不跑性能测试的读者可以忽略这条但做模型选型、硬件对比的同学建议升完再复测一次。上手路径从 Python 脚本到目标平台下载模型模型包在项目的 release 资源asr-models 标签中Python 示例头部的 docstring 给出了wget与解压命令的完整写法解压后你会看到encoder.int8.onnx、decoder.int8.onnx、tokens.txt和一组测试 wav。跑通最小示例先执行 python-api-examples/offline-fire-red-asr-decode-files.py用sherpa_onnx.OfflineRecognizer.from_fire_red_asr(encoder..., decoder..., tokens...)三个参数即可拿到识别器整段逻辑不到 80 行。切到目标语言确定选型后直接对照上表里对应语言的示例改路径即可接口形态各语言基本一致encoder/decoder/tokens 三件套。AED 还是 CTC默认推荐 AED 整段识别精度优先、离线批处理如果你的场景要求逐帧出字或更低延迟试 CTC 变体的示例做对比两者模型文件不通用需要分别下载。选型建议FireRedASR 适合放进你的方案吗中文为主、夹杂英文词或专业术语AED 模型的zh_en包是本次主打建议优先在自有数据上验证。有口音、方言的口语输入用示例包内的方言测试 wav四川、天津、河南先听一遍实际效果再决定要不要替换现有模型。边缘设备 / 嵌入式int8 量化 ONNX 框架本身的 onnxruntime 后端适合树莓派、NPU 板卡等受限环境部署方式与 sherpa-onnx 现有模型一致。纯 TTS、VAD、标点恢复用户本版本与你无关保持现状即可。如果你已在用 sherpa-onnx升级到 v1.10.45 的收益集中在多一个可用的离线识别模型 两处修复还没接入的团队可以借这次更新直接评估 FireRedASR 是否要进入你们的识别链路。【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考