ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Canary vs Canary-Qwen:transcribe.cpp 两大 NVIDIA 模型家族完整横向对比指南

2026/9/18 22:56:41 拓冰建站 浏览量
Canary vs Canary-Qwen:transcribe.cpp 两大 NVIDIA 模型家族完整横向对比指南 Canary vs Canary-Qwentranscribe.cpp 两大 NVIDIA 模型家族完整横向对比指南【免费下载链接】transcribe.cppggml speech-to-text inference for 16 model families项目地址: https://gitcode.com/GitHub_Trending/tr/transcribe.cpptranscribe.cpp 是一个基于 ggml 的 C 语音转文字speech-to-text离线推理引擎支持 16 个模型家族。其中Canary与Canary-Qwen是 NVIDIA 出品的两大热门家族一个走编码器-解码器 多语言翻译路线一个走音频-大语言模型Audio-LLM路线。本文通过准确率、速度、体积、许可证四个维度的实测数据帮你 3 分钟选对模型 两大 Canary 家族是什么两者共享同一个FastConformer 音频编码器血统但架构走向完全不同Canary 家族Canary-Qwen 2.5B架构模式多任务 AEDFastConformer 编码器 Transformer 解码器SALM音频增强语言模型FastConformer 编码器 Qwen3-1.7B 因果语言模型工作方式编码器出特征 → 解码器逐词生成音频帧注入到 LLM 输入序列由大模型直接写出转写文本代表变体canary-1b、canary-1b-v2、canary-1b-flash、canary-180m-flashcanary-qwen-2.5b2.53B 参数支持语言4 种英/德/西/法或25 种欧洲语言仅英语附加能力✅ 支持语音翻译如英语音频 → 德语文本❌ 仅 ASR无翻译输入上限约6.7 分钟/次约54 分钟/次许可证原版 1B 为 CC-BY-NC-4.0非商用v2/flash 为 CC-BY-4.0CC-BY-4.0可商用一个有趣的血缘关系Canary-Qwen 的编码器逐字节初始化自canary-1b-flash的 FastConformer相当于把 1B Flash 的耳朵接上了 Qwen3 大模型的嘴。准确率对比WER 越低越好 在 LibriSpeech test-clean2620 条英文语音上的词错率WERQ8_0 量化档位模型参数量WER (Q8_0)Q8_0 体积canary-1b1B1.55%1.16 GBcanary-1b-flash890M1.62%1.05 GBcanary-qwen-2.5b2.53B1.63%2.80 GBcanary-1b-v2980M1.91%1.14 GBcanary-180m-flash189M1.93%218 MB几个值得注意的结论单看英文转写原版canary-1b反而比 2.5B 的 Canary-Qwen 略优1.55% vs 1.63%且文件小一半多Canary-Qwen 的六个量化档位BF16 → Q4_K_MWER全部稳定在 1.63%量化几乎零损失多语言场景如德语、西语只能选 Canary 家族——FLEURS 测试中canary-1b德语 WER 6.45%、法语 7.44%。完整量化矩阵与逐语言数据见 catalog/canary-1b.json 和 catalog/canary-qwen-2.5b.json。速度对比谁更快⚡以 jfk.wav11 秒语音、Q8_0 量化、3 次迭代平均的实测延迟机器 / 后端canary-1bcanary-1b-v2canary-qwen-2.5bApple M4 Max · Metal207 ms51.7× 实时105 ms104.7× 实时229 ms48.1× 实时Apple M4 Max · CPU426 ms415 ms1015 msAMD Ryzen 7 4750U · CPU1395 ms1150 ms3871 ms规律很清晰同平台下Canary 家族比 Canary-Qwen 快约 2 倍——解码端只是一个小 Transformer而 Canary-Qwen 每步都要跑完整的 Qwen3 LLM即便是 2.5B 的 Canary-Qwen在 M4 Max 上处理 11 秒音频也只要 0.23 秒离线场景绰绰有余追求极限低延迟选canary-1b-v28 层浅解码器追求小体积跑在树莓派级别设备选 218 MB 的canary-180m-flash。如何选择一张决策表 你的需求推荐模型多语言25 种欧洲语言转写canary-1b-v2英/德/西/法 四语 语音翻译canary-1b-flash商用英文转写、单次输入可能超 10 分钟canary-qwen-2.5bCC-BY-4.0 可商用极致英文准确率 小体积canary-1b注意非商用许可证边缘设备 / 内存受限canary-180m-flash⚠️ 两个家族共同的限制均不支持实时流式、说话人分离、自动语言检测Canary 需显式传-l语言码。快速上手3 条命令跑通git clone https://gitcode.com/GitHub_Trending/tr/transcribe.cpp cd transcribe.cpp cmake -B build cmake --build build仓库不附带模型文件从handy-computer/variant-gguf对应的发布仓库下载 GGUF 后# Canary可加 -l de 切德语或 --task translate 做翻译 build/bin/transcribe-cli -m models/canary-1b-flash/canary-1b-flash-Q8_0.gguf samples/jfk.wav # Canary-Qwen英语 build/bin/transcribe-cli -m models/canary-qwen-2.5b/canary-qwen-2.5b-Q8_0.gguf samples/jfk.wav音频需先转为 16 kHz 单声道 WAVffmpeg -i input.mp3 -ar 16000 -ac 1 output.wav延伸阅读与源码路径家族总览docs/models/canary.mdCanary-Qwen 模型卡含下载与性能表docs/models/canary-qwen-2.5b.md各变体文档docs/models/canary-1b.md、docs/models/canary-1b-v2.md、docs/models/canary-1b-flash.md、docs/models/canary-180m-flash.md架构移植与 SALM 音频注入细节docs/porting/families/canary_qwen.mdC 架构实现src/arch/canary/ 与 src/arch/canary_qwen/模型转换脚本scripts/convert-canary.py、scripts/convert-canary-qwen.py数值验证容差配置tests/tolerances/canary_qwen.json一句话总结要多语言 翻译选Canary要可商用的纯英文长音频转写选Canary-Qwen——两个家族都能在离线场景以远超实时的速度交付接近人类水平的转写结果 ✅【免费下载链接】transcribe.cppggml speech-to-text inference for 16 model families项目地址: https://gitcode.com/GitHub_Trending/tr/transcribe.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考