ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Cryfish: On deep audio analysis with Large Language Models

2026/8/27 13:18:50 拓冰建站 浏览量
Cryfish: On deep audio analysis with Large Language Models 论文《Cryfish: On deep audio analysis with Large Language Models》总结与翻译一、论文主要内容总结(一)研究背景与问题近年来,基于文本的大型语言模型(LLMs)发展迅猛,但将听觉能力整合到LLMs中仍面临挑战,现有具备听觉能力的LLMs(AudioLLMs)在不同音频相关任务间的泛化能力有限,在非训练分布的任务上性能大幅下降。为解决这一问题,研究团队提出了Cryfish模型,旨在提升AudioLLM在各类音频任务中的泛化能力。(二)模型架构Cryfish以SALMONN为灵感,采用“WavLM音频编码器+基于Transformer的连接器+Qwen2 LLM”的架构。其中,WavLM作为自监督训练的通用音频编码器,能提供丰富的音频表征,适配多种任务;Transformer连接器可提取句子级和帧级嵌入(帧级嵌入提取速率为2.5Hz),有效衔接音频特征与语言模型;Qwen2.5-7B-Instruct作为语言模型,负责处理文本指令与生成响应。整体架构中,连接器和WavLM共含345M参数,语言模型适配器含21M参数。(三)训练数据与流程训练数据准备:采用“模板指令+LLM生成指令”的双阶段数据构建方式。模板指令数据量达13k小时音频,涵盖语音转录、性别识别等任务,还通