DIAMOND架构设计哲学:为什么双Transformer设计比传统语音增强模型更有效

DIAMOND架构设计哲学:为什么双Transformer设计比传统语音增强模型更有效

【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0

DIAMOND是一款基于双Transformer架构的语音修复模型,它通过自回归RQ-Transformer处理神经音频编解码器令牌,将受损音频转换为接近 studio 级别的 44.1 kHz 语音。与传统语音增强模型不同,DIAMOND采用创新的双Transformer设计,在语音修复效果上展现出显著优势。

传统语音增强模型的局限性

传统语音增强模型往往将重点放在降噪等滤波处理上,但语音修复并非简单的降噪。当编解码器切掉 8 kHz 以上的频段、削波切掉峰值、丢失的数据包使帧归零等情况发生时,观测数据中不再包含这些丢失的内容,仅靠滤波无法恢复。此时,需要从幸存的共振峰中生成缺失的内容,这正是DIAMOND作为生成式序列到序列模型而非滤波器的原因所在。

DIAMOND双Transformer设计的创新之处

双Transformer读取机制

DIAMOND采用Two-transformer read-out设计,这一创新架构包含两个关键部分。

time-transformer负责对帧序列进行建模,它采用因果自注意力与交叉注意力机制,拥有20层、512维、8个头部,参数达到88.7M。通过对帧序列的深入建模,time-transformer能够捕捉语音在时间维度上的依赖关系,为后续的语音修复提供坚实基础。

而紧凑的depth-transformer则在每个帧内的9个RVQ码本中进行处理,它在单个帧的9个RVQ码上进行局部自回归,具有4层、384维、6个头部,参数为14.0M。这一设计恢复了RVQ的因果链,并分布了输出投影,改变了早期模型通过并行头部从单个帧向量中读取所有九个码本的方式。

从 scratch 训练的优势

DIAMOND是完全从 scratch 训练的,没有使用预训练的主干网络,其可训练参数约为166.6M。经过63 GPU小时的训练,该模型达到了最强开源修复器的水平,同时仍是同类中最佳的从 scratch 修复器。这种从零开始的训练方式使得模型能够更好地适应语音修复任务的特定需求,避免了预训练模型可能带来的偏差。

双Transformer设计为何更有效

44.1 kHz 高质量输出

冻结的DAC解码器能够合成全频段音频,8 kHz以上的嘶嘶声和“空气感”得以重新生成,而不仅仅是通过滤波传递。这得益于双Transformer对语音数据的精准建模和生成能力,使得修复后的语音在音质上有了质的飞跃。

内容测量而非假设

生成式修复器可能在听起来干净的同时模糊单词,因此除了DNSMOS指标外,针对真实转录文本的CER(字符错误率)是必不可少的第二个评估维度。DIAMOND在设计中充分考虑了这一点,通过双Transformer的协同工作,在保证语音质量的同时,尽可能地保留了语音内容的准确性。

校准的退化处理

DIAMOND的输入来自DSP增强器,其编解码器调色板是针对每个样本的真实退化语音分布进行拟合的,而不是来自随机效果的集合。这种校准的退化处理方式使得模型在面对各种复杂的语音退化情况时,都能表现出稳定且高效的修复能力,双Transformer架构则为这种复杂处理提供了强大的计算支持和模型容量。

DIAMOND的实际效果展示

在实际应用中,DIAMOND对真实的严重退化语音进行修复,使其达到44.1 kHz的高质量。在每个剪辑上,DNSMOS-P.835 OVRL都上升了整整一个点以上,即使不使用耳机也能明显听到差异。

以下是一些修复效果的数据对比:

#退化输入修复后 - 44.1 kHzDNSMOS OVRL
1example1_degraded.wavexample1_restored.wav2.16 → 3.50 (+1.34)
2example2_degraded.wavexample2_restored.wav2.83 → 3.59 (+0.76)
3example3_degraded.wavexample3_restored.wav2.56 → 3.65 (+1.10)
4example4_degraded.wavexample4_restored.wav3.32 → 3.89 (+0.57)

总结

DIAMOND的双Transformer设计,即time-transformer和depth-transformer的协同工作,为语音修复领域带来了新的突破。它通过创新的架构、从 scratch 的训练方式以及对内容和质量的双重关注,克服了传统语音增强模型的局限性,展现出更卓越的语音修复效果。无论是在音质提升还是内容保留方面,DIAMOND都证明了双Transformer设计在语音增强任务中的有效性和优越性,为语音修复技术的发展开辟了新的方向。

要获取DIAMOND模型,可通过以下仓库地址进行克隆:https://gitcode.com/hf_mirrors/nineninesix/diamond-1.0。更多详细信息可参考项目中的TECH_REPORT.pdf。

【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考