ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Nemotron-3-Diarization训练内幕揭秘:8节点A100与9万小时数据如何炼成实时说话人分离模型

2026/9/25 22:12:05 拓冰建站 浏览量
Nemotron-3-Diarization训练内幕揭秘:8节点A100与9万小时数据如何炼成实时说话人分离模型 Nemotron-3-Diarization训练内幕揭秘8节点A100与9万小时数据如何炼成实时说话人分离模型【免费下载链接】Nemotron-3-Diarization项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/Nemotron-3-DiarizationNemotron-3-Diarization是 NVIDIA 发布的开源权重说话人分离Speaker Diarization模型它回答的是音频里的核心问题谁在什么时间说了话。这篇文章带你揭秘它的训练内幕约9.3 万小时的多说话人数据如何配伍、8 节点 × 8 卡 A100集群上的两阶段训练流程以及它如何把实时说话人分离延迟压到0.32 秒。 一分钟看懂这个模型能做什么说话人分离speaker diarization不是识别这个人是谁而是判断一段音频中哪个说话人在哪段时间活跃输出形如[speaker1, 0.51s, 12.62s]的带时间戳标签。Nemotron-3-Diarization 的几个关键规格项目参数模型规模1 亿参数100M架构31 层 Transformer 编码器 RoPE 旋转位置编码支持说话人最多 8 人推理模式流式 离线双模式输入缓冲延迟0.32 s 30.4 s 可配置理论下限 80 ms输入格式16 kHz 单声道 wav / flac / opus / mp3商用授权OpenMDW 1.1可商用 数据配方9 万小时训练数据是这样配出来的这是训练内幕中最值得细看的部分——数据分为三大块详见 README.md第一块约 10,000 小时真实多说话人对话模型见过的真实场景非常多样覆盖 14 个数据源会议场景AMI、ICSI、AliMeeting中文、NOTSOFAR13–7 人会议电话场景Fisher 英语语料、NIST CALLHOME多语言场景AISHELL-4中文、DISPLACE 2024/2026印地语、卡纳达语等、DIHARD 挑战赛补充语料David AI 多说话人1,000 小时、YODAS-v25,000 小时伪标签数据第二块约 28,000 小时单说话人原料音频包括 LibriSpeech、AMI / AliMeeting 单人耳机轨、Fisher以及 David AI 的播客、闲聊、专家问答等系列覆盖 21 种语言外加 MUSAN 噪声用于数据增强。第三块用 FastMSS 工具包合成出 82,611 小时多人混音这是数据量最大的来源——把上面的单说话人音频用FastMSS工具模拟混合成 1–8 人的虚拟会议合成数据源时长小时David AI 英语36,458David AI 多语言19,216Fisher 英语6,755AliMeeting6,745AMI6,743LibriSpeech6,694启示真实多人对话数据极其昂贵且稀缺真实对话打底 大规模合成混音扩充已成为工业级说话人分离模型的主流数据配方。 训练流程揭秘8 节点 A100 上的两阶段训练模型初始化自 Transformer 架构的NEST 自监督预训练检查点随后在8 节点 × 8 张 NVIDIA A100-SXM4-80GB集群上分两个阶段完成见 README.md第一阶段离线预训练只用合成数据输入缓冲 30.4 秒的离线模式在 82,000 小时合成混音上学习区分多个说话人的基本能力使用 NeMo 的sortformer_diar_train.py脚本与sortformer_offline_8spk.yaml配置第二阶段流式微调真实 合成混合切换为streaming_sortformer_diar_train.py流式训练脚本用1 万小时真实对话 合成混音让模型学会分块在线处理音频学会维护 AOSC按到达顺序的说话人缓存与 FIFO 队列状态两阶段的分工很清晰先让模型听懂多人混音再让它学会边听边输出。⚙️ 架构内幕0.32 秒延迟是怎么做到的模型结构详见 explainability.md10 ms 分辨率的 Mel 频谱经 8 倍特征堆叠压缩为80 ms 帧率的编码器输入31 层 Transformer 编码器逐帧预测 8 个说话人的活跃概率顶部一个Conv1D 上采样层把预测还原到 10 ms 输出分辨率流式推理时AOSC 缓存保留早前片段中的说话人身份FIFO 队列提供近期帧上下文输出按说话人首次出现顺序排列通道Sortformer 的到达序机制天然解决了说话人编号乱序这个经典难题。通过调节分块参数同一检查点可覆盖从 0.32 秒超低延迟到 30.4 秒离线模式的全部档位配置延迟适用场景超低延迟0.32 s实时通话、直播低延迟1.04 s实时会议转写离线模式30.4 s离线处理、最高精度 效果对比比上代模型强多少在 DIHARD III 等 7 大基准上评测协议见 diarization_evaluation.md与上一代 4 人流式模型对比DER 越低越好基准测试上代模型 (30.4s)Nemotron-3 (30.4s)Nemotron-3 (0.32s)DIHARD III全量19.0912.7313.55CALLHOME 电话10.329.1011.32AliMeeting 远场13.6910.4711.60AMI 单通道远场21.4211.1412.95NOTSOFAR1 单通道30.4911.0014.53亮点5–9 人会议最难场景的 DIHARD DER 从 40.21 降到 27.58在 0.32 秒超低延迟下精度仅小幅回退。推理速度方面单卡 batch32 编译加速后实时加速比RTFx最高达15,113 倍。 上手体验快速跑一次说话人分离安装 NVIDIA NeMo Speech 框架后下载检查点 Nemotron-3-Diarization.nemo 即可加载推理from nemo.collections.asr.models import SortformerEncLabelModel diar_model SortformerEncLabelModel.from_pretrained(nvidia/Nemotron-3-Diarization)随后调用diar_model.diarize(audioyour_audio.wav)即可得到起始秒, 结束秒, 说话人编号的分离结果流式参数配置与 8 人 TTS 演示音频nemotron3_tts_8_open_voices.mp4都列在 README.md 中。若要与流式 ASR 组合生成谁说了什么的完整转写可参考 ASR_INTEGRATION_GUIDE.md。 总结Nemotron-3-Diarization 的炼成配方可以浓缩为三句话数据1 万小时真实对话 FastMSS 合成的 8.2 万小时多人混音多语言覆盖训练NEST 自监督初始化 → 离线预训练 → 流式微调全程 8 节点 A100 集群工程AOSC FIFO 缓存机制让一个 100M 参数的小模型在 0.32 秒延迟下仍保持高精度如果你想在自己的项目里做实时会议转写、通话分析或多说话人录音整理这个开源模型OpenMDW 1.1 授权、可商用是目前值得优先考虑的实时说话人分离方案之一。【免费下载链接】Nemotron-3-Diarization项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/Nemotron-3-Diarization创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考