GigaSpeech数据集结构全揭秘:从音频源到元数据,新手入门必看指南 GigaSpeech数据集结构全揭秘从音频源到元数据新手入门必看指南【免费下载链接】GigaSpeechLarge, modern dataset for speech recognition项目地址: https://gitcode.com/gh_mirrors/gi/GigaSpeechGigaSpeech是一个大型现代语音识别数据集包含10,000小时高质量人工转录音频和33,000多小时用于无监督/半监督学习的音频为语音识别研究和应用提供了丰富的资源。 音频源组成多领域数据全景GigaSpeech的音频数据来自三个主要来源涵盖了不同的声学条件和语言使用场景音频源转录小时数总小时数声学条件Audiobook2,65511,982朗读、各种年龄和口音Podcast3,4989,254清晰或有背景音乐、室内、近场、自发式、各种年龄和口音YouTube3,84511,768清晰和嘈杂、室内和室外、近场和远场、朗读和自发式、各种年龄和口音总计10,00033,005这些多样化的音频源确保了GigaSpeech数据集在不同实际应用场景下的适用性为训练鲁棒的语音识别模型提供了坚实基础。 数据集子集划分满足不同需求GigaSpeech根据使用场景和规模需求将转录数据划分为多个子集训练子集子集小时数用途说明XS10系统构建和调试S250快速研究实验M1,000大规模研究实验L2,500中等规模工业实验XL10,000大规模工业实验较大的子集是较小子集的超集例如子集L包含子集M的所有数据这样的设计允许研究人员根据计算资源和实验需求灵活选择合适的训练数据规模。评估子集子集小时数用途说明Dev12从爬取的Podcast和YouTube数据中随机选择Test40部分从爬取的Podcast和YouTube数据中随机选择部分通过其他渠道手动收集以获得更好的覆盖范围评估子集由专业人工标注员进行标注确保了评估结果的准确性和可靠性。 元数据结构GigaSpeech.json详解GigaSpeech将所有元数据信息保存到一个名为GigaSpeech.json的JSON文件中该文件是理解和使用数据集的关键。以下是该文件的结构片段{ dataset: GigaSpeech, language: EN, version: v1.0.0, ... audios: [ { title: The Architect of Hollywood, url: https://99percentinvisible.org/episode/the-architect-of-hollywood/download, path: audio/podcast/P0001/POD0000000025.opus, ... segments: [ { sid: POD0000000025_S0000103, speaker: N/A, begin_time: 780.31, end_time: 783.13, text_tn: FOUR OCLOCK TOMORROW AFTERNOON COMMA SAID WILLIAMS PERIOD, subsets: [ {XL}, {L} ] }, ... ], ... }, ... ] }要使用语料库用户需要从GigaSpeech.json中提取相关信息。例如对于语音识别任务应首先查看audios条目获取音频文件列表。然后可以通过url条目下载原始音频文件或如果预处理的音频文件已下载到磁盘则使用path条目。之后对于每个音频文件可以查看segments条目获取可训练的音频片段及其相应的转录文本。此外还有subsets、md5等补充条目对使用数据集也很有帮助。元数据文件GigaSpeech.json受版本控制并且会随着时间更新。在未来的版本中计划在元数据文件中添加说话人信息使其适用于说话人识别/验证任务还计划添加更多来自不同来源的数据以增加多样性。 实用工具简化数据处理流程GigaSpeech提供了一些基于jq的便捷命令行工具帮助用户更轻松地处理和分析数据集utils/ls_audios.sh用于列出音频文件utils/show_segment_info.sh用于显示片段信息utils/ls_md5.sh用于列出MD5值此外还有音频和文本处理工具utils/opus_to_wav.py用于将Opus格式转换为WAV格式utils/gigaspeech_scoring.py用于WER评分这些工具简化了数据处理流程使研究人员能够更专注于模型开发和实验。 数据准备指南快速开始使用GigaSpeechGigaSpeech在仓库中维护了不同语音识别工具包的数据准备脚本以便当数据集更新时无需更新下游工具包中的脚本。不同语音识别工具包的数据准备脚本维护在toolkits/文件夹中例如Kaldi语音识别工具包的脚本在toolkits/kaldi中。要使用数据准备脚本请在工具包中执行以下步骤以Kaldi为例git clone https://gitcode.com/gh_mirrors/gi/GigaSpeech cd GigaSpeech utils/download_gigaspeech.sh /disk1/audio_data/gigaspeech toolkits/kaldi/gigaspeech_data_prep.sh --train-subset XL /disk1/audio_data/gigaspeech ../data cd ..音频处理GigaSpeech音频文件重采样为16 kHz采样率并使用Opus格式压缩。建议用户在训练和测试前将解码后的音频显式重采样为16 kHz采样率。有关Opus到WAV的转换请参考示例工具utils/opus_to_wav.py。文本预处理标点符号在规范化文本中保留了4个标点符号见GigaSpeech.json中的text_tn条目COMMA、PERIOD、QUESTIONMARK、EXCLAMATIONPOINT。这允许研究人员探索端到端端点检测和标点恢复等方向。如果不需要这些可以在训练时将其删除。垃圾话语标签Dev/Test评估集由人工标注员标注。对于非语音片段使用垃圾话语标签。建议用户在训练中丢弃这些话语。这些标签的完整列表是SIL、MUSIC、NOISE、OTHER。文本后处理评分前自发/对话语音包含对话填充词如UH、UHH、UM、EH、MM、HM、AH、HUH、HA、ER。建议用户在WER评分前从假设和参考文本中删除这些填充词以便在不同工具包之间进行公平的性能比较。通过以上指南新手用户可以快速了解GigaSpeech数据集的结构和使用方法为语音识别研究和应用奠定基础。GigaSpeech作为一个不断发展的多领域ASR语料库将持续为语音技术的进步提供支持。【免费下载链接】GigaSpeechLarge, modern dataset for speech recognition项目地址: https://gitcode.com/gh_mirrors/gi/GigaSpeech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考