
从Common Crawl到GitHubNVIDIA-Nemotron-3.5-Lightning的20T tokens训练数据全景分析【免费下载链接】NVIDIA-Nemotron-3.5-Lightning-30B-A3B-Base-BF16项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-Base-BF16NVIDIA-Nemotron-3.5-Lightning-30B-A3B-Base-BF16是一款强大的AI模型其预训练过程使用了超过20T tokens的海量数据支持高达1M的上下文长度。本文将全面解析该模型训练数据的来源、构成及处理流程带您深入了解这一先进AI模型背后的数据基石。数据规模与核心来源Nemotron-3.5-Lightning的训练数据总量超过20T tokens主要来自两大核心渠道Common Crawl的网络数据和GitHub的代码资源。这些数据经过精心筛选、去重和处理为模型提供了丰富而高质量的学习素材。Common Crawl海量网络数据的宝库Common Crawl作为全球最大的公开网络爬虫数据资源之一为Nemotron-3.5-Lightning提供了海量的文本数据。其中Nemotron-CC-v2和v2.1版本贡献了9.1T tokens的英语网络数据包括2.5T tokens的新有机内容、翻译内容和合成改写内容。这些数据来自Common Crawl的多个快照从CC-MAIN-2013-20一直到CC-MAIN-2025-13。除了英语数据模型还使用了812.7B tokens的多语言Common Crawl数据涵盖阿拉伯语、中文、丹麦语、荷兰语、法语、德语、意大利语、日语、韩语、波兰语、葡萄牙语、俄语、西班牙语、瑞典语和泰语等15种语言。这些数据来自CC-MAIN-2024-51、CC-MAIN-2025-08和CC-MAIN-2025-18三个快照。GitHub优质代码数据的源泉GitHub作为全球最大的代码托管平台为Nemotron-3.5-Lightning提供了丰富的代码训练数据。Nemotron-Pretraining-Code-v1、v2和v3版本总共贡献了1.7T tokens的精选GitHub代码参考这些数据经过多阶段过滤、去重和大规模合成处理。GitHub数据的收集采用了GitHub REST API和Amazon S3 API并严格遵守各来源设定的速率限制。在收集原始源代码后会移除所有不包含在许可许可证集中的内容确保数据的合法性和合规性。数据处理与优化为了确保训练数据的质量和有效性Nemotron-3.5-Lightning对收集到的数据进行了一系列严格的处理和优化。数据过滤与去重对于Common Crawl数据NVIDIA团队进行了 deduplication 和 various ways 的过滤具体方法在Nemotron-CC论文中有详细描述。对于多语言数据由于缺乏可靠的基于模型的质量分类器采用了与低质量英语数据类似的启发式过滤方法。GitHub数据则经过多阶段过滤和去重确保只保留高质量的代码参考。这包括对代码质量、许可证合规性等多方面的评估和筛选。数据增强与合成除了原始数据Nemotron-3.5-Lightning还使用了大量的合成数据来增强训练效果。例如利用phi-4模型从Common Crawl生成了合成的数学数据包括73B tokens的Synthetic Rephrased Math Data from Common Crawl、52.3B tokens的Synthetic Math Data from Common Crawl 4plus和80.9B tokens的Synthetic Math Data from Common Crawl 3。在代码数据方面利用phi-4生成了427.9B tokens的Synthetic Common Crawl Code。此外还使用Qwen3-30B-A3B和Mistral-Nemo-12B-Instruct等模型生成了415.8B tokens的Synthetic Common Crawl数据以及未公开数量的Synthetic Multilingual Data from Common Crawl和Synthetic Common Crawl from Qwen3-30B-A3B数据。数据构成详解Nemotron-3.5-Lightning的训练数据由多种类型的内容组成包括文本、代码等每种类型的数据源和规模如下文本数据English Common Crawl3.36T tokens由NVIDIA Advanced Deep Learning Research于2025年4月8日提供。English Common Crawl 1.1数量未公开由NVIDIA Advanced Deep Learning Research于2025年10月2日提供。Multilingual Common Crawl812.7B tokens由NVIDIA Advanced Deep Learning Research于2025年5月1日提供。Synthetic Rephrased Math Data from Common Crawl73B tokens来源于Common Crawl使用phi-4模型生成。Synthetic Math Data from Common Crawl 4plus52.3B tokens来源于Common Crawl使用phi-4模型生成。Synthetic Math Data from Common Crawl 380.9B tokens来源于Common Crawl使用phi-4模型生成。Synthetic Common Crawl from Qwen3-30B-A3B and Mistral-Nemo-12B-Instruct415.8B tokens来源于Common Crawl使用Qwen3-30B-A3B和Mistral-NeMo-12B-Instruct模型生成。Synthetic Multilingual Data from Common Crawl from Qwen3-30B-A3B数量未公开来源于Common Crawl使用Qwen3-30B-A3B模型生成。Translated Synthetic Crawl389.9B tokens来源于Common Crawl使用Qwen3-30B-A3B模型生成。Synthetic Textbook Math from Qwen3-30B-A3B, Qwen3-235B-A22B, phi-4数量未公开来源于Common Crawl和FineMath使用Qwen3-30B-A3B、Qwen3-235B-A22B和phi-4模型生成。代码数据GitHub Crawl747.4B tokens由NVIDIA Advanced Deep Learning Research于2025年4月29日提供。GitHub Crawl 1.1172.7B tokens由NVIDIA Advanced Deep Learning Research于2025年9月30日提供。Synthetic Common Crawl Code from phi-4427.9B tokens来源于Common Crawl使用phi-4模型生成。Synthetic Code from Qwen3-32B数量未公开来源于English Common Crawl和English Common Crawl 1.1使用Qwen3-32B模型生成。总结NVIDIA-Nemotron-3.5-Lightning-30B-A3B-Base-BF16的20T tokens训练数据是一个庞大而复杂的体系涵盖了来自Common Crawl的海量网络文本和GitHub的优质代码资源。通过精心的数据筛选、去重、增强和合成处理NVIDIA为模型提供了丰富多样的学习素材为模型的强大性能奠定了坚实的基础。这些数据不仅数量庞大而且种类丰富包括多语言文本、数学数据、代码数据等使得模型能够在各种任务和场景中表现出色。同时NVIDIA在数据处理过程中严格遵守各数据源的规定和许可证要求确保了数据的合法性和合规性。如果您想深入了解Nemotron-3.5-Lightning模型可以通过以下步骤获取相关资源克隆仓库git clone https://gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-Base-BF16查看详细文档阅读项目中的LICENSE、README.md、bias.md、explainability.md、privacy.md和safety.md等文件了解模型的更多细节和注意事项。通过本文的介绍相信您对NVIDIA-Nemotron-3.5-Lightning的训练数据有了全面的了解。这些海量数据的背后是NVIDIA团队在数据收集、处理和优化方面的不懈努力正是这些努力使得Nemotron-3.5-Lightning成为当今最先进的AI模型之一。【免费下载链接】NVIDIA-Nemotron-3.5-Lightning-30B-A3B-Base-BF16项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-Base-BF16创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考