ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

一条命令装好 DeepSpeed:Windows 原生安装与验证速成指南

2026/8/31 14:00:15 拓冰建站 浏览量
一条命令装好 DeepSpeed:Windows 原生安装与验证速成指南 一条命令装好 DeepSpeedWindows 原生安装与验证速成指南【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed从 0.14.5 起DeepSpeed一个让分布式训练与推理变得更简单的深度学习优化库可以在 Windows 上原生安装运行不再绕道 WSL。pip 装完即用算子已预编译。读完本文你能在 Windows 上装好它、完成验证并跑通训练与推理两个最小示例。环境速查开装前花 30 秒对照先确认系统满足下表要求再开始安装。对照一次能省去后面大部分折腾。项目要求参考 / 推荐配置操作系统Windows 11 Version 23H2 及以上官方验证环境Windows 11 23H2Build 22631.3880Python3.x任意受支持的 3.x 版本PyTorch带 CUDA 支持官方验证环境PyTorch 2.3.0GPUNVIDIA 单卡即可官方验证环境RTX A20004GB 显存配套库按需微调 / 推理示例需 HuggingFace Transformers验证版本 4.41.2最短路径安装pip 一条命令pip 通道是最省事的选择Windows 包已预编译全部算子。执行pip install deepspeed即可下载带预编译算子的 Windows wheel 包。无需 CUDA SDK也无需 C 编译器。安装结束看到Successfully installed deepspeed-0.14.5字样即可确认装上了。其他安装方式源码构建需要最新代码或自定义算子时才走源码构建。执行git clone https://gitcode.com/GitHub_Trending/de/DeepSpeed并进入目录即可拿到完整源码。执行build_win.bat即可在dist文件夹生成 wheel 文件。脚本会先关闭稀疏注意力等 Windows 下不编译的算子开关再运行python -m build。执行pip install dist\生成的wheel名.whl即可安装自己构建的版本。安装验证ds_report 一眼看懂状态装完别急着跑模型先用一条命令确认状态。执行ds_report即可打印完整的 C/CUDA 算子与环境报告。预期输出分两块前半部分逐行列出算子状态YES表示已预编译NO表示未预编译、可在运行时按需 JIT 编译后半部分列出 torch 版本、CUDA 版本、DeepSpeed 版本与编译环境。只要版本信息与你的 PyTorch 对得上环境就算就绪。最小示例跑通一训一推各选一个示例脚本来自官方 DeepSpeedExamples 仓库先克隆它再按下面的命令跑。两个示例分别覆盖训练和推理两类最常用场景。训练CIFAR-10 图像分类执行deepspeed cifar10_deepspeed.py --deepspeed即可在 Windows 上完成一次完整的预训练。跑完会打印验证集10000 张图整体准确率以及 plane、car、bird 等每个类别的准确率。推理ZeRO-Inference 跑 Llama-2-7BZeRO-Inference 是 DeepSpeed 的推理方案能把模型权重卸载到 CPU 内存让小显存设备也装得下大模型。执行deepspeed run_model.py --model meta-llama/Llama-2-7b-hf --batch-size 64 --prompt-len 8 --gen-len 32 --cpu-offload即可让 4GB 显存的机器生成 Llama-2-7B 的 32 个 token。输出包含每条生成的文本以及总延迟、吞吐量和峰值显存等指标。排错速查表遇到报错先查下表多数情况两分钟能定位。报错现象常见原因处理动作源码编译时报LNK1181: cannot open input file缺少链接所需的 C 运行时组件为 Visual Studio 2019 或更高版本安装使用 C 的桌面开发工作负载CUDA error/ 版本对不上DeepSpeed 与 PyTorch 的 CUDA 版本不一致执行python -c import torch; print(torch.version.cuda)核对 PyTorch 的 CUDA 版本必要时重装匹配的 PyTorch训练或推理时显存溢出显存装不下模型或生成工作集调小 batch size推理时加--cpu-offload如 Llama-2 示例微调时开启 offloadtriton not installed或requires torch 1.5 ~ 2.0警告triton 版本与当前 PyTorch 不匹配忽略警告即可它只影响 sparse_attn 等可选算子不阻塞主流程编译时找不到 CUDA环境变量未指向 CUDA 目录设置CUDA_PATH指向 CUDA 安装目录或直接改用 pip 预编译包跳过编译进阶与社区Windows 专项教程docs/_tutorials/advanced-install.md上手与常见问题入口docs/_tutorials/getting-started.md构建脚本 build_win.bat 里能看到 Windows 下实际启用了哪些算子开关。安装脚本源码在 op_builder/想自己改编译项可以从这里入手。遇到问题直接在仓库提交 Issue 给维护者跟进。【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考