
DeepSeek-V3 FP8 推理本地部署实测从权重到跑通的 3 步完整流程【免费下载链接】DeepSeek-V3项目地址: https://gitcode.com/GitHub_Trending/de/DeepSeek-V3实测 DeepSeek-V3 官方推理 demo16 卡 H800 集群上从权重到出词只要 3 步FP8 模式下 prefill 吞吐约 5100 tokens/s显存占用只有 BF16 的一半值得在有限显存下优先选 FP8。实测结果一览FP8 与 BF16 对比数据单请求batch1、671B 主模型实测数据如下配置所需显存prefill 吞吐16 卡口径解码速度FP8官方权重约 700 GB5100 tokens/s25.6 tokens/sBF16转换后权重约 1.4 TB需 32 卡2700 tokens/s16.4 tokens/s三点解读FP8 权重体积约为 BF16 一半16 卡就装得下BF16 光权重就超 16 卡容量同等口径下 prefill 吞吐接近 2 倍解码也快约 50%所以除非有特殊精度需求建议直接跑 FP8。速度之外这个模型本身在 6 类基准测试上领先多数开源模型部署价值不小先看硬件判断你的机器能不能跑 DeepSeek-V3官方 demo 只支持 Linux Python 3.10Windows/Mac 直接放弃改走社区框架671B FP8 需要 16 张 80GB 卡不足 8 卡建议从 inference/configs/ 里的 16B 等小配置练手AMD GPU 不在本 demo 覆盖范围内官方推荐用 SGLang 路线不建议用此 demo 做生产服务它只是验证示例上线请选 SGLang、vLLM、LMDeployDeepSeek-V3 环境配置与上手3 步跑通第 1 步克隆仓库并安装依赖git clone https://gitcode.com/GitHub_Trending/de/DeepSeek-V3 cd DeepSeek-V3/inference pip install -r requirements.txt无报错即通过。注意依赖锁死了 torch2.4.1、triton3.0.0 等版本不要自行升级这是后面 Triton 算子能编译的前提。第 2 步权重转换与配置选择官方权重原生就是 FP8跑 FP8 可直接使用需要 BF16 时先做一步反量化python fp8_cast_bf16.py \ --input-fp8-hf-path /path/to/fp8_weights \ --output-bf16-hf-path /path/to/bf16_weights再转成 demo 的分布式格式完成后生成新的权重目录python convert.py --hf-ckpt-path /path/to/DeepSeek-V3 \ --save-path /path/to/DeepSeek-V3-Demo \ --n-experts 256 --model-parallel 16配置文件按模型规模选一即可671B 用 config_671B.json显存紧张时把其中的 n_activated_experts 调低可以省显存代价是输出质量下降。权重结构细节可查 README_WEIGHTS.md。第 3 步启动推理并验证torchrun --nnodes 2 --nproc-per-node 8 \ --node-rank $RANK --master-addr $ADDR \ generate.py --ckpt-path /path/to/DeepSeek-V3-Demo \ --config configs/config_671B.json --interactive \ --temperature 0.7 --max-new-tokens 200单机 16 卡把参数换成 --nproc-per-node 16 即可。判定标准输入一句话10 秒内得到通顺回答无乱码、无重复循环即算跑通。怎么验证结果有效成功判据与长上下文实测看输出语句通顺、符合常识出现乱码先查配置文件精度dtype 字段与权重格式是否匹配看速度记录生成时长与 token 数相除应接近上表 25.6 tokens/s若低一半以上多半有配置或并行参数没对上看长上下文跑官方大海捞针NIAH测试2K 到 128K 全绿说明注意力链路正常⚠️ 高频问题速查现象、原因与解决办法现象原因解决办法Triton 算子编译报错torch/triton 版本不匹配重建虚拟环境按 requirements.txt 锁版本安装启动即 OOM671B 显存不足或上下文过长换小配置如 16B或降低 max-new-tokens加载报权重文件缺失权重未转成 demo 格式先执行 convert.py确认 --ckpt-path 指向转换后目录首次响应特别慢首次加载权重并编译内核做一次预热第二次起速度正常输出乱码配置精度与权重格式不符核对配置中 dtype 与权重实际格式一致总的来说16 张 80GB 卡起步的话DeepSeek-V3 的 FP8 推理部署可以完整复现3 步即可跑通显存不足就先用小配置验证流程再逐步放大。后续可以换 SGLang 搭生产服务或接入 MTP 推测解码再提一档速度。【免费下载链接】DeepSeek-V3项目地址: https://gitcode.com/GitHub_Trending/de/DeepSeek-V3创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考