ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

如何精确测量DGX Spark上的vLLM推理性能?spark-vllm-docker基准测试教程

2026/10/4 16:23:44 拓冰建站 浏览量
如何精确测量DGX Spark上的vLLM推理性能?spark-vllm-docker基准测试教程 如何精确测量DGX Spark上的vLLM推理性能spark-vllm-docker基准测试教程【免费下载链接】spark-vllm-dockerDocker configuration for running VLLM on dual DGX Sparks项目地址: https://gitcode.com/gh_mirrors/sp/spark-vllm-dockerspark-vllm-docker 是面向 DGX Spark 的 vLLM Docker 部署方案覆盖单机与多节点集群。本教程教你精确测量vLLM 在 DGX Spark 上的推理性能生成吞吐tokens/s、首 token 延迟TTFT、内存占用与集群网络带宽从而获得可信且可复现的基准测试数据。一、先部署好 vLLM 推理服务基准测试的前提是有服务在跑。spark-vllm-docker 把构建镜像 下载模型 启动服务打包成一条命令git clone https://gitcode.com/gh_mirrors/sp/spark-vllm-docker cd spark-vllm-docker ./run-recipe.sh recipes/qwen3.8-flash-next-nvfp4-solo.yaml --solo --setup 单机加--solo双机集群省略该参数即可自动组网需先按 docs/NETWORKING.md 完成双机直连与免密 SSH 配置。服务就绪后用curl http://localhost:8000/health确认返回正常即可开始压测。二、测量吞吐量与延迟核心指标项目推荐llama-benchy本仓库 README.md 的 Benchmarking 章节推荐llama-benchy其输出格式与 llama.cpp 的 llama-bench 一致直接以 tokens/s 呈现方便跨后端横向对比它直接对 OpenAI 兼容接口发起压测请求。零依赖方案vLLM 内置 vllm bench不想装额外工具用 vLLM 自带的vllm bench serve一次拿到吞吐 延迟./launch-cluster.sh --solo exec vllm bench serve \ --base-url http://localhost:8000 \ --model nvidia/Qwen3.8-27B-NVFP4 \ --dataset-name random \ --num-prompts 100关键指标含义优化方向Output token throughput每秒生成 token 数调--gpu-memory-utilization、开 prefix cachingTTFT首 token 延迟控制max-model-len、优化 prefillMean E2E latency单请求端到端时延调--max-num-seqs、检查并发三、测量内存占用memory-profile 模块DGX Spark 采用 CPU/GPU 共享的统一内存内存占用直接决定能开多大的上下文与并发。mods/memory-profile/ 模块可在不干扰推理的前提下记录启动全过程的 CPU / CUDA / KV 内存曲线./run-recipe.sh qwen3.8-flash-next-nvfp4-solo --solo \ --apply-mod mods/memory-profile \ -v $PWD/memory-profiles:/memory-profiles \ -e VLLM_MEMORY_PROFILE_RUN_IDqwen-baseline-01随后生成可读报告与启动内存图python3 mods/memory-profile/report.py memory-profiles/qwen-baseline-01.yaml \ --output memory-profiles/qwen-baseline-01.md配合capacity.py还能离线判断这套配置在多大内存规格的机器上放得下完整用法见 mods/memory-profile/README.md。四、多节点集群测量 NCCL 网络带宽双机 / 多机下节点互联带宽直接决定张量并行TP的实际收益。docs/NETWORKING.md 提供两类基准InfiniBand 裸带宽perftest 的ib_write_bw理想值应接近 100 Gb/s 以上NCCL all_gather 测试nccl-tests真实模拟 vLLM 多卡通信用于定位网络瓶颈。五、让基准测试结果可信的 4 个要点固定负载同模型、同上下文长度、同并发下对比否则数字不可比。排除干扰压测前确认无其他进程抢占 GPU/内存必要时加--earlyoom防内存溢出。多轮取均值单次结果受缓存 / 编译影响建议跑 ≥3 次取中位数。区分 Prefill / Decode长 prompt 看 TTFT短回复看吞吐分别评估。总结部署run-recipe.sh 一键起服务或用 launch-cluster.sh 精细控制参数。压测vllm bench serve拿吞吐 / 延迟llama-benchy 做跨后端对比。内存memory-profile 记录启动曲线并评估容量。集群docs/NETWORKING.md 的 NCCL 测试定位网络瓶颈。掌握这套组合拳你就能在 DGX Spark 上得到精确、可复现的 vLLM 推理性能基准。【免费下载链接】spark-vllm-dockerDocker configuration for running VLLM on dual DGX Sparks项目地址: https://gitcode.com/gh_mirrors/sp/spark-vllm-docker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考