ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Qwen2.5-Omni-7B在昇腾平台的性能优化实践

2026/9/2 9:20:36 拓冰建站 浏览量
Qwen2.5-Omni-7B在昇腾平台的性能优化实践 摘要:本文基于昇腾Atlas 800T A2平台,系统介绍Qwen2.5-Omni-7B多模态模型的部署与性能优化实践。通过aisbench压测定位推理瓶颈,并采用全图模式、异步调度、虚拟内存扩展及AIV通讯等vLLM优化手段,将高并发场景下的TTFT时延从15.6s降至3.7s以内,支持并发数由70提升至90,总输出吞吐提升约21%,为昇腾平台大模型推理调优提供可复现的参考方案。一、Qwen2.5-Omni-7B环境部署环境信息:vllm0.11.0vllm-ascend0.11.0cann8.3.RC2HDK25.2.0硬件信息Atlas800T A2cann安装包下载:toolkit:Ascend-cann-toolkit_8.3.RC1_linux-aarch64.runkernels:Ascend-cann-kernels-910b_8.3.RC2_linux-aarch64.runnnal:Ascend-cann-nnal_8.3.RC2_linux-aarch64.run环境搭建以及测试参考:Qwen2.5-Omni-7B环境搭建及aisbench压测指导二、Qwen2.5-Omni-7B初始性能测试vllm服务启动命令:source /usr/local/Ascend/ascend-toolkit/set_env.shsource /usr/local/Ascend/nnal/atb/set_env.shexport VLLM_USE_MODELSCOPE=Trueexport PYTORCH_NPU_ALLOC_CONF=max_split_size_mb:256export ASCEND_RT_VISIBLE_DEVICES=0export VLLM_TORCH_PROFILER_DIR="./vllm_profile"vllm serve /root/autodl-tmp/Qwen2.5-Omni-7B --host 0.0.0.0 --port 9988 \--max-model-len 4096 \--max-num-batched-tokens 4096 \--max-num-seqs 200 \--gpu-memory-utilization 0.4 \--dtype bfloat16 \--tensor-parallel-size 1 \--trust-remote-code \--served-model-name Qwen2.5-Omni-7B \--block-size 128 \--allowed-local-media-path /root/Omni-7B/benchmark/ais_bench/datasets/ \--enable-prefix-cachingaisbench压测命令ais_bench --models vllm_api_stream_chat --datasets vocalsound_gen --summarizer default_perf --mode perf压测音频数据集总计608个,每个音频30s时长,16K赫兹,输出文本设置为128,并发设置为10-150,性能压测结果如下:音频输入文本输出并发TTFT(ms)TPOT(ms)总输出(token/s)时长30s且16K赫兹12810743.830.15278.67时长30s且16K赫兹128201282.0837.29419.4时长30s且16K赫兹128301335.5946.36522.55时长30s且16K赫兹128401333.1756.96586.64时长30s且16K赫兹128501596.369.32601.72时长30s且16K赫兹128601660.379.88635.04时长30s且16K赫兹128701712.5594.33