Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0评估全流程:从lm-evaluation-harness安装到GSM8K测试
Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0评估全流程:从lm-evaluation-harness安装到GSM8K测试
【免费下载链接】Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0项目地址: https://ai.gitcode.com/hf_mirrors/amd/Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0
Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0是由AMD基于Microsoft Phi-4-reasoning-plus模型量化优化的CPU推理模型,采用8位权重和8位动态激活量化(W8A8)技术,通过LLM Compressor v0.12.0实现,专为AMD EPYC处理器优化,可在Linux系统上通过vLLM引擎高效运行。
评估准备:环境与工具安装
核心依赖安装
评估前需确保系统已安装以下组件:
- Python环境:建议3.8+版本
- 基础依赖包:
pip install torch==2.11.0 zentorch==2.11.0.3 vllm==0.26.0 llmcompressor==0.12.0
lm-evaluation-harness部署
lm-evaluation-harness是EleutherAI开发的基准测试框架,支持多种语言模型评估:
# 克隆官方仓库 git clone https://github.com/EleutherAI/lm-evaluation-harness cd lm-evaluation-harness # 安装依赖 pip install -e .模型获取与部署
克隆模型仓库
通过Git获取量化模型文件:
git clone https://gitcode.com/hf_mirrors/amd/Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0 cd Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0环境变量配置
为确保vLLM引擎性能,需设置OpenMP库加载路径:
# 使用LLVM OpenMP export LD_PRELOAD=$(find /path/to/venv -name "libomp.so" | head -1) # 或Intel OpenMP export LD_PRELOAD=$(find /path/to/venv -name "libiomp5.so" | head -1)GSM8K评估全流程
评估命令解析
使用lm-evaluation-harness对GSM8K数据集(5-shot)进行测试:
lm_eval \ --model vllm \ --model_args pretrained=amd/Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0,dtype=bfloat16 \ --tasks gsm8k \ --batch_size auto \ --trust_remote_code \ --num_fewshot 5 \ --apply_chat_template \ --log_samples \ --gen_kwargs "max_gen_toks=2048" \ --output_path ./evaluation_results参数说明:
--model vllm:指定使用vLLM推理引擎--num_fewshot 5:采用5样本示例提示--apply_chat_template:应用模型对话模板chat_template.jinja--output_path:结果保存路径
评估结果解读
官方测试显示,该量化模型在GSM8K(5-shot)任务上表现优异:
| 基准测试 | BF16原始模型 | W8A8量化模型 | 性能恢复率 |
|---|---|---|---|
| GSM8K (5-shot) | 0.8704 | 0.8893 | 102.17% |
关键发现:量化模型准确率(0.8893)超过原始BF16模型,实现102.17%的性能恢复,同时磁盘空间减少46%(从27.3 GiB降至14.6 GiB)。
常见问题解决
依赖版本冲突
若出现ImportError,需严格匹配版本要求:
torch==2.11.0 zentorch==2.11.0.3 vllm==0.26.0 llmcompressor==0.12.0查看完整依赖清单:requirements配置
推理性能优化
- CPU核心配置:设置
OMP_NUM_THREADS为物理核心数 - 内存分配:确保系统空闲内存≥32GB
- 量化参数:参考recipe.yaml中的优化配置
总结与扩展
Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0通过W8A8量化实现了高效CPU推理,在保持推理质量的同时显著降低资源占用。评估流程可扩展至其他基准测试(如MMLU、TruthfulQA),只需修改--tasks参数即可。完整评估脚本与配置文件可在项目根目录获取,包括:
- 量化配置:recipe.yaml
- 模型参数:config.json
- 生成配置:generation_config.json
建议定期查看SECURITY.md获取安全更新,遵循CODE_OF_CONDUCT.md进行模型使用与二次开发。
【免费下载链接】Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0项目地址: https://ai.gitcode.com/hf_mirrors/amd/Phi-4-reasoning-plus-w8a8-llmcompressor-v0.12.0
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考