Links for llama-cpp-python whl安装包下载地址
Links for llama-cpp-python whl安装包下载地址
https://github.com/abetlen/llama-cpp-python/releases
自己的经历:
在Windows平台部署DeepSeek-R1-Distill-Qwen-7B-GGUF模型进行推理时,需要安装llama-cpp-python,可官网github发布的.whl文件版本比较低,推理DeepSeek-R1-Distill-Qwen-7B-GGUF模型报错,解决方案就是在本地安装较高版本的包,利用编译的方式
依次在本地安装
Visual Studio、CMake、git
然后在所创建的虚拟环境中,执行:
pip install llama-cpp-python \--extra-index-url https://abetlen.github.io/llama-cpp-python/whl/cpupython3-m llama_cpp.server--model./gpustack/bge-m3-GGUF/bge-m3-Q4_K_M.gguf--embedding true--model_alias bge-m3-embedding--host0.0.0.0--port8081python3-m llama_cpp.server--model./gpustack/bge-reranker-v2-m3-GGUF/bge-reranker-v2-m3-Q4_K_M.gguf--embedding true--host0.0.0.0--port8082Docker镜像下载地址:
arm架构的:
# amperecomputingai/llama.cpphttps://hub.docker.com/r/amperecomputingai/llama.cppdocker pull amperecomputingai/llama.cppamd架构的
# amperecomputingai/llama.cpphttps://hub.docker.com/r/dimaskiddo/llama.cpp/tagsdocker pull dimaskiddo/llama.cpp:0.0.0.10012-server