ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

大模型-新手安装Ollama以及大模型调用

2026/8/12 19:47:44 拓冰建站 浏览量
大模型-新手安装Ollama以及大模型调用 文章目录电脑配置下载安装Ollama更改模型存放地址使用ollama 下载 LLM 和 Embedding 模型API 调用使用Ollama 的http服务接口调用在代码中调用方式1通过 Python 调用http接口方式2直接引入ollama Python 包推荐调用方式3自定义API调用这里使用FastApi自定义http服务接口拓展-Ollama 配置文件Modelfilepython3安装环境依赖[为下一篇RAG开发做准备]电脑配置配置项最低配置推荐配置(个人笔记本)生产配置 CPU4 核8 核16 核 RAM8GB16GB32GB GPU❌ 不需要⚡ 可选 (加速推理) NVIDIA A100 磁盘10GB50GB200GB 响应速度5-10秒1-3秒 1秒这里我用的是个人笔记本配置下载安装Ollama在官网选择对应的版本下载https://ollama.com/downloadOllamaSetup.exeWindows直接双击启动时它默认安装C盘无法界面选择。当我需要装到D盘时使用如下命令在下载路径中打开CMD.\OllamaSetup.exe /DIRD:\Ollama可以看到它的安装日志已经显示是D盘了直到下图说明安装完成CMD命令行验证安装完成版本号如下ollama--versionollama version is0.32.1更改模型存放地址默认它会存放在Linux/macOS系统默认路径通常为 ~/.ollama/models 用户主目录下的隐藏文件夹。验证方法终端执行 ls -la ~/.ollama/models 若存在则显示模型文件列表。Windows系统默认路径为 %APPDATA%\Ollama\models 如 C:\Users用户名.ollama\models 。◦ 验证方法WinR输入 %APPDATA% 导航至 Ollama\models 文件夹。使用ollama 下载 LLM 和 Embedding 模型常见大模型特点模型大小特点推荐用途llama3.21B / 3BMeta 出品轻量快速英文日常对话、简单问答大小4GBqwen3.50.8B/2B/4B/9B/35B/122B阿里出品中文能力强,Instruct集成版性能要求低中文写作、代码生成deepseek-r11.5B / 7B / 14B / 32B推理能力突出逻辑推理、数学计算mistral7B欧洲开源英文强英文写作、翻译qwen3.5:2b-q4_k_m这里是2B量化压缩版本普通16G笔记本可以使用,磁盘空间占用1.6G4b版本需要磁盘空间3.2G集显运行时间大约45秒一个简短思考。这里使用最小版本下载毕竟笔记本的性能有限如果你的电脑配置高可以选择更好的模型下载# 1. 下载对话模型Llama 3.1 8B约 4.7GBollama pull llama3.1:8b# 2. 下载 Embedding 模型用于向量化文本ollama pull nomic-embed-text# 验证模型ollama list# 应显示# NAME SIZE MODIFIED# llama3.1:8b 4.7 GB ...# nomic-embed-text 274 MB ...国内下载速度还是挺快的如上图说明下载完成查看已经安装的模型ollama list NAME ID SIZE MODIFIED llama3.1:8b 46e0c10c039e4.9GB15hours ago nomic-embed-text:latest 0a109f422b47274MB15hours ago启动模型并使用模型对话llama run llama3.1 pulling manifest pulling 667b0c1932bc:100% ▕███████████████████████████████████████████████████████████████████████▏4.9GB pulling 948af2743fc7:100% ▕███████████████████████████████████████████████████████████████████████▏1.5KB pulling 0ba8f0e314b4:100% ▕███████████████████████████████████████████████████████████████████████▏12KB pulling 56bb8bd477a5:100% ▕███████████████████████████████████████████████████████████████████████▏96B pulling 455f34728c9b:100% ▕███████████████████████████████████████████████████████████████████████▏487B verifying sha256 digest writing manifest successhello Hello!How are you today? Is there something I canhelpyou with or would you like to chat?你好 Youre speaking Chinese!(I think)Hello, nǐ hǎo!API 调用使用Ollama 的http服务接口调用Ollama 启动后会自动在本地运行一个 API 服务地址是 http://localhost:11434。这意味着你可以通过 HTTP 请求调用模型就像使用 OpenAI API 一样curlhttp://localhost:11434/api/generate-d{ model: qwen2.5:7b, prompt: 什么是 Transformer用一句话解释。, stream: false }也可以在postman中直接测试在代码中调用方式1通过 Python 调用http接口importrequests urlhttp://localhost:11434/api/generatepayload{model:qwen2.5:7b,prompt:用 Python 写一个计算 Fibonacci 数列的函数,stream:False}responserequests.post(url,jsonpayload)print(response.json()[response])本地使用比较直接无token限制方式2直接引入ollama Python 包推荐调用##下载ollma包pipinstallollamaimportollama# 简单对话responseollama.chat(modelqwen2.5:7b,messages[{role:system,content:你是一个专业的程序员},{role:user,content:用 Python 实现一个快速排序算法}])print(response[message][content])项目内部提供模块化服务使用无token限制token检查有专门的模块服务负责方式3自定义API调用这里使用FastApi自定义http服务接口from fastapiimportFastAPIimportollama appFastAPI()app.post(/chat)def chat(prompt: str): responseollama.chat(modelqwen2.5:7b,messages[{role:user,content:prompt}])return{answer:response[message][content]}一般项目服务产品或者给第三方提供服务SAAS采用此种方式可以在每次调用前校验用户权限用户的token余额是否足够如果只是简单使用这里已经全部完成了无非就是根据你的电脑配置你可以使用更大更新更快的模型而已。下面的章节为开发做准备如果你要研究RAG等可能需要开发环境和依赖包拓展-Ollama 配置文件ModelfileModelfile 是 Ollama 用来定义和构建自定义模型的配置文件类似于 Dockerfile。你可以通过它基于已有模型创建新模型修改系统提示System Prompt调整推理参数自定义输入输出格式加载微调适配器LoRA预设对话历史打包成可分享的模型镜像Ollama 超详细配置教程之Modelfilehttps://blog.csdn.net/weixin_74256690/article/details/151353588python3安装环境依赖[为下一篇RAG开发做准备]具体安装方式参考我之前的bloghttps://blog.csdn.net/zjcjava/article/details/100751958安装完成cmd查看当前版本如下python Python3.13.7(tags/v3.13.7:bcee1c3, Aug142025,14:15:11)[MSC v.194464bit(AMD64)]on win32 Typehelp,copyright,creditsorlicenseformoreinformation.依赖包说明如下包名用途是否必需langchainRAG编排框架核心必需langchain-ollamaOllama集成(LLMEmbeddings)必需chromadb本地向量数据库;必需pypdfPDF文档解析按需python-docxWord 文档解析按需streamlitWeb UI框架可选tiktokenToken计数(分块优化)推荐安装命令如下根据系统命令不同替换不同的换行符# 创建虚拟环境推荐python-mvenv rag-env rag-env\Scripts\activate# Windows# source rag-env/bin/activate # macOS/Linux# rag-env\Scripts\activate # Windows# 安装依赖 windows下 powershellpipinstall-Upip pipinstalllangchain0.3.0langchain-ollama0.2.0langchain-community0.3.0chromadb0.5.0sentence-transformers3.0.0pypdf1.13.0python-docx1.1.0streamlit1.39.0tiktoken0.8.0rank-bm250.2.2--index-url https://pypi.tuna.tsinghua.edu.cn/simple##pip 如果是maccentos则替换为\# CMD则替换为^