发布日期:2026-07-22 | 关键词:Ollama / DeepSeek / 本地部署 / LLM
Ollama 是目前最流行的本地大模型运行工具,GitHub 累计176,741 Star,底层基于 Georgi Gerganov 的 llama.cpp 项目,支持 macOS、Windows、Linux 三端一键安装,三条命令即可在本地跑起 DeepSeek-R1。本文基于 Ollama 官方文档和模型库,完整覆盖三端安装流程、NVIDIA / AMD GPU 驱动配置、DeepSeek 各版本显存需求对照、REST API 调用,以及 Open WebUI 可视化界面搭建,适合零基础到有经验的开发者。
先看硬件:你的显卡能跑哪个版本?
DeepSeek 模型按参数量分多个档位,选错了要么跑不动,要么速度极慢。以下是 Ollama 官方模型库的实际文件大小与推荐配置:
| 模型版本 | 文件大小 | 上下文 | 推荐显存 | 适合场景 |
|---|---|---|---|---|
| deepseek-r1:1.5b | 1.1 GB | 128K | 4 GB+ | 入门体验,M 系列 Mac / 低端 PC |
| deepseek-r1:7b | 4.7 GB | 128K | 8 GB+ | 日常使用首选 |
| deepseek-r1:8b(latest) | 5.2 GB | 128K | 8 GB+ | 当前默认版本(Qwen3-8B 蒸馏) |
| deepseek-r1:14b | 9.0 GB | 128K | 16 GB+ | 效果更好,RTX 3080 / M2 Pro |
| deepseek-r1:32b | 20 GB | 128K | 24 GB+ | 高质量推理,RTX 4090 / M3 Max |
| deepseek-r1:70b | 43 GB | 128K | 多卡或 48 GB+ | 接近满血效果 |
| deepseek-r1:671b | 404 GB | 160K | 多卡服务器 | 完整模型 |
deepseek-v3:671b 同样需要 404 GB,需 Ollama v0.5.5+,适合服务器部署。
GPU 兼容性快速检查:
- NVIDIA:计算能力 5.0+(GTX 750 Ti 及以上)、驱动版本 550+,RTX 20/30/40/50 全系支持
- AMD:Linux 需 ROCm v7,支持 RX 6000/7000/9000 系列;Windows 仅支持 RX 7000 系列
- Apple Silicon:M1 / M2 / M3 / M4 全系支持,统一内存直接当显存用,16 GB 内存可流畅跑 14b
macOS 安装
方法一:命令行(推荐)
curl-fsSLhttps://ollama.com/install.sh|sh方法二:图形界面安装
前往ollama.com/download下载Ollama.dmg,拖入应用程序文件夹,双击启动。
安装完成后,菜单栏出现 Ollama 图标即代表服务已在后台运行(默认监听localhost:11434)。
拉取并运行 DeepSeek-R1:
# 拉取默认版本(8b,5.2 GB)ollama pull deepseek-r1# 直接运行(自动下载+启动交互对话)ollama run deepseek-r1# 指定版本ollama run deepseek-r1:14b下载完成后,终端出现>>>提示符即可直接对话。输入/bye退出交互模式,模型仍在后台保持加载状态。
Windows 安装
方法一:PowerShell 一键安装
irmhttps://ollama.com/install.ps1|iex方法二:图形界面安装
前往ollama.com/download下载OllamaSetup.exe,双击安装,完成后系统托盘出现 Ollama 图标。
确认服务运行:
# 检查服务状态curl http://localhost:11434# 拉取模型ollama pull deepseek-r1# 运行ollama run deepseek-r1多 GPU 配置(NVIDIA):
如果有多张显卡,可以通过环境变量限制 Ollama 使用哪张:
# 查看 GPU UUIDnvidia-smi-L# 指定使用第一张卡(在系统环境变量中设置)$env:CUDA_VISIBLE_DEVICES ="0"Linux 安装
一键安装脚本:
curl-fsSLhttps://ollama.com/install.sh|sh安装完成后 Ollama 会自动配置为 systemd 服务。
NVIDIA GPU 配置
# 验证 GPU 驱动(需要 550+)nvidia-smi# 确认驱动版本nvidia-smi --query-gpu=driver_version--format=csv,noheader如果驱动版本低于 550,前往 NVIDIA 官网下载最新驱动后重新运行安装脚本。
Linux 休眠唤醒后 GPU 丢失问题:重新加载驱动模块:
sudormmod nvidia_uvm&&sudomodprobe nvidia_uvmAMD GPU 配置(ROCm v7)
# 安装 ROCm(参考 AMD 官方 amdgpu-install 工具)# 安装完成后下载 Ollama ROCm 扩展curl-fsSLhttps://ollama.com/download/ollama-linux-amd64-rocm.tar.zst\|sudotarx-C/usr如果你的 AMD GPU 不在官方支持列表,可以尝试强制指定最近的 LLVM target,例如 RX 5400(gfx1034)可以尝试使用 gfx1030 的参数:
exportHSA_OVERRIDE_GFX_VERSION="10.3.0"配置为 systemd 服务(生产环境推荐)
安装脚本已自动创建服务,手动管理命令:
# 查看服务状态sudosystemctl status ollama# 设置开机自启sudosystemctlenableollama# 重启服务sudosystemctl restart ollama# 查看日志journalctl-uollama-f自定义配置(如修改监听端口或开启远程访问):
sudosystemctl edit ollama在弹出编辑器中添加:
[Service] Environment="OLLAMA_HOST=0.0.0.0:11434"常用命令速查
# 查看已下载的模型ollama list# 删除模型ollamarmdeepseek-r1:7b# 更新模型ollama pull deepseek-r1# 查看模型详情ollama show deepseek-r1# 后台运行服务(不启动终端 UI)ollama serveREST API 调用
Ollama 在本地11434端口提供完整的 REST API,兼容 OpenAI 接口格式:
# 基础对话curlhttp://localhost:11434/api/chat\-d'{ "model": "deepseek-r1", "messages": [{"role": "user", "content": "用 Python 写一个快速排序"}], "stream": false }'Python 调用:
pipinstallollamafromollamaimportchat response=chat(model='deepseek-r1',messages=[{'role':'user','content':'用 Python 写一个快速排序'}])print(response.message.content)JavaScript 调用:
npmi ollamaimportollamafrom'ollama'constresponse=awaitollama.chat({model:'deepseek-r1',messages:[{role:'user',content:'用 Python 写一个快速排序'}]})console.log(response.message.content)本地资源不足时,也可以通过支持 OpenAI 兼容接口的云端服务补充——例如七牛云 AI 推理服务提供 DeepSeek 系列模型的 API 接入,只需将base_url替换即可,代码结构与本地调用完全一致。
搭一个可视化界面:Open WebUI
不想用命令行,可以用Open WebUI,Docker 一条命令搞定:
dockerrun-d\-p3000:8080\--add-host=host.docker.internal:host-gateway\-vopen-webui:/app/backend/data\--nameopen-webui\--restartalways\ghcr.io/open-webui/open-webui:main浏览器打开http://localhost:3000,在设置中将 Ollama API 地址填入http://host.docker.internal:11434,即可在 Web 界面与本地 DeepSeek 对话。
常见问题
Q:ollama run后模型下载很慢,能加速吗?
Ollama 模型托管在 Cloudflare,国内直连速度因网络环境差异较大。可以在ollama pull命令前设置代理:
exporthttps_proxy=http://127.0.0.1:7890 ollama pull deepseek-r1或者在局域网内搭一台已经下好模型的机器,通过OLLAMA_HOST=0.0.0.0开启远程访问,其他机器直接用。
Q:CPU 能不能跑?
能,但很慢。Ollama 在没有 GPU 时自动回退 CPU 推理,7b 模型在 CPU 上大约每秒 3-8 个 token。1.5b 模型 CPU 体验相对可接受,14b 以上建议有 GPU 再运行。
Q:M 系列 Mac 怎么最大化利用统一内存?
Ollama 会自动调度 Apple Neural Engine + GPU,无需额外配置。M2 Pro(16 GB)跑 14b 问题不大;M3 Max(36 GB)可以流畅跑 32b。注意不要同时开其他内存占用大的应用。
Q:Ollama 更新后模型需要重新下载吗?
不需要,模型文件存储在独立路径(macOS/Linux:~/.ollama/models;Windows:C:\Users\<用户名>\.ollama\models),Ollama 版本更新不影响已下载的模型。
结语
Ollama 把本地大模型部署的门槛压到了极低——三端安装命令都在 1-2 行之内,DeepSeek-R1 的 8b 版本在任何有 8 GB 显存的机器上都能流畅运行。从 1.5b 到 671b,覆盖了从入门体验到生产部署的完整参数区间,MIT 协议可商用。
Ollama 官方 GitHub 最后更新于 2026 年 7 月,GPU 支持文档涵盖 NVIDIA RTX 50xx 最新架构和 AMD ROCm v7 全系支持,本文所有命令基于当前官方文档,建议定期访问docs.ollama.com获取最新信息。
延伸资源
- Ollama 官网:ollama.com
- DeepSeek-R1 模型库:ollama.com/library/deepseek-r1
- Open WebUI:github.com/open-webui/open-webui
- 云端 DeepSeek API 接入:qiniu.com/ai/plan