ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

国产大模型本地部署与微调实战:从DeepSeek/Qwen3/ChatGLM到生产级服务

2026/8/18 5:51:41 拓冰建站 浏览量
国产大模型本地部署与微调实战:从DeepSeek/Qwen3/ChatGLM到生产级服务 从零玩转国产大模型DeepSeek/Qwen3/ChatGLM部署、微调、私有化实战一条龙【建议收藏】最近在尝试将大模型能力集成到内部业务系统时发现网上关于国产大模型本地部署和微调的教程要么过于零散要么停留在理论层面真正能跑通全流程的实战指南少之又少。从环境配置、模型下载到参数微调、服务部署每一步都可能遇到意想不到的“坑”。本文旨在整合一套从零开始的完整闭环方案手把手带你搞定 DeepSeek、Qwen3、ChatGLM 这几款主流国产大模型的本地部署、高效微调以及私有化服务搭建。无论你是想快速体验大模型能力的学生还是需要在企业内网安全落地的开发者都能从本文中找到可直接复用的代码、配置和避坑指南。1. 背景与核心概念为什么选择国产大模型在 ChatGPT 引领的 AI 浪潮下国内也涌现出一批优秀的大语言模型。对于开发者而言选择国产大模型进行本地化部署和微调主要基于以下几点考量数据安全与合规性许多企业业务涉及敏感数据无法将数据上传至境外云服务。本地部署能确保数据完全留在内网满足严格的合规要求。定制化需求通用大模型在特定垂直领域如法律、医疗、金融的表现可能不尽如人意。通过微调Fine-tuning我们可以用领域数据“教导”模型使其更专业、更符合业务场景。成本可控虽然本地部署需要硬件投入但对于高频调用或长期使用的场景相比按次付费的 API总体成本可能更低且没有网络延迟和调用限制。技术自主掌握从部署到微调的全流程有助于团队积累核心 AI 能力避免被单一供应商绑定。本文重点关注的三个模型各有特色DeepSeek由深度求索公司开发以强大的代码能力和推理能力著称最新版本在多项基准测试中表现优异且完全开源、可商用。Qwen3阿里通义千问的最新开源系列覆盖了从 0.5B 到 72B 的多种规模在中文理解和多语言任务上表现均衡工具调用、多模态等能力丰富。ChatGLM3智谱 AI 推出的开源对话模型基于 GLM 架构在中文对话场景下非常成熟生态工具如transformers、langchain集成度好微调方案多样。理解“部署”和“微调”是入门的第一步部署指将训练好的大模型权重文件下载到本地服务器或 PC并启动一个能够接收请求、返回模型推理结果的服务如基于 HTTP 的 API。这让你能像使用 OpenAI API 一样在本地调用模型。微调指在预训练好的大模型基础上使用你自己的特定领域数据继续训练使模型适应新任务或领域的过程。常见的微调方法有全参数微调、LoRA低秩适应等后者能以极小的参数量达到接近全参数微调的效果节省大量计算资源。2. 环境准备与版本说明工欲善其事必先利其器。在开始操作前请确保你的环境满足以下基本要求。本文示例以 LinuxUbuntu 22.04系统为主Windows 用户可通过 WSL2 获得类似体验。2.1 硬件与系统要求操作系统Ubuntu 20.04/22.04 LTS, CentOS 7/8, 或 Windows 10/11 with WSL2。推荐使用 Linux。CPU建议支持 AVX2 指令集。内存至少 16GB。运行 7B 参数模型建议 32GB 以上运行 14B/72B 模型需要更大内存。GPU强烈推荐NVIDIA GPU显存是关键。以下为粗略估计7B 模型INT4量化约需 6GB 显存。14B 模型INT4量化约需 10GB 显存。72B 模型INT4量化约需 40GB 显存。无 GPU 也可纯 CPU 推理但速度会慢很多。磁盘空间预留 50GB 以上空间用于存放模型文件和依赖库。2.2 核心软件安装首先更新系统并安装基础编译工具和 Python。# 更新系统包列表 sudo apt-get update sudo apt-get upgrade -y # 安装基础编译工具和软件属性管理包 sudo apt-get install -y build-essential git curl wget software-properties-common # 安装 Python 3.10Ubuntu 22.04 默认可能为3.10 sudo apt-get install -y python3.10 python3.10-venv python3.10-dev python3-pip接下来安装 CUDA 和 cuDNN如果使用 NVIDIA GPU。这是加速深度学习计算的核心。请根据你的 GPU 驱动和型号在 NVIDIA 官网选择对应版本的 CUDA Toolkit如 12.1进行安装。这里以 CUDA 12.1 为例# 添加 NVIDIA 包仓库 wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/cuda-ubuntu2204.pin sudo mv cuda-ubuntu2204.pin /etc/apt/preferences.d/cuda-repository-pin-600 sudo apt-key adv --fetch-keys https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/3bf863cc.pub sudo add-apt-repository deb https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/ / sudo apt-get update # 安装 CUDA 12.1 sudo apt-get install -y cuda-toolkit-12-1 # 安装 cuDNN (需要注册 NVIDIA 开发者账号下载) # 假设你已经将下载的 cuDNN Debian 包如 libcudnn8_8.x.x.x-1cuda12.1_amd64.deb放在当前目录 sudo dpkg -i libcudnn8_8.x.x.x-1cuda12.1_amd64.deb安装完成后将 CUDA 加入环境变量echo export PATH/usr/local/cuda-12.1/bin:$PATH ~/.bashrc echo export LD_LIBRARY_PATH/usr/local/cuda-12.1/lib64:$LD_LIBRARY_PATH ~/.bashrc source ~/.bashrc验证安装nvidia-smi # 查看GPU状态 nvcc --version # 查看CUDA编译器版本2.3 创建 Python 虚拟环境为避免包冲突为每个项目创建独立的虚拟环境是最佳实践。# 创建项目目录并进入 mkdir -p ~/projects/llm_deploy_finetune cd ~/projects/llm_deploy_finetune # 创建 Python 3.10 虚拟环境 python3.10 -m venv venv # 激活虚拟环境 source venv/bin/activate # 升级 pip 和 setuptools pip install --upgrade pip setuptools wheel至此基础环境准备完毕。后续所有 Python 包的安装都应在激活的虚拟环境中进行。3. 核心工具与框架选型在部署和微调大模型时选择合适的工具能事半功倍。下面介绍几个核心工具我们将基于它们展开实战。3.1 Ollama极简的本地大模型运行工具Ollama是一个开源项目它简化了在本地运行大语言模型的过程。你只需要一条命令就能下载并启动一个模型并通过类 OpenAI 的 API 进行调用。它自动处理模型格式转换、上下文窗口管理等非常适合快速体验和轻量级部署。核心特点一键下载运行模型支持 GGUF 格式。内置简单的 REST API 和 OpenAI 兼容的 API 端点。支持模型量化4-bit, 5-bit, 8-bit降低资源消耗。跨平台macOS, Linux, Windows。我们将使用 Ollama 来快速部署和体验 DeepSeek、Qwen3 等模型。3.2 LM Studio图形化本地大模型桌面工具LM Studio为不熟悉命令行的用户提供了图形化界面可以方便地搜索、下载、运行和聊天式地测试各种开源大模型。它也提供了本地服务器功能可供其他应用程序通过 API 调用。适用场景个人学习、快速原型验证、在 Windows/macOS 上免配置体验模型。3.3 Llama-Factory / XTuner高效微调框架当我们需要用自定义数据训练模型时全参数微调成本太高。LoRA等参数高效微调方法成为主流。这里推荐两个优秀的微调框架Llama-Factory一个统一、易用的开源大模型微调框架支持数十种模型包括 LLaMA, Qwen, ChatGLM, DeepSeek 等和多种微调方法全参数、LoRA, QLoRA等。它提供了 Web UI 和命令行两种方式极大降低了微调门槛。XTuner上海人工智能实验室推出的轻量级微调工具箱与 InternLM 系列模型深度集成也对 Qwen 等主流模型支持良好以配置简单、高效著称。本文将主要使用Llama-Factory进行微调实战因为它对多模型的支持更全面社区活跃文档清晰。3.4 vLLM / Text Generation Inference高性能推理服务器对于生产环境我们需要高吞吐、低延迟的推理服务。vLLM和TGI是当前最流行的两款高性能推理引擎。vLLM基于 PagedAttention 注意力算法实现了极高的吞吐量特别适合批量推理场景。TGIHugging Face 推出的推理服务器支持 Tensor Parallelism 和连续批处理功能强大。在部署章节我们会介绍如何使用这些工具搭建生产级 API 服务。4. 实战一使用 Ollama 快速本地部署与体验这是最快上手大模型的方法。我们将部署 DeepSeek 和 Qwen3 的聊天版本。4.1 安装 Ollama在 Linux 上使用一键安装脚本curl -fsSL https://ollama.com/install.sh | sh安装完成后Ollama 服务会自动启动。你可以通过systemctl status ollama检查服务状态。4.2 下载并运行模型Ollama 的模型库托管在 ollama.com/library 。我们以deepseek-coder:6.7b一个专注于代码的 DeepSeek 模型和qwen2.5:7b为例。# 拉取并运行 deepseek-coder 6.7B 模型量化版节省显存 ollama run deepseek-coder:6.7b # 首次运行会自动下载模型下载完成后会进入交互式聊天界面。 # 你可以输入问题例如Write a Python function to calculate Fibonacci sequence. # 在另一个终端拉取并运行 Qwen2.5 7B 模型 ollama run qwen2.5:7b4.3 以服务模式运行并提供 API更多时候我们需要模型以后台服务运行并通过 API 调用。# 1. 直接启动服务并加载模型 (服务运行在 11434 端口) ollama serve # 或者使用 nohup 保持后台运行 # nohup ollama serve ollama.log 21 # 2. 在另一个终端通过 curl 调用 API # 注意需要先确保模型已经拉取例如 ollama pull qwen2.5:7b curl http://localhost:11434/api/generate -d { model: qwen2.5:7b, prompt: 为什么天空是蓝色的, stream: false }API 返回是 JSON 格式包含模型生成的回复。4.4 使用 OpenAI 兼容的 API 端点Ollama 还提供了与 OpenAI SDK 完全兼容的 API 端点/v1/chat/completions这使得你可以直接使用像openai、langchain这样的库来调用本地模型。# 调用 OpenAI 格式的聊天补全接口 curl http://localhost:11434/v1/chat/completions -H Content-Type: application/json -d { model: qwen2.5:7b, messages: [ { role: user, content: 请用中文介绍一下你自己。 } ], stream: false }Python 代码示例 创建一个test_ollama_api.py文件# test_ollama_api.py import requests import json def ask_ollama(model, prompt): url http://localhost:11434/api/generate payload { model: model, prompt: prompt, stream: False } response requests.post(url, jsonpayload) if response.status_code 200: result response.json() return result.get(response, ) else: return fError: {response.status_code}, {response.text} if __name__ __main__: # 测试 DeepSeek Coder answer ask_ollama(deepseek-coder:6.7b, 用Python写一个快速排序函数并添加注释。) print(DeepSeek Coder 回答\n, answer) print(- * 50) # 测试 Qwen2.5 answer ask_ollama(qwen2.5:7b, 解释一下机器学习中的过拟合现象。) print(Qwen2.5 回答\n, answer)运行python test_ollama_api.py即可看到结果。优点与局限优点极其简单开箱即用适合快速验证和轻量级应用。局限功能相对单一缺乏高级的部署特性如动态批处理、多GPU并行不适合高并发生产场景。模型管理依赖 Ollama 官方库。5. 实战二使用 Llama-Factory 进行 LoRA 微调现在我们进入更核心的环节——微调。假设我们有一个医疗问答数据集希望让 Qwen2.5-7B 模型在该领域表现更好。我们将使用Llama-Factory和LoRA方法。5.1 环境搭建与项目初始化首先确保在之前创建的虚拟环境中操作。# 激活虚拟环境如果已退出 cd ~/projects/llm_deploy_finetune source venv/bin/activate # 克隆 Llama-Factory 仓库 git clone https://github.com/hiyouga/LLaMA-Factory.git cd LLaMA-Factory # 安装依赖根据你的CUDA版本选择例如 torch 2.1.2cu121 pip install -r requirements.txt -U # 可能需要单独安装特定版本的 torch pip install torch2.1.2 torchvision0.16.2 torchaudio2.1.2 --index-url https://download.pytorch.org/whl/cu121 # 安装 Llama-Factory 本体 pip install -e .5.2 准备微调数据Llama-Factory 支持多种数据格式最常见的是alpaca格式指令-输入-输出和sharegpt格式多轮对话。我们创建一个简单的医疗问答数据集medical_qa.json采用alpaca格式。[ { instruction: 什么是糖尿病, input: , output: 糖尿病是一种慢性代谢性疾病主要特征是血液中的葡萄糖血糖水平持续高于正常范围。这通常是由于胰岛素分泌不足或身体对胰岛素反应不佳胰岛素抵抗导致的。糖尿病分为1型、2型、妊娠期糖尿病等类型需要长期管理包括饮食控制、运动和药物治疗。 }, { instruction: 高血压患者平时应该注意什么, input: , output: 高血压患者应注意1. 低盐饮食每日钠摄入量低于5克。2. 均衡饮食多吃蔬菜水果、全谷物限制饱和脂肪和胆固醇。3. 规律运动每周至少150分钟中等强度有氧运动。4. 控制体重保持BMI在健康范围。5. 限制饮酒戒烟。6. 定期监测血压遵医嘱服药不随意停药。7. 管理压力保持充足睡眠。 }, { instruction: 根据症状判断可能疾病, input: 患者男45岁近期出现多饮、多尿、体重下降、乏力。, output: 根据“多饮、多尿、体重下降、乏力”的典型症状需要高度警惕糖尿病的可能性特别是2型糖尿病。建议尽快就医进行空腹血糖、糖化血红蛋白等检查以明确诊断。 } ]将medical_qa.json文件放在LLaMA-Factory/data目录下。5.3 配置与启动微调Llama-Factory 提供了便捷的 Web UI 和命令行工具。我们先使用 Web UI 进行可视化操作。# 启动 Web UI CUDA_VISIBLE_DEVICES0 python src/train_web.py浏览器访问http://localhost:7860。在 Web UI 中操作模型设置模型名称选择Qwen2.5-7B。如果本地没有可以填写 Hugging Face 模型IDQwen/Qwen2.5-7B程序会自动下载。模型路径留空会自动从 Hugging Face 下载。训练配置微调方法选择LoRA。模板选择qwen根据模型选择对应模板。数据集在“数据集”标签页点击“创建数据集”命名如medical_qa类型选alpaca然后上传或填写我们刚创建的medical_qa.json文件的路径如./data/medical_qa.json。保存后在“训练”页面的“数据集”中选择它。训练参数关键学习率1e-4(LoRA 常用)批处理大小根据 GPU 显存调整7B模型可尝试4或8。训练轮数3(对于小数据集防止过拟合)LoRA Rank8(LoRA 秩影响参数量常用8,16,32)LoRA Alpha32(缩放参数通常设为 rank 的2-4倍)保存步数100(每100步保存一次检查点)输出设置输出目录例如./saves/qwen2.5-7b-lora-medical开始训练点击“开始”按钮。训练开始后可以在终端或 Web UI 看到损失loss下降的日志。训练完成后模型适配器LoRA 权重会保存在指定的输出目录中。5.4 使用命令行微调供参考如果你更喜欢命令行或需要写脚本可以使用以下命令CUDA_VISIBLE_DEVICES0 llamafactory-cli train \ --stage sft \ --do_train True \ --model_name_or_path Qwen/Qwen2.5-7B \ --dataset medical_qa \ --template qwen \ --finetuning_type lora \ --lora_rank 8 \ --lora_alpha 32 \ --output_dir ./saves/qwen2.5-7b-lora-medical \ --overwrite_cache True \ --per_device_train_batch_size 4 \ --gradient_accumulation_steps 4 \ --lr_scheduler_type cosine \ --logging_steps 10 \ --save_steps 100 \ --learning_rate 1e-4 \ --num_train_epochs 3.0 \ --fp16 True5.5 合并与测试微调后的模型训练完成后我们得到的是 LoRA 适配器权重需要与原始模型合并才能方便地部署和使用。使用 Web UI 合并在 Web UI 切换到“导出”标签页。模型名称选择刚才微调使用的基座模型如 Qwen2.5-7B。适配器路径选择训练输出的目录如./saves/qwen2.5-7b-lora-medical。导出格式选择PyTorch用于后续推理或GGUF用于 Ollama 等。点击“开始导出”合并后的模型会保存在./saves/qwen2.5-7b-lora-medical/merged目录下。测试合并后的模型 可以使用 Llama-Factory 内置的聊天界面测试或者用transformers库加载。# test_finetuned_model.py from transformers import AutoTokenizer, AutoModelForCausalLM import torch model_path ./saves/qwen2.5-7b-lora-medical/merged tokenizer AutoTokenizer.from_pretrained(model_path) model AutoModelForCausalLM.from_pretrained(model_path, torch_dtypetorch.float16, device_mapauto) prompt 什么是糖尿病 inputs tokenizer(prompt, return_tensorspt).to(model.device) with torch.no_grad(): outputs model.generate(**inputs, max_new_tokens200, temperature0.7) response tokenizer.decode(outputs[0], skip_special_tokensTrue) print(response)6. 实战三使用 vLLM 部署生产级推理服务对于需要高并发、低延迟响应的生产环境Ollama 可能力有不逮。vLLM是一个高性能、易用的大模型推理和服务引擎特别适合部署我们刚刚微调好的模型。6.1 安装 vLLM在虚拟环境中安装 vLLMpip install vllm # 或者从源码安装最新版 # pip install githttps://github.com/vllm-project/vllm.git6.2 启动 vLLM 推理服务器假设我们已经有了合并后的模型路径./saves/qwen2.5-7b-lora-medical/merged。# 启动一个 OpenAI API 兼容的服务器 CUDA_VISIBLE_DEVICES0 python -m vllm.entrypoints.openai.api_server \ --model ./saves/qwen2.5-7b-lora-medical/merged \ --served-model-name qwen2.5-7b-medical \ --max-model-len 4096 \ --tensor-parallel-size 1 \ --gpu-memory-utilization 0.9 \ --port 8000参数解释--model模型路径本地或 Hugging Face ID。--served-model-name服务中使用的模型名称。--max-model-len模型支持的最大上下文长度。--tensor-parallel-sizeTensor 并行大小多 GPU 时使用。--gpu-memory-utilizationGPU 内存利用率目标。--port服务监听的端口默认为 8000。服务启动后会提供一个与 OpenAI API 完全兼容的端点http://localhost:8000/v1。6.3 调用 vLLM API我们可以使用openai库需要安装openai包或者curl来调用。使用 Python 客户端# test_vllm_api.py from openai import OpenAI # 注意这里指向本地 vLLM 服务器 client OpenAI( api_keytoken-abc123, # vLLM 服务器默认不需要验证但需要提供任意非空api_key base_urlhttp://localhost:8000/v1 ) completion client.chat.completions.create( modelqwen2.5-7b-medical, # 与 --served-model-name 一致 messages[ {role: user, content: 高血压患者平时应该注意什么} ], temperature0.7, max_tokens500 ) print(completion.choices[0].message.content)使用 curl 调用curl http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -H Authorization: Bearer token-abc123 \ -d { model: qwen2.5-7b-medical, messages: [ {role: user, content: 高血压患者平时应该注意什么} ], temperature: 0.7, max_tokens: 500 }6.4 vLLM 的高级特性与优化连续批处理vLLM 默认开启能自动将多个请求动态批处理极大提高 GPU 利用率。PagedAttention核心算法高效管理注意力机制的键值缓存允许处理超长文本。多 GPU 支持通过--tensor-parallel-size和--distributed-executor-backend参数可以利用多卡。量化支持vLLM 支持 AWQ、GPTQ 等量化模型可以进一步降低显存占用提升速度。部署时直接加载量化后的模型即可例如--model Qwen/Qwen2.5-7B-Instruct-AWQ。7. 常见问题与排查思路FAQ在部署和微调过程中你几乎一定会遇到一些问题。以下是高频问题及解决方案。问题现象可能原因排查步骤与解决方案Ollama 启动模型时提示Error: pull model manifest1. 网络问题无法连接 Ollama 服务器。2. 模型名称拼写错误。1. 检查网络连接尝试curl -v https://ollama.com。2. 使用ollama list查看本地已有模型或用ollama pull model_name明确拉取。微调时 GPU 显存不足OOM1. 批处理大小batch size太大。2. 模型太大未使用量化。3. 未使用梯度累积。1. 减小per_device_train_batch_size。2. 使用量化模型如Qwen2.5-7B-Instruct-Int4作为基座。3. 在 Llama-Factory 中增大gradient_accumulation_steps等效增大总 batch size 但不增加瞬时显存。vLLM 服务启动失败提示 CUDA 错误1. vLLM 版本与 CUDA/torch 版本不兼容。2. GPU 驱动太旧。1. 检查 vLLM 官方文档的版本兼容性表。通常pip install vllm会自动匹配如有问题可指定版本pip install vllm0.3.3。2. 使用nvidia-smi确认驱动版本升级到最新稳定版。调用 API 时返回404或模型未找到1. API 端点路径错误。2.--served-model-name与请求中的model参数不匹配。1. vLLM OpenAI API 端点为/v1/chat/completions确保 URL 正确。2. 检查启动命令中的--served-model-name和请求体中的model字段是否完全一致。微调后模型输出乱码或胡言乱语1. 学习率过高训练发散。2. 训练数据格式与模板不匹配。3. 训练轮数太多过拟合。1. 降低学习率如从1e-4降到5e-5。2. 检查数据集格式是否正确模板是否选对如 Qwen 模型用qwen模板。3. 减少训练轮数或在数据中增加更多样化的样本。使用合并后的模型推理速度很慢1. 未使用torch.compile或推理优化。2. 仍在 CPU 上运行。3. 未使用量化。1. 使用 vLLM 或 TGI 等优化推理引擎。2. 确保模型加载时使用了.to(‘cuda’)或device_map“auto”。3. 考虑将模型转换为 GPTQ/AWQ 等量化格式后再部署。8. 最佳实践与工程建议将大模型应用于实际项目除了跑通流程更需要关注稳定性、可维护性和性能。8.1 模型选择与量化策略按需选择模型尺寸不要盲目追求大参数模型。7B-14B 的模型在大多数任务上已有不错表现且部署成本低。72B 及以上模型需要强大的硬件支撑。量化是部署的必选项FP16 精度模型对显存要求高。优先使用 GPTQ/AWQ 的 4-bit 量化模型能在几乎不损失精度的情况下将显存占用降低至 1/4推理速度也有提升。在 Hugging Face 模型库中搜索模型时注意-GPTQ或-AWQ后缀。测试后再决定在最终决定前用你的核心业务问题或构建一个小的测试集对不同模型和量化版本进行效果评估。8.2 数据准备与微调质量优于数量微调数据的质量至关重要。确保指令清晰、答案准确、格式规范。几百条高质量数据的效果可能优于几千条噪声数据。数据格式统一严格按照所选微调框架要求的格式准备数据。使用其提供的脚本或工具进行格式检查和清洗。警惕过拟合使用验证集validation set监控训练过程。当验证集损失不再下降甚至上升时应提前停止训练。对于小数据集训练轮数epoch通常设为 3-5 即可。LoRA 参数选择rank是核心参数一般 8、16、32 是常用值。对于领域适配8 可能就足够对于复杂任务可以尝试 16 或 32。alpha通常设为rank的 2-4 倍。8.3 生产环境部署使用专用推理服务器生产环境务必使用vLLM或TGI它们提供了并发处理、动态批处理、监控接口等企业级特性。API 安全与限流vLLM 本身不提供高级认证和限流。在生产中应在 vLLM 前部署一个反向代理如 Nginx并配置 API 密钥验证、请求速率限制、访问日志等。健康检查与监控为推理服务添加健康检查端点如/health并集成到你的监控系统如 Prometheus Grafana中监控 GPU 使用率、显存、请求延迟、QPS 等关键指标。版本管理与回滚对微调后的模型进行版本化管理如打上 git tag。部署新模型时做好 A/B 测试或蓝绿部署预案以便在效果不佳时快速回滚。8.4 资源管理与成本控制GPU 资源池化如果有多台 GPU 服务器可以考虑使用 Kubernetes 搭配 GPU 调度插件如 NVIDIA K8s Device Plugin或专业的 MLOps 平台来池化管理 GPU 资源提高利用率。冷热模型分离对于不常访问的模型可以将其权重存储在低速大容量磁盘上需要时再加载到 GPU 内存节省宝贵的显存资源。考虑混合部署对于实时性要求不高的批处理任务如数据标注、内容审核可以使用 CPU 集群进行推理虽然慢但成本极低。从快速体验的 Ollama到灵活微调的 Llama-Factory再到高性能部署的 vLLM我们完成了一个完整的国产大模型本地化应用闭环。关键在于根据你的场景选择合适的技术栈个人学习或原型验证Ollama 足矣需要定制模型能力用 Llama-Factory 进行 LoRA 微调面向生产提供服务则必须采用 vLLM 这类工业级引擎。下一步你可以探索更高级的主题例如使用Docker容器化你的模型服务以实现环境一致性研究GGUF量化格式以便在更多设备甚至 Mac M系列上运行或者尝试多模态模型如 Qwen-VL的微调与部署。大模型技术迭代迅速但掌握了部署、微调、服务化这些核心工程能力你就能快速地将最新的模型研究成果应用到实际业务中。