ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

《开源大模型食用指南》:LM Studio 本地部署调用 gpt-oss-20b 全流程——模型下载、OpenAI 兼容 API 与 MCP 工具调用实战

2026/9/20 22:24:12 拓冰建站 浏览量
《开源大模型食用指南》:LM Studio 本地部署调用 gpt-oss-20b 全流程——模型下载、OpenAI 兼容 API 与 MCP 工具调用实战 《开源大模型食用指南》LM Studio 本地部署调用 gpt-oss-20b 全流程——模型下载、OpenAI 兼容 API 与 MCP 工具调用实战【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/datawhalechina/self-llm本篇指南以 gpt-oss-20b 为例完整讲解如何在个人电脑上通过 LM Studio 完成大模型的本地部署与调用从安装客户端、在线/离线获取模型到界面与终端双通道对话再到以 OpenAI 兼容接口进行 Python 编程调用最后通过 MCP 协议为模型挂载外部工具让模型真正动手干活。读完本文你将掌握一套不依赖云服务、可在离线环境复用的本地 LLM 落地路径。为什么选择 LM Studio 在本地运行 gpt-oss-20b在本地运行大型语言模型LLMs已经成为许多开发者和爱好者的热门选择它带来了隐私性、定制化和离线使用的可能性。虽然像 Ollama 这样的工具提供了强大的命令行界面来管理和运行本地模型但 LM Studio 则为追求更图形化、更直观交互体验的用户提供了一个极具吸引力的替代方案。与 Ollama 相比LM Studio 拥有更丰富的用户界面模型搜索、下载、加载、对话、服务启动全部可视化完成无需记忆命令同样强大的模型生态支持可以直接拉取主流开源模型仓库中的模型并自动按硬件情况推荐合适的量化版本更易于上手的交互体验适合零基础用户从安装到对话一条龙走完出色的离线可用性非常适合在无网络环境下部署和使用大模型是一个出色的本地 LLM 应用产品。而在本仓库的 gpt-oss 模型目录 中vLLM 部署文档 对 gpt-oss 系列模型给出了明确的定位GPT-OSS 是 OpenAI 推出的开源大语言模型系列包含 gpt-oss-120b 与 gpt-oss-20b 两个版本均采用 MoEMixture-of-ExpertsTransformer 架构支持 128K 上下文长度采用 Apache 2.0 许可协议。其中gpt-oss-20b在常见基准测试中表现接近 OpenAI o3-mini且可在仅配备 16GB 内存的边缘设备上运行是设备端应用、本地推理和快速迭代的理想选择两个模型在工具使用、少样本函数调用、CoT 推理等能力上表现突出。这正与 LM Studio 的本地部署场景高度契合——用消费级硬件就能把具备强工具调用能力的 MoE 模型跑在桌面上。本教程将带你逐步走完以下流程下载与安装快速获取并安装 LM Studio 应用程序模型下载在线在 LM Studio 界面内搜索、选择并下载模型以 gpt-oss-20b 为例模型安装离线针对网络不佳或希望手动管理模型文件的用户展示如何从魔搭社区等来源获取模型文件并放入 LM Studio 模型库模型测试通过 LM Studio 内建的聊天界面与 gpt-oss-20b 交互本地 API 调用启动 LM Studio 本地服务器使用 Python 与 OpenAI 库通过 API 调用已加载的 gpt-oss-20b实现程序化交互MCP 工具调用利用 LM Studio 的 MCP 客户端能力为模型挂接外部工具让模型完成真实任务。安装 LM StudioLM Studio 适用于 Windows、macOS 和 Linux 三大平台前往官方网站的 Download 页面选择适合你系统的安装包下载即可。下载后按安装向导逐步操作Linux 用户注意执行权限与依赖完成安装后首次启动会引导初始化模型存储目录。安装完成并启动后建议先确认模型的存储路径与本地服务开关的位置后续下载模型和开启 API 服务都会用到这些入口。下载 gpt-oss-20b 模型在线与命令行两种方式方式一界面内搜索下载在线打开 LM Studio 后通过界面左下角的放大镜进入模型搜索页输入gpt-oss-20b即可看到对应模型卡片。LM Studio 会根据你电脑的硬件配置给出兼容性提示选择适配自己显卡/内存的版本后点击下载按钮即可。以 gpt-oss-20b 为例模型体积约十余 GB下载完成后会自动出现在本地模型库中。方式二命令行下载lms CLILM Studio 从 0.3 版本起提供lms命令行工具可在系统终端Windows 为 CMD/PowerShellmacOS 为终端中直接拉取模型适合脚本化或远程服务器场景# 下载 20B 版本 lms get openai/gpt-oss-20b # 或者下载 120B 全尺寸版本需要更大显存 lms get openai/gpt-oss-120b硬件参考根据仓库中 vLLM 部署文档 的说明gpt-oss-20b 仅需约 16GB 内存/显存即可运行可在消费级设备上流畅使用gpt-oss-120b 则建议在显存 ≥60GB 的环境如单张 H100 或多 GPU 设置下运行。请据此选择下载的模型规模与量化等级。方式三离线安装网络不佳时的备选方案如果网络环境不佳、在线下载速度缓慢可以改用下载模型文件 手动放置的离线安装方式从魔搭社区等模型仓库获取 gpt-oss-20b 对应的 GGUF 量化文件下载后放入 LM Studio 的模型存储目录中Windows 下通常为~/.lmstudio/models/下的组织名/模型名目录结构然后回到 LM Studio 界面刷新即可看到该模型。仓库中 03-Qwen3-7B-Instruct Windows LMStudio 部署.md 的离线安装小节以 Qwen3-8B 为例完整演示了定位模型存储地址 → 创建模型目录 → 放入下载文件 → 刷新识别的流程可作同类参考。离线安装时请依据自己显卡显存选择合适量化档位如 Q8/Q4/Q3避免显存不足或精度损失过大。运行模型并开始对话界面聊天加载模型即聊模型下载完成后点击左侧对话标签页在顶部选择并加载openai/gpt-oss-20b模型即可直接在聊天界面中与模型交互。终端聊天lms chat除了界面聊天lms命令行同样支持直接对话首次使用前请先启动 LM Studio 并完成初始化后续命令才能正常连接本地运行时lms chat openai/gpt-oss-20b该命令会启动一个交互式终端会话适合在 SSH 或无图形界面的服务器环境中使用。通过本地 API 以 OpenAI 兼容方式调用 gpt-oss-20bLM Studio 内置本地推理服务器提供与 OpenAI 完全兼容的 REST API这意味着现有的 OpenAI SDK 代码几乎可以零改动地指向本地模型。开启本地服务在 LM Studio 的开发者/服务器页面中选择已加载的 gpt-oss-20b 模型点击启动Serve服务默认监听http://localhost:1234。启动后右侧会展示服务状态与可用端点例如GET /v1/models查询当前可用的模型列表POST /v1/chat/completions对话补全接口POST /v1/completions文本补全接口。Python 脚本调用准备 Python 环境并安装 OpenAI 库pip install openai然后运行以下脚本from openai import OpenAI client OpenAI( base_urlhttp://localhost:1234/v1, # LM Studio 本地服务地址 api_keynot-needed # LM Studio 本地服务不校验 API Key任意字符串即可 ) result client.chat.completions.create( modelopenai/gpt-oss-20b, # 使用本地加载的模型 messages[ {role: system, content: You are a helpful assistant.}, {role: user, content: Explain what MXFP4 quantization is.} ] ) print(result.choices[0].message.content)几点说明base_url指向本地1234端口的/v1路径与 OpenAI API 的请求结构完全一致model字段填写 LM Studio 中加载的模型标识openai/gpt-oss-20b由于是本地服务api_key不会被校验填入任意字符串即可若需要局域网内其他机器访问可在 LM Studio 设置中开启在本地网络提供服务选项并将base_url中的localhost替换为服务器局域网 IP。值得注意的是gpt-oss-20b 本身支持reasoning_effort等生成参数调节推理深度。仓库中 EvalScope 评测文档 展示了通过extra_body: {reasoning_effort: high}开启高推理水平的方式在本地 API 调用中同样可以传入类似参数来控制模型思考的投入程度。与 vLLM 服务化部署的定位差异LM Studio 面向的是个人桌面与离线场景开箱即用、界面友好若你需要更高吞吐的服务化部署如并发压测、生产环境仓库 vLLM 部署文档 提供了完整的 vLLM 启动方案vllm serve openai/gpt-oss-20b即可拉起 OpenAI 兼容服务而 EvalScope 评测文档 则演示了如何基于该服务进行推理速度与并发性能测试。两者定位互补桌面交互与离线演示选 LM Studio规模化服务与性能评测选 vLLM EvalScope。通过 MCP 为 gpt-oss-20b 扩展工具能力大模型的价值不止于聊天更在于干活。LM Studio 本身就是一个 MCPModel Context Protocol客户端这意味着你可以将 MCP 服务器接入 LM Studio为 gpt-oss 模型提供外部工具让模型自主决定何时调用工具来完成真实任务。MCP 配置入口LM Studio 的 MCP 服务器配置保存在~/.lmstudio/mcp.json中通过编辑该文件即可注册自定义 MCP 服务器。除此之外更灵活的方案是直接使用 LM Studio 官方 SDK 在 Python/TypeScript 代码中完成工具调用与本地函数执行SDK 提供 Python 与 TypeScript 两个版本。核心是.act()调用它允许你向 gpt-oss 提供工具列表模型会在调用工具与推理之间自主切换直到完成你的任务。安装 SDK使用 pip 或 uv 均可安装 Python 版 SDKpip install lmstudiouv pip install lmstudio在 Python 脚本中让模型调用工具下面这个完整示例为 gpt-oss-20b 提供了在本地文件系统创建文件的单一工具并实现了带流式输出的终端对话循环。你可以以此为起点扩展任意数量的工具import readline # 启用输入行编辑功能支持历史记录和快捷键 from pathlib import Path import lmstudio as lms # 定义一个可以被模型调用的工具函数让AI助手能够创建文件 # 工具函数本质上就是普通的Python函数可以实现任何功能 def create_file(name: str, content: str): 创建指定名称和内容的文件。 Args: name: 文件名支持相对路径和绝对路径 content: 文件内容 Returns: 操作结果的描述信息 dest_path Path(name) if dest_path.exists(): return 错误文件已存在无法覆盖。 try: dest_path.write_text(content, encodingutf-8) except Exception as exc: return f错误文件创建失败 - {exc!r} return f文件 {name} 创建成功。 def print_fragment(fragment, round_index0): 实时打印模型生成的文本片段实现流式输出效果。 Args: fragment: 包含生成内容的片段对象 round_index: 轮次索引.act()方法会自动传递此参数 Note: 设置默认参数使得此回调函数同时兼容 .complete() 和 .respond() 方法 print(fragment.content, end, flushTrue) # 初始化模型和聊天会话 model lms.llm(openai/gpt-oss-20b) # 加载OpenAI GPT-OSS 20B模型 chat lms.Chat(你是一个运行在用户计算机上的智能助手可以帮助用户完成各种任务。) # 主交互循环 while True: try: user_input input(用户直接回车退出: ) except EOFError: # 处理CtrlD等终端输入结束信号 print() break if not user_input.strip(): # 用户输入为空时退出程序 break # 将用户消息添加到聊天历史 chat.add_user_message(user_input) print(助手: , end, flushTrue) # 调用模型进行推理支持工具调用和流式输出 model.act( chat, # 聊天上下文 [create_file], # 可用的工具函数列表 on_messagechat.append, # 将完整响应添加到聊天历史 on_prediction_fragmentprint_fragment, # 流式输出回调 ) print() # 换行分隔每轮对话这段代码的核心机制可以拆解为三层工具定义即普通函数create_file就是一个普通 Python 函数带类型注解与清晰的 docstring——SDK 会据此把函数签名与描述序列化为模型可理解的工具定义模型看到的是有什么工具、参数是什么、干什么用.act()是工具调用循环的驱动器model.act(chat, [create_file], ...)将聊天上下文与工具列表交给模型模型在生成回复与发起工具调用之间自主迭代直到得出最终答案on_messagechat.append保证每一轮中间结果都回写进聊天历史维持多轮上下文流式输出回调print_fragment被逐片段调用实现打字机式的实时打印效果。运行该脚本后你可以直接对模型下达请帮我创建一个名为 hello.txt、内容为 Hello gpt-oss 的文件之类的指令模型会调用create_file工具并汇报执行结果。借助 MCP 协议这套模式可以无限扩展——连接文件系统、数据库、网络请求、代码执行器等外部能力这正是 gpt-oss 系列模型工具使用、少样本函数调用强项的落地体现。小结至此你已经走完了 gpt-oss-20b 本地部署调用的完整链路安装跨平台安装 LM Studio获得图形化的本地 LLM 管理体验取模型界面搜索、lms get命令行、离线文件放置三种方式任选对话界面聊天或lms chat终端会话双通道交互编程调用启动本地 OpenAI 兼容服务Python OpenAI 库一行切换即可对接工具化通过 MCP 与 lmstudio SDK 的.act()机制让模型自主调用外部工具完成任务。对于追求服务化高并发部署与性能评测的读者可继续阅读本仓库 gpt-oss 模型目录 下的 vLLM 部署教程、EvalScope 并发与基准测试以及 LoRA 微调、DPO 微调 等进阶内容形成从部署、评测到微调的完整技术栈。【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/datawhalechina/self-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考