ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Eigent 本地模型部署:vLLM、Ollama、LM Studio 三条路线怎么走

2026/9/11 3:29:14 拓冰建站 浏览量
Eigent 本地模型部署:vLLM、Ollama、LM Studio 三条路线怎么走 Eigent 本地模型部署vLLM、Ollama、LM Studio 三条路线怎么走【免费下载链接】eigentEigent: The Open Source Cowork Desktop - Local and Free Alternative to Claude Cowork and Codex项目地址: https://gitcode.com/GitHub_Trending/ei/eigentEigent 本地模型部署通过 OpenAI 兼容 API 把 Ollama、vLLM、LM Studio 等本地推理引擎接入 Eigent让整个 AI 工作流在本机完成推理。本文讲清机制、选型与连接验证。一、本地模型部署在 Eigent 里是怎么运作的机制很简单本地推理引擎对外暴露一个 OpenAI 兼容的 API 端点通常是.../v1Eigent 在设置里填入这个端点 URL 和模型类型之后所有请求都发往本机。也就是说Eigent 本身不关心你底层用的是哪套推理框架——只要它提供/v1/chat/completions这类标准接口Eigent 就能像调用云端模型一样调用它。推理数据不离开你的机器。二、选型vLLM / Ollama / LM Studio 怎么选三个引擎的定位差异可以一张表看明白维度OllamavLLMLM Studio适用场景日常开发、快速试验高吞吐、批量或多并发推理不想碰命令行、图形化试用上手难度低一条命令拉模型中需了解 GPU 显存与参数最低全程鼠标操作性能取向够用即可CPU/单卡均可追求吞吐和延迟显存利用率高跟随本地硬件无性能调优空间如果还看到 SGLang它是另一类面向大规模服务的推理框架Eigent 同样支持默认端点为http://localhost:30000/v1本文不展开。Eigent 里还预置了 LLaMA.cpphttp://localhost:8080/v1配置方式相同。三、5 分钟跑通用 Ollama 接入第一个本地模型Ollama 是路径最短的起点装好后只需一条命令拉取模型ollama pull qwen2.5:7b拉取完成后Ollama 服务默认监听http://localhost:11434。Eigent 的默认端点已预填为http://localhost:11434/v1。注意末尾的/v1OpenAI 兼容 API 挂在这个路径下如果你手填了裸地址http://localhost:11434Eigent 会检测并在输入框失焦时自动补上/v1。模型类型model type填qwen2.5:7b与ollama list里显示的模型名一致验证即可。四、追求性能用 vLLM 起一个高吞吐服务当你需要同时跑多个智能体任务、批量生成或者加载较大的开源模型时vLLM 的 PagedAttention 与连续批处理能把显存利用率和吞吐拉满vllm serve Qwen/Qwen2.5-1.5B-Instruct服务起来后默认端点为http://localhost:8000/v1模型类型填实际加载的模型名例如Qwen/Qwen2.5-1.5B-Instruct。显存不足时可通过启动参数控制上下文长度避免加载即 OOM。五、不想敲命令LM Studio 图形化接入LM Studio 把下载模型、本地推理、起服务合并进一个界面在 LM Studio 中下载并打开一个 Chat 模型在 Developer 页启动本地服务器记下服务端口默认 1234。Eigent 端预填端点为http://localhost:1234/v1模型类型填 LM Studio 里显示的名称即可。六、把三种引擎接进 Eigent端点、模型类型与连接验证三种引擎在 Eigent 里的配置入口完全一致集中在设置页的「本地模型」区域只是填的端点不同引擎默认端点 URL模型类型示例Ollamahttp://localhost:11434/v1qwen2.5:7bvLLMhttp://localhost:8000/v1Qwen/Qwen2.5-1.5B-InstructLM Studiohttp://localhost:1234/v1与 LM Studio 显示名一致填写要点端点 URL必须是 OpenAI 兼容路径一般以/v1结尾。本地引擎不需要 API KeyEigent 会按无需密钥处理。模型类型与服务端实际加载的模型名严格一致这是最常见的报错来源。验证点验证后Eigent 会向后端发起一次真实调用检查模型可用性并额外确认该模型支持 function calling——这是多智能体工作流的硬性要求。验证通过会弹出成功提示不通过会显示服务端返回的具体错误信息。设为默认验证成功后可以把它设为默认工作模型。之后新建会话默认走本地推理切回云端模型只需在模型选择处改回。七、踩坑排查连接失败、验证报错、性能不达预期怎么定位现象排查方向验证时连接超时或被拒绝确认推理服务进程在跑、端口未被占用跨机器访问时检查防火墙是否放行 11434/8000/1234 端口请求返回 404Ollama端点缺少/v1后缀确认填的是http://localhost:11434/v1而不是裸地址验证提示模型不支持 function calling换用 Instruct/Chat 版模型纯基座模型或小型模型通常不具备工具调用能力模型类型与端点都正确但仍报错核对模型名拼写区分大小写并确认该模型已在服务端加载完成生成速度慢于预期换低参数或量化版本模型检查 GPU 显存是否充足vLLM 下调上下文长度收尾回顾这条主线本地引擎负责推理OpenAI 兼容 API 负责协议统一Eigent 负责把端点、模型类型和验证收进同一套配置界面。无论换 Ollama、vLLM 还是 LM Studio你改的只是端点地址。更多本地模型支持的默认端点与自动纠错逻辑可以参考仓库里的 src/pages/Agents/localModels.ts 和 backend/app/controller/model_controller.py。【免费下载链接】eigentEigent: The Open Source Cowork Desktop - Local and Free Alternative to Claude Cowork and Codex项目地址: https://gitcode.com/GitHub_Trending/ei/eigent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考