
InternVL3.5-8B生产级部署LMDeploy搭建OpenAI兼容API服务的完整攻略【免费下载链接】InternVL3_5-8B-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-8B-HFInternVL3.5-8B-HF 是上海 AI 实验室开源的 8B 多模态大模型看图、读图、推理、写代码样样在行。本文将带你用 LMDeploy 推理框架仅用一条命令把它部署为OpenAI 兼容 API 服务覆盖环境准备、一键启动、接口调用与生产级调优全流程——即使你是第一次部署多模态大模型也能照着做完整套。 先认识 InternVL3.5-8B为什么值得部署InternVL3.5 系列是开源多模态大模型MLLM中的第一梯队核心亮点包括多模态全能遵循 ViT–MLP–LLM 架构视觉编码器InternViT-300M Qwen3-8B 语言模型图文理解、OCR、图表分析、数学推理均可胜任级联强化学习训练通过 CPT → SFT → CascadeRL 四阶段训练推理能力相比上一代最高提升 16%单卡可跑8B 版本总参数仅 8.5B0.3B 视觉 8.2B 语言官方确认 30B 以内均可在单张 A100 上部署消费级 GPU 配量化后同样有机会HF 标准格式本仓库的-HF版本完全兼容 HuggingFace Transformers 生态配置清晰、加载简单下面这张图就是模型典型的输入素材——对多模态模型来说看懂一只趴在木箱上的小熊猫正是它的基本功 部署完成后的服务就可以用类似describe this image的提示词让模型描述上图这正是后文 OpenAI 兼容接口的典型用法。️ 硬件要求与环境准备一键安装步骤最低配置参考项目建议配置说明GPU单卡 24GB 显存A10/3090/4090/A100bf16 原精度部署GPU可选单卡 16GB使用 8-bit 量化后部署显存占用约 16–20GB8.5B 参数 KV Cache会话长度32K tokens官方推荐 session_len32768两步完成环境安装# 1. 安装 LMDeploy需 0.9.1 及以上版本 pip install lmdeploy0.9.1 # 2. 安装 OpenAI SDK用于调用兼容接口 pip install openaiLMDeploy 把复杂的多模态推理封装成与 LLM 一致的简单管线支持 PyTorch / TurboMind 双后端无需自己折腾视觉编码器的调度逻辑。 一条命令启动服务LMDeploy 部署完整步骤模型文件就绪后本仓库目录即为完整模型权重执行以下命令即可拉起 OpenAI 兼容的 API 服务lmdeploy serve api_server OpenGVLab/InternVL3_5-8B-HF \ --server-port 23333 \ --tp 1 \ --backend pytorch关键参数速查参数含义新手建议--server-port服务端口默认 23333可随意改--tp张量并行卡数8B 用 138B 用 2241B 用 8--backend推理后端新手用pytorch兼容性最好启动成功后服务会在http://0.0.0.0:23333/v1暴露与 OpenAI 完全一致的 RESTful 接口任何支持 OpenAI 协议的工具IDE 插件、Chat 前端、Agent 框架都可以直接接入一行代码都不用改。 调用 OpenAI 兼容接口3 行代码上手既然接口与 OpenAI 完全对齐调用方式也就是标准的 SDK 写法from openai import OpenAI client OpenAI(api_keyEMPTY, base_urlhttp://0.0.0.0:23333/v1) model_name client.models.list().data[0].id response client.chat.completions.create( modelmodel_name, messages[{role: user, content: [ {type: text, text: describe this image}, {type: image_url, image_url: {url: https://your-oss.com/tiger.jpeg}} ]}], temperature0.8, top_p0.8) print(response)图片支持 URL 或 base64 传入文本、图文混合消息都能处理——这就是OpenAI 兼容的实战价值换个 base_url你的应用从 GPT 无缝切换到 InternVL。️ 进阶玩法多图输入与多轮对话多图输入把多张图片放进同一个列表并在提示词中编号Image-1: ... Image-2: ...多轮对比、文档问答都能做注意多图会增加 token 数记得适当调大上下文窗口多轮对话使用 LMDeploy 的pipe.chat接口传入session即可维持上下文实现先描述图片、再追问细节的连续问答思考模式设置官方 Thinking 系统提示词后模型会先输出think推理过程再给答案官方建议配合do_sampleTrue、temperature0.6避免重复 模型文件结构权重与配置都在哪本仓库是标准的 HF 格式模型目录各文件分工如下文件作用model-00001-of-00004.safetensors模型权重分片 1共 4 片model.safetensors.index.json权重索引记录每个参数所在分片config.json核心架构配置Qwen3-8B 语言模型 InternViT-300M 视觉编码器generation_config.json生成默认参数bos/eos token 等tokenizer.json、vocab.json分词器与词表preprocessor_config.json图像预处理配置448×448 输入video_preprocessor_config.json视频帧预处理配置chat_template.jinja对话模板决定消息如何拼成 promptREADME.md项目完整文档架构、训练细节、全部用法从 config.json 可以看到语言模型基于 Qwen336 层、40K 上下文视觉编码器为 24 层 InternViT二者以 bf16 精度存储——这正是单卡可部署的原因。⚙️ 生产级部署调优清单量化降显存显存紧张时可用 BNB 8-bit 量化加载load_in_8bitTrue8B 模型可压到 16GB 级别多卡扩容升级到大模型时调大--tp38B 设 2241B 设 8无需改代码上下文长度默认会话 32K多图或长文档场景按需调大session_len版本要求若直接走 Transformers 加载需transformers4.52.1LMDeploy 路线需0.9.1框架选择LMDeploy 与 vLLM 均可部署本系列GPT-OSS 底座的 20B 版本官方推荐 vLLM解耦部署DvDInternVL3.5 提出视觉-语言分离部署方案将 ViT 与 LLM 拆到不同 GPU高并发生产环境可显著提升吞吐❓ 新手常见问题FAQQ1模型下载慢怎么办可直接使用本地模型目录路径启动服务或将权重放到内网后以本地路径传入lmdeploy serve api_server。Q2服务启动报显存不足优先换用 8-bit 量化后端或减小session_len。Q3非 OpenAI 客户端能用吗可以。只要客户端支持自定义base_url如各类 Chat 前端、LangChain 类框架填http://你的IP:23333/v1即可接入。Q4图片和视频都支持吗支持。仓库自带 preprocessor_config.json 与 video_preprocessor_config.json 两套预处理配置视频理解同样开箱即用。✅ 小结InternVL3.5-8B-HF LMDeploy 的组合是目前把开源多模态大模型推向生产环境最省心的路线之一一条命令起服务、标准 OpenAI 接口、单卡即可运行。跟着本文走完安装 → 启动 → 调用三步你手上就有一个能看图、能推理、能对话的多模态 AI 服务了。【免费下载链接】InternVL3_5-8B-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-8B-HF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考