
Xinference 内置模型 Yi-200k 部署指南262K 长上下文大模型的启动、引擎选择与推理调用【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference本篇技术指南以 Xinference 内置模型 Yi-200k 的官方模型文档为骨架详细介绍 01.AI 出品、具备 262144 token 超长上下文的 Yi-200k 系列模型在 Xinference 中的两种内置规格6B 与 34B、支持的推理引擎、模型仓库来源与精确版本信息并给出可直接复制的启动命令、参数说明以及启动后的推理调用方式。读完本文你将掌握如何在一行命令内把 Yi-200k 部署为生产可用的 OpenAI 兼容推理服务并理解其内置模型注册表llm_family.json与文档、命令行之间的映射关系。Yi-200k 模型概述根据官方模型文档 yi-200k.rstYi-200k 是 Xinference 内置支持的一个长上下文大语言模型系列其核心元信息如下属性值Context Length上下文长度262144Model Name模型名Yi-200kLanguages支持语言en, zh英文、中文Abilities能力generate文本生成Description描述The Yi series models are large language models trained from scratch by developers at 01.AI.Yi 系列是 01.AI 开发者从零训练的大语言模型需要特别强调的是262144约 262K的上下文长度这是该模型系列最突出的技术特征单次推理可以容纳约 26 万 token 的输入输出窗口非常适合长文档分析、长代码仓库理解、超长对话记忆等场景。这些元信息并非孤立的文档描述而是与仓库内置模型注册表一一对应。在 llm_family.json 中Yi-200k条目version: 2精确记录了context_length: 262144、model_lang: [en, zh]、model_ability: [generate]与完全一致的model_description文档与源码数据完全同源。两种内置规格Model Spec详解Yi-200k 在 Xinference 中内置了6 Billion与34 Billion两种尺寸的规格均以pytorch格式发布。官方文档将两者分别列为 Model Spec 1 与 Model Spec 2Spec 1Yi-200k (pytorch, 6B)属性值Model FormatpytorchModel Size (in billions)6Quantizationsnone不提供量化版本EnginesvLLM、Transformers、SGLangModel ID01-ai/Yi-6B-200K在 llm_family.json 中6B 规格还记录了三个模型仓库的具体来源与版本固定信息比 RST 文档更为精确Hugging Face01-ai/Yi-6B-200Kmodel_revision固定为70649e36d43f91dff1357b576e6713cac03c1d4cModelScope01ai/Yi-6B-200Kmodel_revision为masterOpenMind Hubwuhaicc/Yi-6B-200K。Spec 2Yi-200k (pytorch, 34B)属性值Model FormatpytorchModel Size (in billions)34QuantizationsnoneEnginesvLLM、Transformers、SGLangModel ID01-ai/Yi-34B-200K对应地llm_family.json 中 34B 规格的仓库来源为Hugging Face01-ai/Yi-34B-200Kmodel_revision固定为591ae83b8f9c269700ef27f9dbd548934d800302ModelScope01ai/Yi-34B-200Kmodel_revision为master。工程提示官方文档将两者统称为 Yi-200k实际启动时必须通过--size-in-billions区分 6B 与 34B否则 Xinference 无法在注册表中唯一确定模型规格。内置注册表文档与配置的同源关系理解 Yi-200k 的部署方式有必要先了解这些模型信息从哪里来。Xinference 将所有内置 LLM 的规格统一定义在 llm_family.json 中并在 llm_family.py 中加载解析该 JSON 中的每个条目对应一个LLMFamilyV2模型族对象定义于 llm_family.py包含model_name、context_length、model_lang、model_ability、model_specs、architectures、virtualenv等字段所有内置条目被收集进BUILTIN_LLM_FAMILIES列表见 llm_family.pymatch_llm/match_model_size等函数见 llm_family.py 与 llm_family.py负责在用户指定--model-name --size-in-billions --model-format --quantization后精确匹配出唯一的模型规格而你在文档站点看到的 yi-200k 页面正是由文档生成脚本结合 llm.rst.jinja 模板从该 JSON 自动渲染出来的因此二者字段一一对应、不会漂移。在 JSON 中还可以看到 Yi-200k 的架构元信息见 llm_family.jsonarchitectures: [LlamaForCausalLM]—— 基于 Llama 类 CausalLM 架构这也是它能被 Transformers / vLLM / SGLang 三个引擎加载的基础model_type: llamavirtualenv.packages按引擎条件声明依赖例如 Transformers 引擎安装#transformers_dependencies#vLLM 引擎安装#vllm_dependencies#与#system_numpy#Xinference 会据此为不同引擎创建/选择隔离的虚拟环境。启动命令与参数详解官方文档为两种规格各给出了一条标准启动命令。以 6B 规格为例xinference launch --model-engine ${engine} --model-name Yi-200k --size-in-billions 6 --model-format pytorch --quantization ${quantization}34B 规格只需把--size-in-billions改为34xinference launch --model-engine ${engine} --model-name Yi-200k --size-in-billions 34 --model-format pytorch --quantization ${quantization}其中${engine}与${quantization}是占位符需要按上文规格替换为实际值。由于 Yi-200k 仅有none一种量化选项--quantization应填none--model-engine可在vllm、transformers、sglang三者中选择。各参数含义如下参数作用Yi-200k 可选值--model-engine选择推理引擎vllm、transformers、sglang--model-name内置模型族名称Yi-200k--size-in-billions模型规格十亿参数6或34--model-format模型格式pytorch--quantization量化方式none启动后 Xinference 会自动根据上述四元组name size format quantization在BUILTIN_LLM_FAMILIES中完成匹配校验。若填写的引擎、格式或量化与注册表不符会抛出类似Model Yi-200k cannot be run on engine {engine}, with format {format}, size {size} and quantization {quantization}.的明确错误该错误文案定义于 llm_family.py帮助你快速定位参数问题。补充常用启动选项在实际部署中通常还需要追加以下选项这些均属于 Xinference 通用启动能力详见 模型启动指南xinference launch \ --model-engine vllm \ --model-name Yi-200k \ --size-in-billions 6 \ --model-format pytorch \ --quantization none \ --endpoint http://127.0.0.1:9997 \ --n-gpu 1--endpoint指定 supervisor 服务地址默认http://127.0.0.1:9997--n-gpu指定使用的 GPU 数量34B 规格建议按显存情况调整--replica N指定副本数可在多 GPU 环境横向扩展实例Xinference 会自动负载均衡--env A 0为单个模型注入自定义环境变量自 v1.8.1 起支持。引擎选择建议Yi-200k 官方支持 vLLM、Transformers、SGLang 三个引擎选择时需结合硬件与场景TransformersHugging Face 生态的标准引擎兼容性最好、便于调试但吞吐相对有限对 262K 长上下文序列较长时间开销和显存占用会更显著vLLM生产环境的高吞吐首选基于分页注意力PagedAttention的显存管理与连续批处理continuous batching对长上下文推理尤其友好可通过--env VLLM_USE_V1 0/1控制 V1/V0 版本参考 launch.rst 中对 vLLM 版本切换的说明SGLang与 vLLM 定位相近的高性能服务化引擎同样适合长上下文与高并发场景。引擎对应的依赖包由模型族配置中的virtualenv.packages按条件自动装配见 llm_family.json无需手工安装。所有引擎最终都通过 core.py 中定义的LLM抽象基类统一接入 Xinference 的模型管理、副本与请求调度体系。启动后的推理调用模型启动成功后即可通过 OpenAI 兼容的 REST API 或 Python 客户端调用。以下是使用 Python 客户端restful_client.py完成「启动 对话」的完整流程from xinference.client import Client client Client(http://127.0.0.1:9997) # 与命令行等价启动 Yi-200k 6BvLLM 引擎pytorch 格式无量化 model_uid client.launch_model( model_nameYi-200k, model_enginevllm, size_in_billions6, model_formatpytorch, quantizationnone, ) # 使用 262K 长上下文进行对话 resp client.chat( model_uid, [ {role: system, content: 你是一个擅长长文档分析的中文助手。}, {role: user, content: 请基于以下长文本总结要点……}, ], ) print(resp[choices][0][message][content])常用管理操作# 查看已启动的模型含 model_uid、状态、引擎、规格等 xinference list # 终止指定模型 xinference terminate --model-uid model_uid长上下文使用注意事项Yi-200k 的 262144 token 上下文是它区别于常规模型的核心能力部署时建议留意以下几点显存规划上下文长度越大KV Cache 占用越高。6B 规格显存压力较小34B 规格建议使用 vLLM/SGLang 等对 KV Cache 管理更高效的引擎并按显存设置合理的max_num_seqs、max_model_len等引擎参数可通过--env注入输入限制虽然模型窗口长达 262K但实际输入会受引擎的max_model_len与 Xinference 服务端校验约束超长输入需要确认引擎侧配置匹配校验--size-in-billions与--model-format、--quantization必须与注册表完全一致建议直接复制官方文档命令并只替换占位符避免手误。小结本文以官方模型文档 yi-200k.rst 为核心完整覆盖了 Yi-200k 的 262K 上下文特性、6B/34B 两种内置规格、Hugging Face / ModelScope / OpenMind Hub 的多仓库来源与精确版本、三个支持引擎的启动命令并深入到了 llm_family.json 这一同源注册表解释了文档、配置与启动校验之间的对应关系。无论是首次尝试长上下文模型还是为长文档/长对话场景规划生产部署你都可以直接参考文中的命令与 Python 示例完成从启动到调用的全流程。【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考