ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

如何10分钟在单张GPU上跑通Ornith-9B:从下载权重到第一次对话的零基础教程

2026/10/8 7:04:20 拓冰建站 浏览量
如何10分钟在单张GPU上跑通Ornith-9B:从下载权重到第一次对话的零基础教程 如何10分钟在单张GPU上跑通Ornith-9B从下载权重到第一次对话的零基础教程【免费下载链接】Ornith-1项目地址: https://gitcode.com/gh_mirrors/or/Ornith-1Ornith-9B 是 Ornith 开源自改进大模型家族中的 90 亿参数稠密模型原生支持工具调用与长链推理拥有 256K 超长上下文可在单张 80GB 显存的 GPU 上完整运行。本教程带你按下载权重 → 启动服务 → 完成第一次对话三步走完全流程在自己的机器上免费跑起这个 MIT 协议的智能体编程模型。一、开始之前先确认你的GPU够不够用官方推荐稠密版 9Bbf16 全精度跑在单张 80GB 显存 GPU如 A100-80G、H100 等数据中心级显卡。开始动手前对照下表快速确认一下检查项建议要求说明GPU单张 80GB 显存bf16 全精度部署显存不足可看第五节常见问题推理框架vLLM ≥ 0.19.1 或 SGLang ≥ 0.5.9版本过旧无法支持 Ornith 的工具调用解析采样参数temperature0.6、top_p0.95、top_k20官方推荐值直接照抄即可小提示Ornith 系列是推理模型每次回答会先输出一段think思考过程再给出最终答案。启动时开启对应的解析器后思考内容会单独放在reasoning_content字段里返回不会和答案混在一起。二、第一步下载 Ornith-9B 模型权重前往 Hugging Face 模型库搜索 Ornith 官方账号下的检查点任选其一检查点格式适合场景Ornith-1.5-9Bbf16✅ 本教程主角单卡部署与微调Ornith-1.5-9B-Mobile量化iPhone / Android 端侧推理Ornith-1.0-9B-GGUFGGUF 量化低显存设备走 llama.cpp / Ollama两代模型背景不同Ornith-1.5是最新版本把自我搭建脚手架扩展为完整的自改进循环——模型自己提出新任务、生成任务专属脚手架再产出解法用于强化学习Ornith-1.0则是首次发布联合优化脚手架与最终解答。两者均为MIT 协议、全球可访问、无地区限制可自由使用。本教程以Ornith-1.5-9B为例。三、第二步用 vLLM 一条命令启动本地服务权重就位后一条命令就能拉起服务。vLLM 是 9B 单卡场景下最快的启动方式vllm serve deepreinforce-ai/Ornith-1.5-9B \ --served-model-name Ornith-1.5 \ --host 0.0.0.0 --port 8000 \ --max-model-len 262144 \ --gpu-memory-utilization 0.90 \ --enable-prefix-caching \ --enable-auto-tool-choice --tool-call-parser qwen3_xml \ --reasoning-parser qwen3 \ --trust-remote-code几个关键参数说明--served-model-name Ornith-1.5统一别名之后调 API 时直接用它--max-model-len 262144解锁完整 256K 上下文显存紧张时可调小--tool-call-parser/--reasoning-parser分别开启工具调用与推理解析跑智能体任务时缺一不可注意稠密 9B 单卡即可跑不需要张量并行参数——--tensor-parallel-size是给 35B / 397B 的 MoE 模型分片用的。如果你更习惯 SGLang用python -m sglang.launch_server加--reasoning-parser qwen3 --tool-call-parser qwen3_coder即可完整参数见 README.md 的 SGLang 一节。四、第三步和 Ornith-9B 完成第一次对话服务起来后就是一个标准的 OpenAI 兼容接口。用 Python 客户端几行代码就能开口说话from openai import OpenAI client OpenAI(base_urlhttp://localhost:8000/v1, api_keyEMPTY) resp client.chat.completions.create( modelOrnith-1.5, messages[{role: user, content: 写一个判断素数的 Python 函数 is_prime(n)}], temperature0.6, top_p0.95, ) print(思考过程:, resp.choices[0].message.reasoning_content) print(最终答案:, resp.choices[0].message.content)当终端里分别打印出推理内容和最终答案你的 Ornith-9B 就正式活了 。因为接口完全兼容 OpenAI 协议curl、Node.js 或任意语言的 OpenAI SDK 都能直接对接同一个/v1/chat/completions端点。五、常见问题速查表症状原因解决办法启动报 OOM 显存不足显存不够调小--max-model-len或改用 4-bit 加载见 README返回里没有reasoning_content未开启推理解析器启动命令补上--reasoning-parser qwen3调 API 提示模型不存在名字对不上请求里的model要与--served-model-name完全一致工具调用没被解析出来缺少解析参数补上--enable-auto-tool-choice --tool-call-parser qwen3_xml⚡显存有限换一条路可以跳过 vLLM直接拉取Ornith-1.0-9B-GGUF量化权重用 llama.cpp 或 Ollama 跑本地推理一条ollama run就能开聊具体命令在 README.md 的 llama.cpp / Ollama 一节。六、跑通之后还能玩什么第一次对话完成后你就可以把 Ornith-9B 接入主流智能体框架——它开箱即用地支持标准函数调用可作为 OpenHands、Hermes、OpenCode 等框架的大脑来自动写代码、跑终端命令也可以用 Unsloth Studio 做本地 4-bit 推理与微调。各框架的环境变量接法都已整理在 README.md。想确认开源许可与商用范围查看 LICENSE9B / 35B / 397B 全家族的完整基准数据表同样收录在 README.md 中。从下载权重到第一次对话全程不超过 10 分钟——你的本地智能体编程助手现在就能干活了 【免费下载链接】Ornith-1项目地址: https://gitcode.com/gh_mirrors/or/Ornith-1创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考