ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Qwen3.6-35B 多模态模型 llama.cpp 部署实战:命令行、脚本与 API 服务全指南

2026/9/15 21:46:48 拓冰建站 浏览量
Qwen3.6-35B 多模态模型 llama.cpp 部署实战:命令行、脚本与 API 服务全指南 Qwen3.6-35B 多模态模型 llama.cpp 部署实战命令行、脚本与 API 服务全指南【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS想让一个能看图、说话开放未加内容过滤的多模态大模型跑在自家机器上目标模型是 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive基于 Qwen3.6-35B-A3B 开发文本、图像、视频都能进开放对话风格。本文覆盖它在 llama.cpp 里的完整落地路径——量化版本怎么选、源码怎么编译、命令行怎么聊、脚本怎么调、API 服务怎么开复制命令即可执行。硬件门槛与量化版本怎么选先对一下机器再决定下哪个文件内存32GB 起步64GB 及以上更从容显卡CUDA 架构显存 12GBRTX 3090 / 4090 一档体验最佳基础软件Git、GCC 或 Clang、CMake量化文件统一命名Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-量化.gguf按硬件对号入座量化体积适合硬件Q8_K_P约 44 GB高端 GPU / 服务器Q4_K_M约 21 GB中端 GPU默认推荐IQ2_M约 11 GB入门 GPU / 纯 CPU图像与视频理解还依赖配套的mmproj-...-f16.gguf投影文件随模型一起获取后文所有命令都假设它和模型文件在同一目录。模型文件与 llama.cpp 编译就位从模型镜像仓库下载上表中的量化文件与 mmproj 投影文件放入工作目录。克隆配套示例仓库本文使用的界面截图素材就在data/目录里git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS cd UI-TARS获取 llama.cpp 源码后编译CUDA 加速make LLAMA_CUBLAS1验证产物可用./llama-cli --version纯 CPU 环境直接make即可无需 CUBLAS。三种跑法按场景选入口命令行交互——手动试手感、看原始输出、临时调温度./llama-cli \ -m Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf \ --mmproj mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf \ --jinja -c 131072 -ngl 99-m模型文件--mmproj图像/视频投影文件--jinja启用对话模板保证格式正确-c 131072128K 上下文-ngl 99全部层上 GPU本地脚本调用——批量处理截图、跑固定任务。以图像理解为例把一张 GUI 截图 base64 编码后发给本地服务import base64, json, urllib.request b64 base64.b64encode(open(data/coordinate_process_image.png, rb).read()).decode() payload {messages: [{role: user, content: [ {type: text, text: 这张 GUI 截图打开了什么程序}, {type: image_url, image_url: {url: data:image/png;base64, b64}}]}], max_tokens: 256} req urllib.request.Request(http://localhost:8080/v1/chat/completions, datajson.dumps(payload).encode(), headers{Content-Type: application/json}) print(urllib.request.urlopen(req).read().decode())API 服务——让 Web 应用或其他程序来调30 秒起一个 ./llama-server \ -m Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf \ --mmproj mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf \ --jinja -c 131072 -ngl 99 \ --host 0.0.0.0 --port 8080纯文本生成走/completioncurl -X POST http://localhost:8080/completion \ -H Content-Type: application/json \ -d {prompt: 写一篇关于人工智能的短文, temperature: 0.7, max_tokens: 512}图像理解走 OpenAI 兼容的/v1/chat/completionsimage_url里放 base64。模型返回的点击坐标可以画回原图核对定位效果生成参数调参手册场景temperaturetop_ptop_k手感通用对话 / 生成1.00.9520默认配置代码与精确任务0.60.9520更收敛少跑偏深度推理1.01.040采样放开容忍试错显存紧张时加--low-vram并按任务动态调小-c。跑不动了看这里排错速查现象常见原因解法模型加载失败路径写错 / 文件下载不完整核对相对路径重新下载并校验显存不足OOM量化偏高或上下文过长换 Q4_K_M / IQ2_M加--low-vram缩小-c生成速度慢GPU 层数没吃满-ngl提到 99关掉其他占用 GPU 的进程图像输入无反应漏了--mmproj或图片未做 base64确认投影文件参数生效image_url须为data:image/...;base64,形式对话格式错乱模板没启用命令行与服务端都带上--jinja跑通之后延伸资源更完整的部署与推理流程README_deploy.md动作解析与后处理代码codes/ui_tars/建议路线先用 Q4_K_M 在llama-cli里试手感确认输出符合预期再切到llama-server把能力开放给其他程序——现在就可以把上面第一段命令敲下去。【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考