
本地部署大模型指南TextGen一键启动、参数调优与Docker容器化实战【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgenTextGentext-generation-webui是一个开源本地 LLM 桌面应用支持文本、视觉、工具调用和 OpenAI 兼容 API全程离线、无遥测。跟着做完你手里会有一套能跑、能调、能共享的本地大模型环境。5 分钟从零启动 Web UI用CMD_FLAGS.txt固化你的启动参数显存不够、输出跑偏的调法Docker 容器化部署先判断你的场景个人电脑自用直接看最短路径跑起来跑通后按需调采样参数。内网共享 / 接 API 客户端重点看按目标做个性化里的远程访问与 API 开关。服务器 / 多环境隔离跳到Docker 容器化部署。最短路径跑起来第 1 步克隆仓库git clone https://gitcode.com/GitHub_Trending/te/textgen进入目录。注意路径不要带空格安装脚本依赖 Miniforge。第 2 步按系统运行 start_linux.sh、start_windows.bat 或 start_macos.sh。首次运行会自动下载 Miniforge、建好 Conda 环境并装依赖中途提示时选择你的 GPU 厂商即可。第 3 步浏览器打开http://127.0.0.1:7860。到 Model 标签页选一个模型点 Load再切到 Chat 标签页对话。模型只需放进 user_data/models 目录UI 会自动识别GGUF 单文件放目录根下Transformers 多文件模型放子文件夹。按目标做个性化让每次启动都带上同一套配置持久参数写在 user_data/CMD_FLAGS.txt每行一个启动时自动生效。写--model 你的模型.gguf可以跳过每次手动选模型写--idle-timeout 30则空闲半小时后自动卸载模型释放显存。显存不够怎么办动三个开关。gpu_layers控制多少层放 GPU调低就是往 CPU 挪cache_type设成q8_0或q4_0压缩 KV 缓存省显存但损失一点质量ctx_size调小直接缩小预分配缓存。这三项在 Model 标签页改完点 Load 即生效详见 docs/04 - Model Tab.md。输出重复、风格不稳在 Parameters 标签页调temperature越低越确定、top_p采样池宽度和repetition_penalty压重复力度。不想手调就用 Preset 菜单仓库自带 Creative、Top-P、Deterministic 预设一键切换效果说明见 docs/03 - Parameters Tab.md。允许远程访问和 API 调用在CMD_FLAGS.txt写--listenUI 就能从局域网访问不放心就再加--gradio-auth 用户名:密码上锁。写--api启用 5000 端口的 APIChat、Completions、Messages 端点都兼容 OpenAI 和 Anthropic 的调用方式给客户端指OPENAI_API_BASEhttp://127.0.0.1:5000/v1即可接入细节见 docs/12 - OpenAI API.md。Docker 容器化部署docker/ 下有 nvidia、amd、intel、cpu 四套配置。以 NVIDIA 为例在仓库根目录执行ln -s docker/nvidia/Dockerfile . ln -s docker/nvidia/docker-compose.yml . cp docker/.env.example .env mkdir -p user_data/logs user_data/cache docker compose up --build编辑.env时按显卡型号设TORCH_CUDA_ARCH_LIST用id -g查到的组 ID 填APP_RUNTIME_GID容器内参数同样写进 user_data/CMD_FLAGS.txt。user_data目录被挂载模型和预设重建容器后仍在。前提Docker Compose 2.17 以上NVIDIA 机器另装 Container Toolkit完整说明见 docs/09 - Docker.md。卡住时看这里现象报 CUDA out of memory。→原因模型加缓存装不下。→解法降gpu_layers、ctx_size或 KV 缓存改q8_0。现象Model 下拉框看不到模型。→原因没放对位置或格式不对。→解法GGUF 放user_data/models根目录多文件模型放子文件夹然后点刷新。现象加载时报 tokenizer 或代码相关错误。→原因模型需要执行自带的 Python 代码。→解法加--trust-remote-code启动。现象想给 GGUF 模型挂 LoRA 却发现选项置灰。→原因LoRA 目前只有 Transformers 加载器支持。→解法换 Transformers 加载器对照 docs/What Works.md 选后端。现象Chat 里回复总是被截断。→原因max_new_tokens太小。→解法调大它或勾选auto_max_new_tokens让它自动填满可用上下文。收尾整条路径是装环境 → 放模型 → 用CMD_FLAGS.txt固化参数 → 按目标调采样或上 Docker。下一步可以打开 user_data/CMD_FLAGS.txt 写一行--api然后用任意 OpenAI 客户端打一次请求验证或者按你的显卡把gpu_layers和cache_type调成第一组稳定值。【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考