ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

显存不够也能跑:ComfyUI-Kolors-MZ ChatGLM3 4bit/8bit 量化部署完整指南

2026/8/22 14:32:48 拓冰建站 浏览量
显存不够也能跑:ComfyUI-Kolors-MZ ChatGLM3 4bit/8bit 量化部署完整指南 显存不够也能跑ComfyUI-Kolors-MZ ChatGLM3 4bit/8bit 量化部署完整指南【免费下载链接】ComfyUI-Kolors-MZKolors的ComfyUI原生采样器实现(Kolors ComfyUI Native Sampler Implementation)项目地址: https://gitcode.com/gh_mirrors/co/ComfyUI-Kolors-MZComfyUI-Kolors-MZ 是一款 ComfyUI 的 Kolors 文生图原生采样器插件内置 ChatGLM3 文本编码器。本文教你通过4bit/8bit 量化部署方式配合 cpm_kernels 加速内核把 Kolors 的显存需求从十几 GB 压到6GB 甚至 4GB 以内让中低端显卡也能流畅运行 AI 绘图工作流。为什么需要 4bit/8bit 量化Kolors 由两部分组成UNet 扩散模型 ChatGLM3-6B 文本编码器。其中 ChatGLM3-6B 以 fp16 精度加载时仅权重就占用约12GB 显存再加上 UNet总显存轻松突破 16GB。量化的作用就是把大模型权重压缩存储参考对比精度ChatGLM3-6B 权重显存约典型可运行显卡fp16~12 GB16GB 以上8bit~6.5 GB8GB 左右4bit~3.2 GB6GB 及以下 量化只影响文本编码器的精度对最终出图质量的影响非常小是低显存设备跑 Kolors 的最优解。一键安装步骤ComfyUI-Kolors-MZ 支持直接克隆到 ComfyUI 的自定义节点目录cd ComfyUI/custom_nodes git clone https://gitcode.com/gh_mirrors/co/ComfyUI-Kolors-MZ运行 4bit 量化还需要cpm_kernels提供 GPU 端 int4 压缩/解包 CUDA 内核pip install cpm_kernels 好消息是加载 4bit 模型时插件会自动检测并尝试安装cpm_kernels详见 mz_kolors_core.py 中MZ_ChatGLM3Loader_call的逻辑。量化模型下载与放置准备 ChatGLM3-6B 的safetensors 格式 4bit 或 8bit 量化版本模型社区常用的如 Kijai/ChatGLM3-safetensors 系列均提供 fp16、8bit、4bit 版本文件名中必须包含4bit或8bit字样例如chatglm3-4bit.safetensors、chatglm3-8bit.safetensors——插件靠文件名自动判断量化精度将模型放入 ComfyUI 的models/LLM/文件夹。同时UNet 模型如 Kolors 的 fp16 UNet放入models/unet/文件夹。在节点中启用量化打开 ComfyUI 界面在工作流中找到MZ_ChatGLM3Loader节点在下拉框中选择你的量化模型文件名即可无需任何额外参数选择文件名含4bit的模型 → 自动调用text_encoder.quantize(4)进入 4bit 量化加载流程选择文件名含8bit的模型 → 自动调用text_encoder.quantize(8)进入 8bit 量化加载流程。量化原理速览cpm_kernels 做了什么插件内置了一套轻量量化实现代码见chatglm3/quantization.py核心思路是W4A16 / W8A164bit 模式权重先用 cpm_kernels 的int4WeightCompressionCUDA 内核压缩打包两个 int4 挤进一个 int8显存直接减半再减半推理时再用int4WeightExtractionHalf内核实时解压回 fp16 参与矩阵乘法8bit 模式权重以 int8 fp16 缩放因子scale存储推理时乘以 scale 还原为 fp16 计算不需要 int4 压缩内核。也就是说4bit 是存得省、用时解压8bit 介于两者之间。量化只发生在权重存储层面计算仍在 GPU 上以 fp16 完成因此速度损失有限。常见问题排查FAQ报错 / 现象原因与解决办法name round_up is not definedcpm_kernels 版本过旧或未安装执行pip install -U cpm_kernels更新Could not find chatglm3 checkpoint模型没放进models/LLM/文件夹ChatGLMModel object has no attribute transformer检查 ChatGLM3Loader 选择的模型文件是否下载完整、格式正确RuntimeError: Only Tensors of floating point dtype can require gradients尝试改用 fp16 版本 ChatGLM3 模型module comfy.model_detection has no attribute unet_prefix_from_state_dict把 ComfyUI 本体更新到最新版本不确定模型是 unet 还是 checkpoint 类型优先用 UNet 加载器不行再试试 KolorsCheckpointLoaderSimple更多问题可参考项目 README.md 的 FAQ 章节。性能与选型建议8GB 显卡推荐4bit文本编码器 fp16 UNet整体最稳妥出图速度也快6GB 显卡4bit 是必选项可配合 ComfyUI 的模型 offload 机制显存峰值可控追求极限质量且显存 12GB可直接用 fp16 模型跳过量化量化只压缩文本编码器UNet 仍建议用 fp16以保证出图质量。写在最后借助 ComfyUI-Kolors-MZ 的 4bit/8bit 量化支持与 cpm_kernels 加速内核你只需要三步就能让低显存显卡跑起 Kolors克隆插件 → 放入 4bit/8bit 模型 → 节点选择文件其余全部自动完成。快去试试吧【免费下载链接】ComfyUI-Kolors-MZKolors的ComfyUI原生采样器实现(Kolors ComfyUI Native Sampler Implementation)项目地址: https://gitcode.com/gh_mirrors/co/ComfyUI-Kolors-MZ创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考