ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

ComfyUI 多平台部署:快速搞定 NVIDIA、AMD 与国产加速卡的硬件兼容性

2026/9/5 19:31:37 拓冰建站 浏览量
ComfyUI 多平台部署:快速搞定 NVIDIA、AMD 与国产加速卡的硬件兼容性 ComfyUI 多平台部署快速搞定 NVIDIA、AMD 与国产加速卡的硬件兼容性【免费下载链接】ComfyUIThe most powerful and modular diffusion model GUI, api and backend with a graph/nodes interface.项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUIComfyUI 的节点图跑在什么硬件上取决于两件事装对对应后端的 PyTorch以及启动时选对显存与精度参数。下面按先认硬件、再调参数、后查故障的顺序覆盖你从 clone 仓库到解决 OOM 的完整路径。 按硬件类型走安装分支NVIDIA、AMD、Intel 与国产卡本节解决我的卡该装哪个 PyTorch、跑哪条启动命令。先按硬件对号入座再看对应分支。NVIDIA装 CUDA 版 wheel 再装项目依赖现象启动时报Torch not compiled with CUDA enabled。原因默认装到的是 CPU 版 PyTorch或 torch 与驱动 CUDA 版本不匹配。做法如下git clone https://gitcode.com/GitHub_Trending/co/ComfyUI cd ComfyUI pip install -r requirements.txtpip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130如果之前装错先执行pip uninstall torch再按上面的命令重装。NVIDIA 20 系及以上显卡建议使用 cu130 及以上版本的 PyTorchtorch 最低支持到 2.7。AMDLinuxROCm 稳定版与架构覆盖变量现象ROCm 报不支持当前架构或启动时找不到设备。原因官方 wheel 未覆盖你的显卡。做法分两步pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/rocm7.2如果你的卡不在官方支持列表里用架构覆盖变量启动6700/6600 等 RDNA2 及更早显卡用HSA_OVERRIDE_GFX_VERSION10.3.0 python main.py7600 等 RDNA3 显卡用HSA_OVERRIDE_GFX_VERSION11.0.0 python main.py。想再挤一点性能可设置PYTORCH_TUNABLEOP_ENABLED1开启 TunableOp代价是首次运行明显变慢。Intel Arc用 torch.xpu 而非 CUDA wheel现象装了 CUDA 版 PyTorch 后 Arc 显卡完全没参与计算。原因Intel 显卡需要 oneAPI/XPU 后端。做法pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/xpu启动时可用--oneapi-device-selector指定具体设备。昇腾 NPU、寒武纪 MLU 与 Apple Silicon现象装完 PyTorch 后设备仍识别为 CPU。原因国产卡和 Mac 都依赖厂商的 PyTorch 扩展官方安装步骤在厂商文档里不能只装一个包了事。做法昇腾按 torch_npu 官方文档依次装好 CANN/驱动后再跑python main.py寒武纪先装 CNToolkit 与 torch_mlu 再启动Apple Silicon 按 Apple 官方的 Metal 加速 PyTorch 指南装好最新版再走与 Linux 相同的手动安装流程。️ 显存、精度与注意力参数怎么配按显存大小对号入座本节解决参数太多不知道选哪个。所有硬件相关开关都定义在 comfy/cli_args.py 中设备探测与显存分配逻辑在 comfy/model_management.py。下图展示了模型在节点图中的流向Checkpoint 到 KSampler 这段是显存压力最大的部分也是下面参数主要作用的对象。显存档位先确认你的卡属于哪一档NVIDIA 上 Dynamic VRAM 默认开启模型会按压力自动在显存与内存间搬移以下档位更多是兜底与显式控制参数行为适用情况--gpu-only所有模块常驻显存显存足够、追求最少搬运--highvram用过的模型不卸载16GB 显存不加分档参数动态显存按需加载卸载8-16GB默认推荐--lowvram文本编码器走 CPU4-8GB--novram低显存仍不够时4GB 及以下--cpu全部走 CPU最后手段很慢精度FP16 是多数卡的默认答案参数说明--force-fp32兼容性兜底最慢--fp16-unet多数 NVIDIA/AMD 卡推荐--bf16-unetAMD 等 bf16 表现好的硬件可选--fp8_e4m3fn-unet配合--supports-fp8-computeAda/Lovelace 及更新架构出图整体偏黑或 VAE 解码异常时用--fp32-vae或--cpu-vae单独把 VAE 拉回高精度。注意力后端互斥组一次只能开一个--use-pytorch-cross-attentionPyTorch 2.0 SDPA、--use-flash-attention、--use-sage-attention、--use-ck-attention属于同一互斥组同时传多个会冲突。--fast会开启若干未充分测试的优化fp16 累加、FP8 矩阵乘等可能影响出图质量稳定环境慎用。 显存不足与启动报错如何排查现象、原因、做法本节把部署后最常撞上的四类问题按排查顺序列出。现象Torch not compiled with CUDA enabled。原因装的是 CPU 版 torch。做法pip uninstall torch后安装对应 CUDA 或 ROCm 的 wheel见上节。现象日志显示使用 CPU或指定设备不可见。原因驱动过旧或多卡机器默认选了 0 号卡。做法多卡时用--cuda-device 1指定第二张卡支持0,1这样的逗号列表用--default-device设默认设备。现象生成中途out of memory崩溃。原因显存峰值被批大小、分辨率或驻留策略顶满。做法按顺序尝试--reserve-vram 2给系统和浏览器预留 2GB切到--lowvram或--novram档位仍然崩溃再加--cpu兜底。现象能跑通但速度明显慢于预期。原因动态显存模式下权重在 CPU 与 GPU 之间反复搬运。做法显存够就加--gpu-only或--highvram让模型常驻再叠加--fp16-unet与--use-pytorch-cross-attentionpython main.py --fp16-unet --use-pytorch-cross-attention 节点输入参数如何影响硬件负载本节解决为什么同样的工作流我的卡会 OOM 而别人的不会。KSampler 的步数、宽高的分辨率、批大小这些输入直接决定显存峰值与采样耗时。自定义节点在INPUT_TYPES中声明min/max/default参数键的定义方式见 comfy/comfy_types/examples/前端就会据此做约束和提示。给节点定参数范围时把它当成硬件预算来设为 8GB 显存的卡把默认分辨率压在安全线内、给大尺寸选项加提示或拆成可选分支比让用户撞一次 OOM 再回退要省事。仓库blueprints/目录里的模板工作流如 Text to Image (Flux.1 Dev).json可直接参考各模型的推荐参数组合。先按你的卡型走完第一个 H2 的安装分支再用--reserve-vram、--fp16-unet微调启动参数遇到报错直接对照第三个 H2 的现象列表处理。【免费下载链接】ComfyUIThe most powerful and modular diffusion model GUI, api and backend with a graph/nodes interface.项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考