Qwen-Image-2.1 显存计算器

Qwen-Image-2.1 由三个模型组成:7B 的扩散 Transformer(DiT)、Qwen3-VL-8B 文本编码器和 VAE。分别选择你用的文件、文本编码器放在哪里以及图像尺寸,就能看到峰值显存区间和能跑的显卡。

– 预计峰值显存

同时在 GPU 上的权重: – (精确文件大小)。在此之上的工作内存,取自下方真实显卡的实测区间。

显存8 GB12 GB16 GB24 GB32 GB
结果–––––

“紧张”:只有在区间下限才装得下,比如 ComfyUI 还能把部分模型移到系统内存(会变慢)。如果这块 GPU 还要驱动显示器,请为桌面留出约 0.5–1 GB。

1024×1024 下的常见配置

配置GPU 上的权重峰值区间8 GB12 GB16 GB24 GB32 GB
全精度(diffusers 默认) 30.8 GB 32.9 GB–35.5 GB 不行不行不行不行不行
ComfyUI INT8 ConvRot 套件 16.1 GB 18.2 GB–20.8 GB 不行不行不行可以可以
ComfyUI INT8 套件,卸载编码器 9.3 GB 11.4 GB–14.0 GB 不行紧张可以可以可以
FP8 DiT + FP8 编码器(unsloth) 16.0 GB 18.1 GB–20.7 GB 不行不行不行可以可以
GGUF Q8_0 + 编码器 Q8_0 15.9 GB 18.0 GB–20.6 GB 不行不行不行可以可以
GGUF Q4_K_M + 编码器 INT8 13.2 GB 15.3 GB–17.9 GB 不行不行紧张可以可以
GGUF Q4_K_M + 编码器 Q4_K_M 9.2 GB 11.3 GB–13.9 GB 不行紧张可以可以可以
GGUF Q4_K_M,编码器在 CPU 上 4.5 GB 6.1 GB–6.9 GB 可以可以可以可以可以

8、12、16 GB 显卡的低显存配置

每一行都是上面文件的一种组合,图像为 1024×1024。三个阶段列分别是编码提示词、去噪、VAE 解码时 GPU 上的权重,按精确文件大小计算。峰值再加上实测的工作显存;文本编码器放在 CPU 上时为 1.6–2.4 GB。

显卡DiT + 文本编码器文本编码器 提示词去噪VAE 解码 峰值结果试一试
8 GB GGUF Q4_K_M + GGUF Q4_K_M
+ VAE 分块解码
放在 CPU 上 0.6 GB4.5 GB4.5 GB 6.1 GB–6.9 GB 可以 试一试
8 GB GGUF Q5_K_M + GGUF Q4_K_M
+ VAE 分块解码
放在 CPU 上 0.6 GB5.6 GB5.6 GB 7.2 GB–8.0 GB 紧张 试一试
8 GB GGUF Q3_K_M + GGUF Q3_K_M
一张 RTX 3070 8GB 用这组文件(都放在 GPU 上)在 VAE 解码时显存不足。
全部放在 GPU 上 7.4 GB7.4 GB7.4 GB 9.5 GB–12.1 GB 不行 试一试
12 GB GGUF Q8_0 + GGUF Q4_K_M
+ VAE 分块解码
放在 CPU 上 0.6 GB7.7 GB7.7 GB 9.3 GB–10.1 GB 可以 试一试
12 GB GGUF Q4_K_M + GGUF Q4_K_M 处理完提示词后卸载 5.3 GB4.5 GB4.5 GB 7.4 GB–10.0 GB 可以 试一试
12 GB INT8 ConvRot (ComfyUI) + FP8 处理完提示词后卸载 9.4 GB7.4 GB7.4 GB 11.5 GB–14.1 GB 紧张 试一试
16 GB INT8 ConvRot (ComfyUI) + INT8 ConvRot (ComfyUI) 处理完提示词后卸载 9.3 GB7.4 GB7.4 GB 11.4 GB–14.0 GB 可以 试一试
16 GB GGUF Q6_K + GGUF Q4_K_M 全部放在 GPU 上 11.2 GB11.2 GB11.2 GB 13.3 GB–15.9 GB 可以 试一试
16 GB GGUF Q4_K_M + INT8 ConvRot (ComfyUI) 全部放在 GPU 上 13.2 GB13.2 GB13.2 GB 15.3 GB–17.9 GB 紧张 试一试

在 Windows 上,“8 GB 能跑”可能用了 18 GB

NVIDIA 的 Windows 驱动在显存不够时,会把放不下的部分挪到共享系统内存,而不是报错(System Memory Fallback,驱动 536.40 起),所以任务能跑完,但实际是在系统内存里运行。一位 RTX 3070 8GB 用户用 INT8 套件时看到专用显存 7.3 GB,另加共享内存 11.2 GB。同一张卡上,Q4_K_M DiT 放 GPU、Q4_K_M 编码器放 CPU,峰值 6.9 GB;两者都换成 Q3_K_M(合计 6.8 GB)则在解码时显存不足。如果运行时任务管理器里的“共享 GPU 内存”在上涨,就说明放不下;在 NVIDIA 控制面板里把“CUDA - Sysmem Fallback Policy”设为“Prefer No Sysmem Fallback”,就会直接报显存不足。

在 Mac 上(统一内存)

一份公开报告显示,在 M5 Max 48 GB 上,macOS 版 Unsloth Desktop 使用 Q4_K_M DiT 时,加载后约占 34 GB,生成时约 42 GB,远高于本页的 CUDA 数据;后续回复补充了设置:1024×1024、40 步、用时 3 分 14 秒。在 Mac 上,Unsloth Studio 用 diffusers 在 MPS 上以 BF16 运行:GGUF DiT 保持量化打包(每层只在计算时临时反量化),文本编码器的 FP8/INT8 转换只在 CUDA 上进行,所以编码器保持 BF16,权重合计 22.4 GB(Q4_K_M DiT、BF16 编码器和 BF16 VAE,按十进制 GB 计)。此外,Studio 按每百万像素 8 GiB 预留工作内存;在 MPS 上它设置了 PYTORCH_MPS_HIGH_WATERMARK_RATIO=0.0,取消了分配器的上限,所以放不下时 macOS 会换页,而不是报错。34 GB 和 42 GB 是活动监视器中的读数,尚未确认是整机占用(含 macOS 和其他程序)还是该应用本身。本页的区间来自 CUDA 实测(ComfyUI 和 diffusers),对 MPS、MLX 等 Mac 路径可能偏低。macOS 默认只允许 GPU 使用一部分内存,用户日志显示约为三分之二到四分之三,所以在 48 GB 的 Mac 上要留出余量;在同一讨论中,这位用户用 MLX Serve 运行 8 位 MLX 版本,峰值约 20 GB。stable-diffusion.cpp 能在 Metal 上运行 GGUF 文件,但我们还没有它在 Mac 上的实测。

对应的设置

  • ComfyUI:--disable-dynamic-vram --lowvram 让文本编码器在 CPU 上运行(开启动态显存时 --lowvram 不起作用);“VAE Decode (Tiled)”节点分块解码;--reserve-vram 1 为桌面留出 1 GB;--lowvram 仍不够时,最后可以用 --novram。
  • stable-diffusion.cpp:--backend te=cpu 让文本编码器在 CPU 上运行(取代已弃用的 --clip-on-cpu);--vae-tiling 分块解码;--diffusion-fa 在 DiT 中使用 flash attention;--offload-to-cpu 把权重留在系统内存,需要时再复制到 GPU;--max-vram cuda0=6 限制它计划使用的显存。

参数于 2026-09-29 核对自 ComfyUI 的 cli_args.py 与 nodes.py,以及 stable-diffusion.cpp 的 performance、backend 和 Qwen Image 2.1 文档。

用户实测的峰值显存

GPU软件文件图像峰值来源
RTX 3090 24GBComfyUIDiT GGUF Q4_K_M + 编码器 INT8 ConvRot + VAE BF161024×102415.39 GiB github.com 2026-09-21
RTX 3090 24GBComfyUI同上2048×115216.83 GiB github.com 2026-09-21
RTX 3090 24GBComfyUI同上,图像编辑1024×102417.15 GiB github.com 2026-09-21
RTX 3090 24GBComfyUI --lowvram同上,编码器在 CPU 上运行,VAE 分块解码1024×10246.14 GiB github.com 2026-09-21
RTX 4060 Ti 16GBComfyUIDiT INT8 ConvRot + 编码器 INT8 + VAE BF16未说明约 15 GB huggingface.co 2026-09-22
RTX 4070 12GBComfyUIDiT INT8 ConvRot + 编码器 FP8 + VAE BF16,图像编辑2048×204811.28 GiB note.com 2026-09-24
RTX 5090 32GBdiffusersDiT + 编码器 FP8(torchao),全部常驻显存1024×102421.3 GB huggingface.co 2026-09-22
RTX 5090 32GBdiffusers同上2048×204822.6 GB huggingface.co 2026-09-22
RTX 5090 32GBdiffusersDiT + 编码器 NF4(bitsandbytes)1024×102415.2 GB huggingface.co 2026-09-22
RTX 3070 8GB未说明DiT GGUF Q4_K_M 在 GPU 上,编码器 Q4_K_M 在 CPU 上1024×1024,40 步6.9 GB x.com 2026-09-26
RTX 3070 8GB未说明INT8 套件,溢出到共享系统内存未说明专用 7.3 GB + 共享 11.2 GB x.com 2026-09-26
RTX 3070 8GB未说明DiT GGUF Q3_K_M + 编码器 Q3_K_M,都在 GPU 上未说明VAE 解码时显存不足 x.com 2026-09-26
Apple M5 Max 48GBUnsloth (macOS)DiT GGUF Q4_K_M(保持量化打包);编码器 BF16(Studio 只在 CUDA 上把它转为 FP8);VAE 未说明1024×1024,40 步加载后约 34 GB,生成时约 42 GB github.com 2026-09-29

文件大小于 读取自 Hugging Face: Comfy-Org/Qwen-Image-2.1、unsloth/Qwen-Image-2.1-GGUF、unsloth/Qwen-Image-2.1-FP8、gguf-org/qwen-image-2.1-gguf、unsloth/Qwen3-VL-8B-Instruct-GGUF、Qwen/Qwen-Image-2.1。 语言模型请使用 LLM 显存计算器。本站估算与实测的差距见估算准确度。

使用方法

  1. 选择扩散模型(DiT)文件:BF16、FP8、INT8 或某个 GGUF 量化版本。
  2. 选择文本编码器文件及其运行位置:一直留在 GPU 上、处理完提示词后卸载(显存不足时 ComfyUI 会这样做),或放在 CPU 上。
  3. 选择图像尺寸,或带参考图的编辑模式。
  4. 查看峰值区间和 GPU 表格。“紧张”表示只有在实测区间的下限才装得下。

常见问题

Qwen-Image-2.1 需要多少显存?

全精度文件共 30.8 GB(BF16 DiT 13.3 GB、BF16 Qwen3-VL-8B 编码器 16.3 GB、FP32 VAE 1.3 GB)。ComfyUI 的 INT8 ConvRot 套件为 16.1 GB;GGUF Q4_K_M DiT 搭配 INT8 编码器和 BF16 VAE 为 13.2 GB。生成过程还要额外占用约 2–6 GB,取决于图像尺寸和所用软件。

为什么各种教程说的从 6 GB 到 30 GB 都有?

因为它们算的东西不同。文本编码器比图像模型还大,所以它是否留在 GPU 上基本决定了答案:编码器放在 CPU 上时,Q4_K_M DiT 在 RTX 3090 上生成 1024×1024 图像只用了 6.1 GB;全部以 BF16 放在 GPU 上时,仅权重就有 30.8 GB。

Qwen-Image-2.1 能在 12 GB 或 16 GB 显卡上跑吗?

可以,需要使用量化文件,并在处理完提示词后卸载文本编码器,或把它放在 CPU 上。在 ComfyUI 中,RTX 4070 12GB 用 INT8 DiT 和 FP8 编码器编辑 2048×2048 图像,峰值为 11.3 GB;RTX 4060 Ti 16GB 两者都用 INT8,峰值接近 15 GB。

Qwen-Image-2.1 用的是哪个文本编码器?

Qwen3-VL-8B(Qwen3VLForConditionalGeneration),不是 Qwen2.5-VL。Comfy-Org 仓库里 9B 的 Qwen3.5“提示词增强”文件是可选的额外模型,并不是文本编码器,这里没有计入。

这里的 GB 指 GB 还是 GiB?

指 GiB,和 nvidia-smi 以及显卡显存标称使用的单位一致,全站都是如此。diffusers 的实测数据由作者以 GB 报告,按原样显示。

更多计算器

更新于