Qwen-Image-2.1 显存计算器
Qwen-Image-2.1 由三个模型组成:7B 的扩散 Transformer(DiT)、Qwen3-VL-8B 文本编码器和 VAE。分别选择你用的文件、文本编码器放在哪里以及图像尺寸,就能看到峰值显存区间和能跑的显卡。
– 预计峰值显存
同时在 GPU 上的权重: – (精确文件大小)。在此之上的工作内存,取自下方真实显卡的实测区间。
| 显存 | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB |
|---|---|---|---|---|---|
| 结果 | – | – | – | – | – |
“紧张”:只有在区间下限才装得下,比如 ComfyUI 还能把部分模型移到系统内存(会变慢)。如果这块 GPU 还要驱动显示器,请为桌面留出约 0.5–1 GB。
1024×1024 下的常见配置
| 配置 | GPU 上的权重 | 峰值区间 | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB |
|---|---|---|---|---|---|---|---|
| 全精度(diffusers 默认) | 30.8 GB | 32.9 GB–35.5 GB | 不行 | 不行 | 不行 | 不行 | 不行 |
| ComfyUI INT8 ConvRot 套件 | 16.1 GB | 18.2 GB–20.8 GB | 不行 | 不行 | 不行 | 可以 | 可以 |
| ComfyUI INT8 套件,卸载编码器 | 9.3 GB | 11.4 GB–14.0 GB | 不行 | 紧张 | 可以 | 可以 | 可以 |
| FP8 DiT + FP8 编码器(unsloth) | 16.0 GB | 18.1 GB–20.7 GB | 不行 | 不行 | 不行 | 可以 | 可以 |
| GGUF Q8_0 + 编码器 Q8_0 | 15.9 GB | 18.0 GB–20.6 GB | 不行 | 不行 | 不行 | 可以 | 可以 |
| GGUF Q4_K_M + 编码器 INT8 | 13.2 GB | 15.3 GB–17.9 GB | 不行 | 不行 | 紧张 | 可以 | 可以 |
| GGUF Q4_K_M + 编码器 Q4_K_M | 9.2 GB | 11.3 GB–13.9 GB | 不行 | 紧张 | 可以 | 可以 | 可以 |
| GGUF Q4_K_M,编码器在 CPU 上 | 4.5 GB | 6.1 GB–6.9 GB | 可以 | 可以 | 可以 | 可以 | 可以 |
8、12、16 GB 显卡的低显存配置
每一行都是上面文件的一种组合,图像为 1024×1024。三个阶段列分别是编码提示词、去噪、VAE 解码时 GPU 上的权重,按精确文件大小计算。峰值再加上实测的工作显存;文本编码器放在 CPU 上时为 1.6–2.4 GB。
| 显卡 | DiT + 文本编码器 | 文本编码器 | 提示词 | 去噪 | VAE 解码 | 峰值 | 结果 | 试一试 |
|---|---|---|---|---|---|---|---|---|
| 8 GB | GGUF Q4_K_M + GGUF Q4_K_M + VAE 分块解码 | 放在 CPU 上 | 0.6 GB | 4.5 GB | 4.5 GB | 6.1 GB–6.9 GB | 可以 | 试一试 |
| 8 GB | GGUF Q5_K_M + GGUF Q4_K_M + VAE 分块解码 | 放在 CPU 上 | 0.6 GB | 5.6 GB | 5.6 GB | 7.2 GB–8.0 GB | 紧张 | 试一试 |
| 8 GB | GGUF Q3_K_M + GGUF Q3_K_M 一张 RTX 3070 8GB 用这组文件(都放在 GPU 上)在 VAE 解码时显存不足。 | 全部放在 GPU 上 | 7.4 GB | 7.4 GB | 7.4 GB | 9.5 GB–12.1 GB | 不行 | 试一试 |
| 12 GB | GGUF Q8_0 + GGUF Q4_K_M + VAE 分块解码 | 放在 CPU 上 | 0.6 GB | 7.7 GB | 7.7 GB | 9.3 GB–10.1 GB | 可以 | 试一试 |
| 12 GB | GGUF Q4_K_M + GGUF Q4_K_M | 处理完提示词后卸载 | 5.3 GB | 4.5 GB | 4.5 GB | 7.4 GB–10.0 GB | 可以 | 试一试 |
| 12 GB | INT8 ConvRot (ComfyUI) + FP8 | 处理完提示词后卸载 | 9.4 GB | 7.4 GB | 7.4 GB | 11.5 GB–14.1 GB | 紧张 | 试一试 |
| 16 GB | INT8 ConvRot (ComfyUI) + INT8 ConvRot (ComfyUI) | 处理完提示词后卸载 | 9.3 GB | 7.4 GB | 7.4 GB | 11.4 GB–14.0 GB | 可以 | 试一试 |
| 16 GB | GGUF Q6_K + GGUF Q4_K_M | 全部放在 GPU 上 | 11.2 GB | 11.2 GB | 11.2 GB | 13.3 GB–15.9 GB | 可以 | 试一试 |
| 16 GB | GGUF Q4_K_M + INT8 ConvRot (ComfyUI) | 全部放在 GPU 上 | 13.2 GB | 13.2 GB | 13.2 GB | 15.3 GB–17.9 GB | 紧张 | 试一试 |
在 Windows 上,“8 GB 能跑”可能用了 18 GB
NVIDIA 的 Windows 驱动在显存不够时,会把放不下的部分挪到共享系统内存,而不是报错(System Memory Fallback,驱动 536.40 起),所以任务能跑完,但实际是在系统内存里运行。一位 RTX 3070 8GB 用户用 INT8 套件时看到专用显存 7.3 GB,另加共享内存 11.2 GB。同一张卡上,Q4_K_M DiT 放 GPU、Q4_K_M 编码器放 CPU,峰值 6.9 GB;两者都换成 Q3_K_M(合计 6.8 GB)则在解码时显存不足。如果运行时任务管理器里的“共享 GPU 内存”在上涨,就说明放不下;在 NVIDIA 控制面板里把“CUDA - Sysmem Fallback Policy”设为“Prefer No Sysmem Fallback”,就会直接报显存不足。
在 Mac 上(统一内存)
一份公开报告显示,在 M5 Max 48 GB 上,macOS 版 Unsloth Desktop 使用 Q4_K_M DiT 时,加载后约占 34 GB,生成时约 42 GB,远高于本页的 CUDA 数据;后续回复补充了设置:1024×1024、40 步、用时 3 分 14 秒。在 Mac 上,Unsloth Studio 用 diffusers 在 MPS 上以 BF16 运行:GGUF DiT 保持量化打包(每层只在计算时临时反量化),文本编码器的 FP8/INT8 转换只在 CUDA 上进行,所以编码器保持 BF16,权重合计 22.4 GB(Q4_K_M DiT、BF16 编码器和 BF16 VAE,按十进制 GB 计)。此外,Studio 按每百万像素 8 GiB 预留工作内存;在 MPS 上它设置了 PYTORCH_MPS_HIGH_WATERMARK_RATIO=0.0,取消了分配器的上限,所以放不下时 macOS 会换页,而不是报错。34 GB 和 42 GB 是活动监视器中的读数,尚未确认是整机占用(含 macOS 和其他程序)还是该应用本身。本页的区间来自 CUDA 实测(ComfyUI 和 diffusers),对 MPS、MLX 等 Mac 路径可能偏低。macOS 默认只允许 GPU 使用一部分内存,用户日志显示约为三分之二到四分之三,所以在 48 GB 的 Mac 上要留出余量;在同一讨论中,这位用户用 MLX Serve 运行 8 位 MLX 版本,峰值约 20 GB。stable-diffusion.cpp 能在 Metal 上运行 GGUF 文件,但我们还没有它在 Mac 上的实测。
对应的设置
- ComfyUI:
--disable-dynamic-vram --lowvram让文本编码器在 CPU 上运行(开启动态显存时--lowvram不起作用);“VAE Decode (Tiled)”节点分块解码;--reserve-vram 1为桌面留出 1 GB;--lowvram仍不够时,最后可以用--novram。 - stable-diffusion.cpp:
--backend te=cpu让文本编码器在 CPU 上运行(取代已弃用的--clip-on-cpu);--vae-tiling分块解码;--diffusion-fa在 DiT 中使用 flash attention;--offload-to-cpu把权重留在系统内存,需要时再复制到 GPU;--max-vram cuda0=6限制它计划使用的显存。
参数于 2026-09-29 核对自 ComfyUI 的 cli_args.py 与 nodes.py,以及 stable-diffusion.cpp 的 performance、backend 和 Qwen Image 2.1 文档。
用户实测的峰值显存
| GPU | 软件 | 文件 | 图像 | 峰值 | 来源 |
|---|---|---|---|---|---|
| RTX 3090 24GB | ComfyUI | DiT GGUF Q4_K_M + 编码器 INT8 ConvRot + VAE BF16 | 1024×1024 | 15.39 GiB | github.com 2026-09-21 |
| RTX 3090 24GB | ComfyUI | 同上 | 2048×1152 | 16.83 GiB | github.com 2026-09-21 |
| RTX 3090 24GB | ComfyUI | 同上,图像编辑 | 1024×1024 | 17.15 GiB | github.com 2026-09-21 |
| RTX 3090 24GB | ComfyUI --lowvram | 同上,编码器在 CPU 上运行,VAE 分块解码 | 1024×1024 | 6.14 GiB | github.com 2026-09-21 |
| RTX 4060 Ti 16GB | ComfyUI | DiT INT8 ConvRot + 编码器 INT8 + VAE BF16 | 未说明 | 约 15 GB | huggingface.co 2026-09-22 |
| RTX 4070 12GB | ComfyUI | DiT INT8 ConvRot + 编码器 FP8 + VAE BF16,图像编辑 | 2048×2048 | 11.28 GiB | note.com 2026-09-24 |
| RTX 5090 32GB | diffusers | DiT + 编码器 FP8(torchao),全部常驻显存 | 1024×1024 | 21.3 GB | huggingface.co 2026-09-22 |
| RTX 5090 32GB | diffusers | 同上 | 2048×2048 | 22.6 GB | huggingface.co 2026-09-22 |
| RTX 5090 32GB | diffusers | DiT + 编码器 NF4(bitsandbytes) | 1024×1024 | 15.2 GB | huggingface.co 2026-09-22 |
| RTX 3070 8GB | 未说明 | DiT GGUF Q4_K_M 在 GPU 上,编码器 Q4_K_M 在 CPU 上 | 1024×1024,40 步 | 6.9 GB | x.com 2026-09-26 |
| RTX 3070 8GB | 未说明 | INT8 套件,溢出到共享系统内存 | 未说明 | 专用 7.3 GB + 共享 11.2 GB | x.com 2026-09-26 |
| RTX 3070 8GB | 未说明 | DiT GGUF Q3_K_M + 编码器 Q3_K_M,都在 GPU 上 | 未说明 | VAE 解码时显存不足 | x.com 2026-09-26 |
| Apple M5 Max 48GB | Unsloth (macOS) | DiT GGUF Q4_K_M(保持量化打包);编码器 BF16(Studio 只在 CUDA 上把它转为 FP8);VAE 未说明 | 1024×1024,40 步 | 加载后约 34 GB,生成时约 42 GB | github.com 2026-09-29 |
文件大小于 读取自 Hugging Face: Comfy-Org/
使用方法
- 选择扩散模型(DiT)文件:BF16、FP8、INT8 或某个 GGUF 量化版本。
- 选择文本编码器文件及其运行位置:一直留在 GPU 上、处理完提示词后卸载(显存不足时 ComfyUI 会这样做),或放在 CPU 上。
- 选择图像尺寸,或带参考图的编辑模式。
- 查看峰值区间和 GPU 表格。“紧张”表示只有在实测区间的下限才装得下。
常见问题
Qwen-Image-2.1 需要多少显存?
全精度文件共 30.8 GB(BF16 DiT 13.3 GB、BF16 Qwen3-VL-8B 编码器 16.3 GB、FP32 VAE 1.3 GB)。ComfyUI 的 INT8 ConvRot 套件为 16.1 GB;GGUF Q4_K_M DiT 搭配 INT8 编码器和 BF16 VAE 为 13.2 GB。生成过程还要额外占用约 2–6 GB,取决于图像尺寸和所用软件。
为什么各种教程说的从 6 GB 到 30 GB 都有?
因为它们算的东西不同。文本编码器比图像模型还大,所以它是否留在 GPU 上基本决定了答案:编码器放在 CPU 上时,Q4_K_M DiT 在 RTX 3090 上生成 1024×1024 图像只用了 6.1 GB;全部以 BF16 放在 GPU 上时,仅权重就有 30.8 GB。
Qwen-Image-2.1 能在 12 GB 或 16 GB 显卡上跑吗?
可以,需要使用量化文件,并在处理完提示词后卸载文本编码器,或把它放在 CPU 上。在 ComfyUI 中,RTX 4070 12GB 用 INT8 DiT 和 FP8 编码器编辑 2048×2048 图像,峰值为 11.3 GB;RTX 4060 Ti 16GB 两者都用 INT8,峰值接近 15 GB。
Qwen-Image-2.1 用的是哪个文本编码器?
Qwen3-VL-8B(Qwen3VL
这里的 GB 指 GB 还是 GiB?
指 GiB,和 nvidia-smi 以及显卡显存标称使用的单位一致,全站都是如此。diffusers 的实测数据由作者以 GB 报告,按原样显示。
更多计算器
- 微调显存计算器 Transformers 或 Unsloth 中全参数微调、LoRA、QLoRA 需要的显存,并与公开实测对比。 打开 →
- Laya 显存需求 Laya 决策编码器三个模型的真实文件大小、运行内存,以及 PyTorch、ggmlc、llama.cpp 三种运行方式。 打开 →
- vLLM KV cache 与并发计算器 vLLM 分配的 KV cache 池有多少 token、能同时处理多少请求,并给出 vllm serve 命令。 打开 →
- 我的电脑能跑什么? 在浏览器里识别你的 GPU,列出它能跑的本地大模型,以及最佳量化和速度。 打开 →
- MiniMax H3 显存计算器
(ComfyUI) MiniMax H3 视频在 ComfyUI 中的显存与系统内存:剪枝版、INT8、NVFP4 和 GGUF 文件在 8–96 GB 显卡上的表现。 打开 → - MoE 卸载计算器
(--n-cpu-moe) 根据 GGUF 真实张量大小,找出能装进你显卡的最小 llama.cpp --n-cpu-moe。 打开 →
更新于