图像与视频模型显存计算器
ComfyUI 中的图像和视频模型由三个文件依次加载:扩散模型、往往同样大的文本编码器和 VAE。选择模型和每一部分所用的文件、文本编码器的位置以及任务尺寸,就能看到峰值显存区间、哪些显卡装得下,以及其余部分需要多少系统内存。
FLUX.2 VAE(FP32 文件,以 BF16 加载)
20.6 GB–22.2 GB 所需文件全部放在 GPU 上时的预计峰值显存
同时在 GPU 上的权重: 18.7 GB ,全部文件共 35.7 GB(精确大小)。
Wan 2.2 A14B 由两个专家组成,一个负责高噪声步,一个负责低噪声步。ComfyUI 每次只把一个放在 GPU 上,另一个留在系统内存中,所以“全部文件”把两个都算进去。
这个检查点已经包含视频 VAE、音频 VAE 和文本连接层,所以 VAE 选项不再增加占用。
| 显存 | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|
| 结果 | 流式 | 流式 | 流式 | 可以 | 可以 | 可以 |
| 系统内存 | 38 GB | 34 GB | 30 GB | 23 GB | 23 GB | 23 GB |
系统内存:不在 GPU 上的权重,再加约 6 GB 给 ComfyUI(在 MiniMax H3 上实测)。若要像 ComfyUI 默认那样在内存中缓存每个文件(重跑更快),请准备 42 GB。
“可以”:所需文件和工作内存区间上限都装得下。“紧张”:只有区间下限装得下。“流式”:工作内存装得下,但权重装不全,ComfyUI 的动态显存会把其余部分放在系统内存中,每一步再复制过去:能跑,但更慢。“有风险”:连工作内存都可能装不下。如果这块 GPU 还要驱动显示器,请为桌面留出约 0.5–1 GB。
GB 即 GiB(1024³ 字节),与 nvidia-smi 和 ComfyUI 日志里的“MB”(MiB)一致;实测数据保留作者使用的单位。
常见配置(处理完提示词后换出编码器)
每个模型按它的第一个任务尺寸计算:图像为 1024×1024,Wan 2.2 A14B 为 832×480,Wan 2.2 5B 为 1280×704,LTX 为 1280×720。其他尺寸请用上面的计算器。
| 配置 | 任务 | GPU 上的权重 | 全部文件 | 峰值区间 | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|---|---|---|
| FLUX.2 [dev] (32B) FP8 mixed (ComfyUI) + FP8 (ComfyUI) | 约 100 万像素(1024×1024) | 33.2 GB | 50.1 GB | 35.1 GB–36.7 GB | 流式 | 流式 | 流式 | 流式 | 流式 | 可以 |
| FLUX.2 [dev] (32B) GGUF Q4_K_M + FP8 (ComfyUI) | 约 100 万像素(1024×1024) | 18.7 GB | 35.7 GB | 20.6 GB–22.2 GB | 流式 | 流式 | 流式 | 可以 | 可以 | 可以 |
| FLUX.2 [dev] (32B) GGUF Q2_K + GGUF Q4_K_M | 约 100 万像素(1024×1024) | 13.5 GB | 25.6 GB | 15.4 GB–17.0 GB | 流式 | 流式 | 紧张 | 可以 | 可以 | 可以 |
| FLUX.2 [klein] 9B BF16(全精度) + BF16(全精度) | 约 100 万像素(1024×1024) | 17.1 GB | 32.5 GB | 18.3 GB–20.1 GB | 流式 | 流式 | 流式 | 可以 | 可以 | 可以 |
| FLUX.2 [klein] 9B FP8 + FP8 mixed (ComfyUI) | 约 100 万像素(1024×1024) | 8.9 GB | 17.2 GB | 10.1 GB–11.9 GB | 流式 | 可以 | 可以 | 可以 | 可以 | 可以 |
| FLUX.2 [klein] 9B GGUF Q4_K_M + GGUF Q4_K_M | 约 100 万像素(1024×1024) | 5.7 GB | 10.5 GB | 6.9 GB–8.7 GB | 紧张 | 可以 | 可以 | 可以 | 可以 | 可以 |
| FLUX.2 [klein] 4B BF16(全精度) + BF16(全精度) | 约 100 万像素(1024×1024) | 7.6 GB | 15.0 GB | 8.6 GB–10.1 GB | 流式 | 可以 | 可以 | 可以 | 可以 | 可以 |
| FLUX.2 [klein] 4B FP8 + FP4 (ComfyUI) | 约 100 万像素(1024×1024) | 3.9 GB | 7.7 GB | 4.9 GB–6.4 GB | 可以 | 可以 | 可以 | 可以 | 可以 | 可以 |
| Qwen-Image 2.1 (7B) INT8 ConvRot (ComfyUI) + INT8 ConvRot (ComfyUI) | 约 100 万像素(1024×1024) | 9.3 GB | 16.1 GB | 11.4 GB–14.0 GB | 流式 | 紧张 | 可以 | 可以 | 可以 | 可以 |
| Qwen-Image 2.1 (7B) GGUF Q4_K_M + GGUF Q4_K_M | 约 100 万像素(1024×1024) | 5.3 GB | 9.2 GB | 7.4 GB–10.0 GB | 紧张 | 可以 | 可以 | 可以 | 可以 | 可以 |
| Wan 2.2 A14B (T2V / I2V) FP16 + FP16(全精度) | 832×480,81 帧(5 秒) | 26.9 GB | 64.1 GB | 27.9 GB–29.9 GB | 流式 | 流式 | 流式 | 流式 | 可以 | 可以 |
| Wan 2.2 A14B (T2V / I2V) FP8 scaled + FP8 scaled (ComfyUI) | 832×480,81 帧(5 秒) | 13.5 GB | 33.1 GB | 14.5 GB–16.5 GB | 流式 | 流式 | 紧张 | 可以 | 可以 | 可以 |
| Wan 2.2 A14B (T2V / I2V) GGUF Q4_K_M + GGUF Q5_K_M | 832×480,81 帧(5 秒) | 9.2 GB | 22.1 GB | 10.2 GB–12.2 GB | 流式 | 紧张 | 可以 | 可以 | 可以 | 可以 |
| Wan 2.2 TI2V 5B FP16(全精度) + FP8 scaled (ComfyUI) | 1280×704,121 帧(5 秒) | 10.6 GB | 16.9 GB | 12.0 GB–15.6 GB | 流式 | 流式 | 可以 | 可以 | 可以 | 可以 |
| Wan 2.2 TI2V 5B GGUF Q4_K_M + GGUF Q4_K_M | 1280×704,121 帧(5 秒) | 4.7 GB | 7.9 GB | 6.1 GB–9.7 GB | 紧张 | 可以 | 可以 | 可以 | 可以 | 可以 |
| LTX-2 (19B) FP8 检查点 + FP8 scaled (ComfyUI) | 1280×720,121 帧(5 秒) | 25.2 GB | 37.5 GB | 27.2 GB–30.2 GB | 流式 | 流式 | 流式 | 流式 | 可以 | 可以 |
| LTX-2 (19B) NVFP4 检查点 + FP4 mixed (ComfyUI) | 1280×720,121 帧(5 秒) | 18.6 GB | 27.4 GB | 20.6 GB–23.6 GB | 流式 | 流式 | 流式 | 可以 | 可以 | 可以 |
| LTX-2.3 (22B) FP8 检查点 + FP8 scaled (ComfyUI) | 1280×720,121 帧(5 秒) | 27.1 GB | 39.4 GB | 29.1 GB–32.1 GB | 流式 | 流式 | 流式 | 流式 | 紧张 | 可以 |
| LTX-2.3 (22B) GGUF Q4_K_M + GGUF Q4_K_M | 1280×720,121 帧(5 秒) | 17.2 GB | 24.0 GB | 19.2 GB–22.2 GB | 流式 | 流式 | 流式 | 可以 | 可以 | 可以 |
| LTX-2.5 (22B) INT8 ConvRot (ComfyUI) + INT8 ConvRot (ComfyUI) | 1280×720,121 帧(5 秒) | 21.7 GB | 36.1 GB | 23.7 GB–26.7 GB | 流式 | 流式 | 流式 | 紧张 | 可以 | 可以 |
| LTX-2.5 (22B) GGUF Q4_K_M(蒸馏版) + INT8 ConvRot (ComfyUI) | 1280×720,121 帧(5 秒) | 16.3 GB | 30.6 GB | 18.3 GB–21.3 GB | 流式 | 流式 | 流式 | 可以 | 可以 | 可以 |
与公开的 ComfyUI 实测核对
两种核对。第一,ComfyUI 自己的加载日志(“loaded”“staged”,单位 MiB)与文件字节数对比:权重精确就靠这一项。第二,一次运行隐含的工作内存,即它的峰值(或显存不足时已分配的量,或它跑完时所用显卡的容量)减去当时在 GPU 上的权重,与本页对该任务使用的区间对比。
| GPU | 运行 | 报告值 | 本页 | 一致 | 来源 |
|---|---|---|---|---|---|
| RTX 3090 24GB | FLUX.2 [dev] 文本编码器,Mistral FP8 | 已加载 17,180.59 MB | 文件:17,199.2 MiB(−0.11%) | 是 | #10891 2025-11-25 |
| RTX 3090 24GB | FLUX.2 [dev] DiT,FP8 mixed | 已加载 20,308.52 MB + 卸载到内存 13,504.50 MB | 文件:33,813.1 MiB(<0.01%) | 是 | #10891 2025-11-25 |
| 未说明 | FLUX.2 [klein] 9B DiT,FP8 KV | 暂存 9,364 MB | 文件:9,364.1 MiB(<0.01%) | 是 | #12906 2026-03-12 |
| 未说明 | FLUX.2 VAE,FP32 文件以 BF16 加载 | 暂存 160 MB | 文件:160.3 MiB(−0.20%) | 是 | #12906 2026-03-12 |
| RTX 5070 Ti 16GB | Wan 2.2 I2V A14B NVFP4,高噪声专家 | 暂存约 9.4 GB(“≈ 文件大小”) | 文件:9,450.3 MiB(−0.53%) | 是 | #11864 2026-07-24 |
| RX 9060 XT 16GB | Wan 2.1 VAE(也是初代 Qwen-Image 的 VAE) | 已加载 242.03 MB | 文件:242.1 MiB(−0.01%) | 是 | #15220 2026-08-02 |
| RTX 3090 24GB (24,121 MB) | FLUX.2 [dev] FP8 mixed,21,897 MB 的 DiT 在 GPU 上,1024×1024 | “峰值接近满 24 GiB” | 隐含工作内存 2.1 GB;区间 1.9–3.5 GB | 是 | #10891 2025-11-27 |
| RTX 5090 32GB | FLUX.2 [klein] 9B FP8 KV + FLUX.2 VAE,参考图工作流,未用 KV cache 节点 | “显存占用 14 GB” | 隐含工作内存 4.7 GB;区间 2.0–5.0 GB | 是 | #12906 2026-03-12 |
| 16 GB 显卡 | Wan 2.2 FP8 scaled,高噪声专家 + Wan 2.1 VAE,720p | “约 15GB” | 隐含工作内存 1.5 GB;区间 1.4–5.5 GB | 是 | #9293 2025-08-13 |
| 16 GB 显卡 | 同上,低噪声专家 | “超过 16GB”(溢出到共享内存) | 隐含至少 2.5 GB;区间上限 5.5 GB | 是 | #9293 2025-08-13 |
| RTX 5070 Ti 16GB | Wan 2.2 I2V A14B NVFP4,低噪声专家(9.7 GB)+ Wan 2.1 VAE,640×640,81 帧 | 跑完 | 隐含至多 6.3 GB;区间下限 1.0 GB | 是 | #11864 2026-07-24 |
| RTX 3090 24GB(可用 22.06 GiB) | LTX-2 19B FP8 检查点,模板工作流 | --normalvram 在 21.90 GB 时显存不足;--novram 可跑(峰值 6.74 GB,权重流式加载) | 仅权重就有 25.2 GB,超过显卡容量;本页显示“流式” | 是 | #12047 2026-01-23 |
| RTX 5090 32GB(可用 31.36 GiB) | LTX-2 19B FP8 检查点(约 27 GB),1080p,81 帧 | “可以轻松运行” | 隐含至多 6.1 GB;区间下限 3.5 GB | 是 | #11864 2026-01-14 |
| RTX 5090 32GB(可用 31.36 GiB) | LTX-2.3,27,580 MB 模型在 GPU 上(另 1,209 MB 卸载),120 帧以上,尺寸未说明 | 已分配 29.60 GiB 时显存不足 | 隐含至少 2.7 GB;区间上限 5.0 GB | 是 | #14683 2026-06-30 |
可能差多少
权重是精确的:上面的加载日志与文件大小相差不超过 0.2%(一份四舍五入到 0.1 GB 的报告为 0.5%)。不确定的是工作内存。上面的实测都落在区间内,但每个区间只依据一到三次运行,其中几次来自任务管理器读数或“约 15GB”这样的约数,所以峰值对图像可能差 1–2 GB,对视频可能差 2–4 GB。FLUX.2 [klein] 4B、Wan 2.2 5B 和 LTX-2.5 还没有带文件大小的公开实测。如果你有,把 nvidia-smi 或 ComfyUI 日志里的峰值连同文件名发到这里,区间就能缩小。
为什么装不下的模型 ComfyUI 也能跑
ComfyUI 不需要把整个模型放在 GPU 上。它先加载装得下的部分,其余部分在每个模块运行时从系统内存复制过去(部分加载,以及 2026 年初起默认开启的动态显存),所以 FLUX.2 [dev] FP8 DiT(33.0 GB)在 24 GB 显卡上也能跑完:issue #10891 中,一张 RTX 3090 放下了其中 19.8 GB,其余 13.2 GB 流式加载。仍然必须装下的是工作内存,所以视频任务需要的余量比权重看起来的更多。流式加载需要上表中的内存,内存不够时就会失败:一张 16 GB 显卡跑 Wan 2.2,直到设置了 100 GB 的页面文件才不再崩溃。
文件大小于 读取自 Hugging Face API: black-forest-labs/
使用方法
- 选择模型:FLUX.2 [dev] 或 [klein]、Qwen-Image 2.1、Wan 2.2 A14B 或 5B、LTX-2、LTX-2.3 或 LTX-2.5。
- 选择扩散模型文件(BF16、FP8、INT8、NVFP4 或某个 GGUF 量化)、文本编码器文件和 VAE。
- 选择生成时文本编码器的位置。显存不足时,ComfyUI 会在处理完提示词后把它换出。
- 选择图像或视频尺寸,查看峰值区间、GPU 表格和每张卡需要的内存。“流式”表示 ComfyUI 把部分权重放在系统内存中:能跑,但更慢。
常见问题
FLUX.2 [dev] 需要多少显存?
全部以 BF16 放在 GPU 上时,权重为 93.3 GB(32B DiT、Mistral Small 3.2 24B 编码器和 VAE)。ComfyUI 的 FP8 套件在处理完提示词后换出编码器时,同时在显卡上的权重为 33.2 GB,100 万像素峰值 35.1 GB–36.7 GB,所以 24 GB 显卡要从系统内存流式加载部分 DiT。换成 Q4_K_M GGUF 后为 20.6 GB–22.2 GB。蒸馏版 FLUX.2 [klein] 9B 用 Q4_K_M 需要 6.9 GB–8.7 GB。
Wan 2.2 14B 能在 12 GB 或 16 GB 显卡上跑吗?
可以,需要量化的专家模型。Wan 2.2 A14B 由两个 14B 专家组成,ComfyUI 每次只把一个放在 GPU 上。720p、81 帧时,一个 FP8 专家(13.3 GB)峰值为 14.9 GB–19.0 GB,16 GB 显卡比较紧张;Q4_K_M 专家峰值为 10.6 GB–14.7 GB。另一个专家留在系统内存中,这套文件合计 22.1 GB。
LTX-2.5 或 LTX-2.3 需要多少显存?
LTX-2.5 用 Lightricks 的 INT8 ConvRot Transformer 和 Gemma 4 编码器、编码器换出时,1280×720、121 帧需要 23.7 GB–26.7 GB。LTX-2.3 用 unsloth 的 Q4_K_M GGUF 和 Q4_K_M Gemma 3 编码器需要 19.2 GB–22.2 GB。LTX-2 和 LTX-2.3 的 FP8 检查点本身就有 25–27 GB,超过 24 GB 显卡的容量。
模型装不下,为什么 ComfyUI 还能跑?
ComfyUI 的动态显存会把装不下的那部分权重放在系统内存中,每一步再复制到 GPU。任务能跑完,但更慢,而且需要这部分内存:本页把这类显卡标为“流式”,并给出每张卡需要的内存。只有连工作内存都装不下时才会失败。
这些数字有多准?
权重是文件的字节数,ComfyUI 自己的加载日志与之相差不超过 0.2%(一份四舍五入到 0.1 GB 的报告为 0.5%)。其上的工作内存是一个区间:8 个公开 ComfyUI 实测中有 8 个落在区间内,但样本不多,视频的估算可能差 2–4 GB。FLUX.2 [klein] 4B、Wan 2.2 5B 和 LTX-2.5 还没有带文件大小的公开实测,区间借用同系列模型,页面上已注明。
这里的 GB 指 GB 还是 GiB?
指 GiB(1024³ 字节),与 nvidia-smi 和 ComfyUI 日志里的“MB”一致,全站都是如此。实测数据保留作者使用的单位。
更多计算器
- 微调显存计算器 Transformers 或 Unsloth 中全参数微调、LoRA、QLoRA 需要的显存,并与公开实测对比。 打开 →
- 可本地运行的 Jev 替代品 只有 API 的 Jev 在本地的开源替代:Laya、零样本分类编码器和小型 LLM,附文件大小与显存。 打开 →
- Laya 显存需求 Laya 决策编码器三个模型的真实文件大小、运行内存,以及 PyTorch、ggmlc、llama.cpp 三种运行方式。 打开 →
- Bonsai 2 27B 显存需求 Ternary Bonsai 2 27B 各文件的真实大小、8–24 GB 显卡能开的最长上下文,以及 5.95 GB 与 8.60 GB 两种说法的来源。 打开 →
- vLLM KV cache 与并发计算器 vLLM 分配的 KV cache 池有多少 token、能同时处理多少请求,并给出 vllm serve 命令。 打开 →
- 我的电脑能跑什么? 在浏览器里识别你的 GPU,列出它能跑的本地大模型,以及最佳量化和速度。 打开 →
更新于