MiniMax H3 显存计算器(ComfyUI)
MiniMax H3 由四个模型依次运行:33B 的扩散 Transformer、Qwen3-VL-32B 文本编码器、视频 VAE 和音频 VAE。选择你用的文件、文本编码器的运行位置和视频尺寸,就能看到峰值显存、哪些显卡装得下,以及装不下的部分需要多少系统内存。
处理提示词时在 GPU 上,之后换出(ComfyUI 默认)
864×480(0.4 MP,模板预览尺寸)
5 秒(124 帧)
– 所需文件全部放在 GPU 上时的预计峰值显存
还没有人公开过这么大任务的实测数据,所以没有工作内存区间。下面的文件大小仍然是精确的;可以试试更短的时长或更小的尺寸。
同时在 GPU 上的权重: – ,全部文件共 –(精确大小,含音频 VAE)。
| 显存 | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB | 96 GB |
|---|---|---|---|---|---|---|---|
| 结果 | – | – | – | – | – | – | – |
| 系统内存 | – | – | – | – | – | – | – |
系统内存:不在 GPU 上的权重,再加约 6 GB 给 ComfyUI。若要像 ComfyUI 默认那样在内存中缓存每个文件(重跑更快),请准备 –。一台 32 GB 内存的 3090 在加上 --disable-pinned-memory 之前会被 OOM 杀掉。
“可以”:所需文件和工作内存区间上限都装得下。“紧张”:只有区间下限装得下。“流式”:工作内存装得下,但权重装不全,ComfyUI 的动态显存会把其余部分放在系统内存中,每一步都要搬运:能跑,但更慢(discussion #59 中 4090 每步搬运 9–10 GB)。“有风险”:连工作内存都可能装不下。如果这块 GPU 还要驱动显示器,请为桌面留出约 0.5–1 GB。
GB 即 GiB(1024³ 字节);实测数据保留来源使用的单位。
864×480、5 秒下的常见配置
| 配置 | GPU 上的权重 | 全部文件 | 峰值区间 | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB | 96 GB |
|---|---|---|---|---|---|---|---|---|---|---|
| 全精度,全部放在 GPU 上 | 115.1 GB | 115.1 GB | 116.4 GB–121.8 GB | 流式 | 流式 | 流式 | 流式 | 流式 | 流式 | 流式 |
| 全精度,编码器换出 | 67.1 GB | 115.1 GB | 68.4 GB–73.8 GB | 流式 | 流式 | 流式 | 流式 | 流式 | 流式 | 可以 |
| 完整 INT8 ConvRot 套件,全部放在 GPU 上 | 62.4 GB | 62.4 GB | 63.7 GB–69.1 GB | 流式 | 流式 | 流式 | 流式 | 流式 | 流式 | 可以 |
| 剪枝 BF16 + INT8 编码器 | 42.9 GB | 68.2 GB | 44.2 GB–49.6 GB | 流式 | 流式 | 流式 | 流式 | 流式 | 紧张 | 可以 |
| 剪枝 INT8 + NVFP4 编码器(Comfy-Org 最小套件) | 24.9 GB | 39.6 GB | 26.2 GB–31.6 GB | 流式 | 流式 | 流式 | 流式 | 可以 | 可以 | 可以 |
| 剪枝 FP8 + NVFP4 编码器 | 24.9 GB | 39.5 GB | 26.2 GB–31.6 GB | 流式 | 流式 | 流式 | 流式 | 可以 | 可以 | 可以 |
| GGUF Q8_0 + NVFP4 编码器 + INT8 VAE | 23.3 GB | 37.9 GB | 24.6 GB–30.0 GB | 流式 | 流式 | 流式 | 流式 | 可以 | 可以 | 可以 |
| W4A8 + NVFP4 编码器 + INT8 VAE | 17.8 GB | 29.5 GB | 19.1 GB–24.5 GB | 流式 | 流式 | 流式 | 紧张 | 可以 | 可以 | 可以 |
| GGUF Q4_K_M + GGUF Q4_K_M 编码器 + INT8 VAE | 16.8 GB | 27.5 GB | 18.1 GB–23.5 GB | 流式 | 流式 | 流式 | 可以 | 可以 | 可以 | 可以 |
| GGUF Q4_K_M,编码器在 CPU 上 | 14.0 GB | 27.5 GB | 15.3 GB–20.7 GB | 流式 | 流式 | 紧张 | 可以 | 可以 | 可以 | 可以 |
| GGUF Q2_K,编码器在 CPU 上 | 9.4 GB | 23.0 GB | 10.7 GB–16.1 GB | 流式 | 紧张 | 紧张 | 可以 | 可以 | 可以 | 可以 |
用户实测数据
单位按各作者原样显示。多数运行都流式加载了部分权重,所以显存一列是显卡实际占用,而不是把所有文件放上 GPU 时所需的量。
| GPU | 软件 | 文件 | 视频 | 显存 | 系统内存占用 | 耗时 | 来源 |
|---|---|---|---|---|---|---|---|
| RTX PRO 6000 96GB 内存: 未说明 | ComfyUI 0.35.0 | 完整 INT8 ConvRot DiT + INT8 编码器 + 两个 VAE;DiT 和编码器同时在显卡上 | 864×480 · 5 秒 · 20 步 | 峰值 63.7 GB | – | 47 秒 | huggingface.co 2026-09-13 |
| RTX 5090 32GB 内存: 94 GB | ComfyUI 0.35.0 | 同上;每步有 1–3 GB 的 DiT 经 PCIe 传输 | 864×480 · 5 秒 · 20 步 | 31.8 GB | – | 69 秒 | huggingface.co 2026-09-13 |
| RTX 4090 24GB 内存: 86–108 GB | ComfyUI 0.35.0 | 同上;每步有 9–10 GB 经 PCIe 传输 | 864×480 · 5 秒 · 20 步 | – | 峰值 68 GB | 92–93 秒 | huggingface.co 2026-09-13 |
| RTX 3090 24GB 内存: 32 GB | ComfyUI 0.30.1,--disable-pinned-memory | 剪枝 INT8 DiT + NVFP4 编码器 + FP16 VAE | 832×480 · 124 帧 · 20 步 | 峰值 23,716 MiB | – | 4 分 26 秒 | github.com 2026-08-04 |
| RTX 3090 24GB 内存: 32 GB | ComfyUI 0.30.1,--disable-pinned-memory | 同上 | 832×480 · 362 帧 · 20 步 | 峰值 18,884 MiB | 7.5 GB(不加该参数时 29.9 GB,被 OOM 杀掉) | 23 分 17 秒 | github.com 2026-08-04 |
| RTX 5070 Ti 16GB 内存: 125 GB | ComfyUI 0.30.1 | 剪枝 INT8 DiT + NVFP4 编码器 + 两个 VAE(42.5 GB) | 1344×768 · 5 秒 | 峰值 14,437 MiB | 45.4 GiB RSS;加 --fast-disk 时 12.6 GiB | – | huggingface.co 2026-08-06 |
| RTX 5070 Ti 16GB 内存: 125 GB | ComfyUI 0.30.1 | 同上 | 640×480 · 30 秒 | 峰值 14,197 MiB | 同上 | – | huggingface.co 2026-08-06 |
| RTX 3090 24GB 内存: 未说明 | ComfyUI 0.34.0 | 剪枝 INT8 DiT + LightX2V 4 步 LoRA | 1280×704 · 192 帧 · 4 步 | 第 1 步时 23,703 MiB(已中止) | – | – | github.com 2026-09-09 |
| RTX 3090 24GB 内存: 未说明 | ComfyUI 0.32 | 同系列 LoRA | 1344×768 · 192 帧 | 峰值约 19,575 MiB | – | – | github.com 2026-09-09 |
| RTX 5070 Ti 16GB 内存: 未说明 | ComfyUI 0.30.2 | 完整 INT8 ConvRot DiT + INT8 编码器 | 1280×736 · 362 帧 · 20 步 | 平均 15.1 GB | – | 26 分 20 秒(约 79 秒/步) | github.com 2026-08-16 |
| RTX 5070 Ti 16GB 内存: 未说明 | ComfyUI 0.33.1 | 同上 | 1280×736 · 362 帧 · 20 步 | 平均 15,773 MB | – | 预计约 2 小时(341+ 秒/步),已取消 | github.com 2026-08-16 |
| RTX 5070 Ti 16GB 内存: 16 GB | ComfyUI 0.34.2 / 0.35.0 | 社区混合 INT8 turbo DiT(10Eros Max H3)+ NVFP4 编码器 + INT8 VAE | 0.6 MP · 6 秒 · 6 步 | 约 74%(0.34.2);0.35.0 加 --vram-headroom 1 时约 90%,不加则整台电脑崩溃 | – | 129–154 秒 | github.com 2026-09-09 |
| RTX 4060 Laptop 8GB 内存: 16 GB | ComfyUI 0.34.0 + PR #16148 | 剪枝 W4A8 DiT + NVFP4 编码器 | 未说明(38,968 token)· 20 步 | 整张显卡 | – | 20 分 51 秒(72 秒/步) | github.com 2026-09-06 |
| RTX 3060 12GB 内存: 未说明 | ComfyUI | 8 步 Turbo LoRA,INT8 视频 VAE | 864×480 · 5 秒 · 8 步 | – | – | 4.5 分钟 | huggingface.co 2026-08-06 |
| RTX 5090 32GB 内存: 未说明 | ComfyUI 0.33.0 nightly | 剪枝 INT8 DiT + NVFP4 编码器 + 4 步 Turbo LoRA | 1344×768 · 56 帧 · 4 步 | – | – | 16.2 秒 | huggingface.co 2026-08-16 |
| Ryzen AI Max(Radeon 8060S),48 GB 用作显存 内存: 15 GB | ComfyUI | 剪枝 INT8 DiT + NVFP4 编码器,均完整加载 | 480p · 5 秒 · 20 步 | 全部权重常驻 | – | 29 分 30 秒(88.5 秒/步) | huggingface.co 2026-08-05 |
| DGX Spark GB10,128 GB 统一内存 内存: 共享 | ComfyUI 0.30.1 | 剪枝 INT8 DiT + NVFP4 编码器 + FP16 VAE | 864×480 · 39 / 56 / 124 帧 · 20 步 | – | 124 帧时容器内存约 39 GB | 88 / 122 / 326 秒 | github.com 2026-09-26 |
| H200 141GB 内存: 未说明 | ComfyUI | 剪枝 INT8 DiT,完整加载 | 1920×1088 · 10 秒 · 20 步 | – | – | 46 分 45 秒(140 秒/步) | huggingface.co 2026-08-06 |
文件大小于 读取自 Hugging Face API: Comfy-Org/MiniMax-H3、Abiray/
使用方法
- 选择扩散模型:完整版或剪枝版,BF16、INT8、FP8、W4A8、NVFP4 或某个 GGUF 量化。
- 选择文本编码器、视频 VAE,以及(如果使用)Fun ControlNet 补丁。
- 选择文本编码器的运行位置。ComfyUI 的默认行为(0.37 及以后、开启动态显存时)是先把它放在 GPU 上处理提示词,然后换出。
- 选择分辨率和时长。查看峰值区间、GPU 表格和每张卡需要的内存。“流式”表示 ComfyUI 把部分权重放在内存中,能跑但更慢。
常见问题
MiniMax H3 需要多少显存?
全精度文件共 115.1 GB(DiT 61.7 GB、Qwen3-VL-32B 编码器 48.0 GB、两个 VAE 5.4 GB)。Comfy-Org 最小的一套(剪枝 INT8 DiT、NVFP4 编码器、FP16 VAE)为 39.6 GB,而且 ComfyUI 从不需要同时放下全部:DiT 与编码器中较大的一个加上 VAE 为 24.9 GB,864×480、5 秒的视频再加 1.3–6.7 GB。更小的显卡也能跑,ComfyUI 会从系统内存流式加载其余权重。
需要多少系统内存?
不在 GPU 上的权重再加约 6 GB。最小的一套在 24 GB 显卡上生成 5 秒 864×480 视频,约需 28 GB。ComfyUI 默认会在内存中缓存每个文件,约需 46 GB:一块 5070 Ti 用了 45.4 GiB,加 --fast-disk 后为 12.6 GiB。一台 32 GB 内存的 3090 在 29.9 GB 时被杀掉,加上 --disable-pinned-memory 后降到 7.5 GB。
MiniMax H3 该用剪枝版还是完整版?
生成视频用剪枝版:剪枝 INT8 为 19.5 GB(完整版 31.7 GB),剪枝 BF16 为 37.5 GB(完整版 61.7 GB)。模型卡称 DiT 的 33B 参数中约 13B 是 AdaLN 调制分支,其输出可以预先计算;据 ComfyUI 博客,Comfy-Org 用查找表替换了它们,“输出质量没有损失”。完整文件用于微调。
为什么更新 ComfyUI 后 H3 变慢或崩溃?
好几个版本改变了 H3 的加载方式。Issue #15665:从 0.32.0 起,16 GB 显卡上 1280×736、362 帧的任务从每步约 79 秒变成 341 秒以上。Issue #16150:0.35.0 会占满显存,让部分电脑崩溃;--vram-headroom 1 和 --disable-comfy-compiler 有帮助。如果新版本在你的卡上更慢,用 --disable-dynamic-vram 把同一个工作流跑一次,比较每步耗时。
ComfyUI 0.37 对文本编码器做了什么改动?
PR #16374「Always put text encoder on GPU when dynamic vram on」于 2026-09-17 合并,随 v0.37.0 发布。开启动态显存(默认)时,Qwen3-VL-32B 编码器现在总是先在 GPU 上处理提示词,再换出给 DiT 腾地方,而 --lowvram 不起任何作用。想让编码器在 CPU 上运行,请用 --disable-dynamic-vram --lowvram 启动 ComfyUI。想知道哪种在你的卡上更快,就分别加和不加 --disable-dynamic-vram 运行同一个工作流,比较每步和每个提示词的耗时。
这里的 GB 指 GB 还是 GiB?
指 GiB,和 nvidia-smi 以及显卡显存标称使用的单位一致,全站都是如此。实测数据按作者使用的单位显示。
更多计算器
- 微调显存计算器 Transformers 或 Unsloth 中全参数微调、LoRA、QLoRA 需要的显存,并与公开实测对比。 打开 →
- vLLM KV cache 与并发计算器 vLLM 分配的 KV cache 池有多少 token、能同时处理多少请求,并给出 vllm serve 命令。 打开 →
- 我的电脑能跑什么? 在浏览器里识别你的 GPU,列出它能跑的本地大模型,以及最佳量化和速度。 打开 →
- MoE 卸载计算器
(--n-cpu-moe) 根据 GGUF 真实张量大小,找出能装进你显卡的最小 llama.cpp --n-cpu-moe。 打开 → - Qwen3.8 27B 新 GGUF 量化:Bonsai 2、GSQ-RCO 与 UD 对比 Qwen3.8 27B 的 Ternary Bonsai 2、GSQ-RCO 与 Unsloth UD 文件:显存、质量、速度,以及各自需要的推理引擎。 打开 →
- Qwen-Image-2.1 显存计算器 DiT、文本编码器和 VAE 各种组合的峰值显存,附真实显卡实测数据。 打开 →
更新于