LLM 显存计算器
选一个预设模型,或从 Hugging Face 加载任意模型,再设置量化精度、上下文长度和并发请求数,就能看到推理需要多少显存、哪些 GPU 装得下。所有计算都在浏览器中完成。
高级:模型参数与运行开销
修改其中任意一项,模型会切换为“自定义”。
– 预计显存占用
- 权重
- –
- KV cache
- –
- 运行开销
- –
- 每 token 的 KV cache
- –
哪些 GPU 能跑
| GPU | 显存 | 结果 |
|---|---|---|
| RTX 3060 | 12 GB | – |
| RTX 4060 Ti 16GB | 16 GB | – |
| RTX 3090 / 4090 | 24 GB | – |
| RTX 5090 | 32 GB | – |
| A100 40GB | 40 GB | – |
| Mac,64 GB 统一内存 默认约 75% 可供 GPU 使用 | 48 GB | – |
| L40S / RTX 6000 Ada | 48 GB | – |
| A100 / H100 80GB | 80 GB | – |
| Mac,128 GB 统一内存 默认约 75% 可供 GPU 使用 | 96 GB | – |
| H200 | 141 GB | – |
| B200 | 180 GB | – |
装得下?接着看看它每秒能生成多少 token。
要微调而不是推理?估算全参数微调、LoRA 和 QLoRA 所需显存。
热门模型显存需求
按 8,192 token 上下文、单个请求、FP16 KV cache 计算的总显存。点击模型名可进入它的独立页面(英文),查看所有量化精度、长上下文缓存和能装下的 GPU。
| 模型 | 参数量 | 原始格式 | Q8_0 | Q4_K_M | Q4_K_M 可运行于 |
|---|---|---|---|---|---|
| Qwen3-Coder 30B-A3B (MoE) | 30.5B | 63.9 GB (BF16) | 34.6 GB | 20.2 GB | RTX 3090 |
| Ornith 1.0 35B (MoE) | 35.1B | 72.6 GB (BF16) | 38.9 GB | 22.4 GB | RTX 3090 |
| Ornith 1.0 9B | 9.4B | 20.1 GB (BF16) | 11.0 GB | 6.61 GB | RTX 4060 8GB |
| Granite 4.2 30B | 29.3B | 62.7 GB (BF16) | 34.6 GB | 20.8 GB | RTX 3090 |
| Granite 4.2 8B | 8.8B | 19.9 GB (BF16) | 11.4 GB | 7.32 GB | RTX 4060 8GB |
| Granite 4.2 3B | 3.7B | 8.69 GB (BF16) | 5.17 GB | 3.46 GB | RTX 4060 8GB |
| Spark-X2.5 4B | 4.1B | 9.35 GB (BF16) | 5.40 GB | 3.47 GB | RTX 4060 8GB |
| Ling 3.0 Tiny 7.9B-A1.3B (MoE) | 7.9B | 16.7 GB (BF16) | 9.15 GB | 5.45 GB | RTX 4060 8GB |
| LFM2.5 8B-A1B (MoE) | 8.5B | 18.0 GB (BF16) | 9.82 GB | 5.85 GB | RTX 4060 8GB |
| Step 3.7 Flash 196B-A11B (MoE) | 201.4B | 414 GB (BF16) | 220 GB | 126 GB | H200 |
| Hy4 Preview 770B-A49B (MoE) | 780.0B | 1,599 GB (BF16) | 850 GB | 485 GB | 8× H100 SXM |
| Limite 1B Violetto | 1.0B | 2.79 GB (BF16) | 1.80 GB | 1.31 GB | RTX 4060 8GB |
| ZDTaichu 5.0 9B | 9.8B | 20.8 GB (BF16) | 11.4 GB | 6.85 GB | RTX 4060 8GB |
| Hemmingway-1 27B | 27.3B | 57.0 GB (BF16) | 30.8 GB | 18.0 GB | RTX 3090 |
| MiMo V2.6 Distill Qwen 9B | 9.4B | 20.1 GB (BF16) | 11.0 GB | 6.61 GB | RTX 4060 8GB |
| K2-Horizon MoVA 36B-A4B (MoE) | 37.4B | 78.9 GB (BF16) | 42.9 GB | 25.4 GB | RTX 5090 |
| IQuest-Q1 320B-A15B (MoE) | 320.3B | 659 GB (BF16) | 351 GB | 201 GB | M3 Ultra Mac Studio (512 GB) |
| LLM-jp-4.1 32B-A3B Thinking (MoE) | 32.1B | 66.9 GB (BF16) | 36.0 GB | 21.0 GB | RTX 3090 |
| Ornith 1.5 35B-A3B (MoE) | 36.0B | 74.3 GB (BF16) | 39.8 GB | 23.0 GB | RTX 3090 |
| Ornith 1.5 9B | 9.7B | 20.6 GB (BF16) | 11.3 GB | 6.76 GB | RTX 4060 8GB |
| AliceAI Foundation 80B-A3B (MoE) | 81.3B | 167 GB (BF16) | 89.2 GB | 51.1 GB | 2× RTX 5090 |
| DeepSeek V4 Flash 0731 | 304.2B | 172 GB (4.4 bits/weight) | 332 GB | 190 GB | M3 Ultra Mac Studio (512 GB) |
| Qwen3.6 35B-A3B (MoE) | 36.0B | 74.3 GB (BF16) | 39.8 GB | 23.0 GB | RTX 3090 |
| Qwen3.6 27B | 27.8B | 58.0 GB (BF16) | 31.3 GB | 18.3 GB | RTX 3090 |
| Qwen3.8 27B | 27.8B | 58.0 GB (BF16) | 31.3 GB | 18.3 GB | RTX 3090 |
| Qwen3.8 Flash Next (180B MoE) | 180.0B | 370 GB (BF16) | 197 GB | 112 GB | DGX Spark (128 GB) |
| Qwen3.8 2.4T-A95B (MoE) | 2.45T | 5,013 GB (BF16) | 2,664 GB | 1,517 GB | 超过 8 张 GPU |
| Qwen3.5 9B | 9.7B | 20.6 GB (BF16) | 11.3 GB | 6.76 GB | RTX 4060 8GB |
| Qwen3.5 122B-A10B (MoE) | 125.1B | 257 GB (BF16) | 137 GB | 78.2 GB | A100 80GB |
| Qwen3-Coder-Next (80B MoE) | 79.7B | 164 GB (BF16) | 87.4 GB | 50.1 GB | 2× RTX 5090 |
| DeepSeek V4.1 Flash | 763.2B | 524 GB (5.3 bits/weight) | 832 GB | 474 GB | 8× H100 SXM |
| DeepSeek V4 Flash | 290.9B | 165 GB (4.4 bits/weight) | 318 GB | 182 GB | M3 Ultra Mac Studio (512 GB) |
| DeepSeek V4 Pro | 1.60T | 887 GB (4.3 bits/weight) | 1,742 GB | 993 GB | 8× H200 |
| DeepSeek V3.2 | 685.4B | 707 GB (FP8) | 747 GB | 426 GB | 8× H100 SXM |
| GLM-5.3 | 753.3B | 775 GB (FP8) | 821 GB | 468 GB | 8× H100 SXM |
| GLM-5.3 Flash | 321.3B | 337 GB (FP8) | 350 GB | 200 GB | M3 Ultra Mac Studio (512 GB) |
| GLM-5.2 | 753.3B | 1,545 GB (BF16) | 821 GB | 468 GB | 8× H100 SXM |
| GLM-4.7 Flash | 31.2B | 64.9 GB (BF16) | 34.9 GB | 20.3 GB | RTX 3090 |
| Gemma 4 31B | 31.3B | 66.6 GB (BF16) | 36.5 GB | 21.9 GB | RTX 3090 |
| Gemma 4 26B-A4B (MoE) | 25.8B | 53.9 GB (BF16) | 29.1 GB | 17.0 GB | RTX 3090 |
| Gemma 4 12B | 12.0B | 25.7 GB (BF16) | 14.2 GB | 8.57 GB | RTX 3060 12GB |
| Gemma 4 E4B | 8.0B | 17.1 GB (BF16) | 9.38 GB | 5.64 GB | RTX 4060 8GB |
| Kimi K3 | 2.78T | 1,600 GB (4.5 bits/weight) | 3,027 GB | 1,724 GB | 超过 8 张 GPU |
| MiniMax M3 | 427.0B | 877 GB (BF16) | 466 GB | 266 GB | M3 Ultra Mac Studio (512 GB) |
| MiniMax M2.7 | 228.7B | 238 GB (FP8) | 252 GB | 144 GB | B200 |
| MiMo V2.6 Flash | 310.8B | 178 GB (4.5 bits/weight) | 339 GB | 193 GB | M3 Ultra Mac Studio (512 GB) |
| MiMo V2.6 Pro | 1.02T | 581 GB (4.4 bits/weight) | 1,116 GB | 636 GB | 8× H100 SXM |
| Mistral Medium 3.5 128B | 127.7B | 140 GB (FP8) | 143 GB | 82.7 GB | Ryzen AI Max+ 395 (128 GB) |
| Nemotron 3 Nano 4B | 4.0B | 8.78 GB (BF16) | 4.96 GB | 3.10 GB | RTX 4060 8GB |
| Nemotron 3 Nano 30B-A3B (MoE) | 31.6B | 65.3 GB (BF16) | 34.9 GB | 20.1 GB | RTX 3090 |
| Nemotron 3 Super 120B-A12B (MoE) | 123.6B | 254 GB (BF16) | 135 GB | 77.2 GB | A100 80GB |
| Xing 4.0 29B-A4B (MoE) | 31.2B | 64.8 GB (BF16) | 34.9 GB | 20.2 GB | RTX 3090 |
| Muse Glimmer 30B | 29.8B | 61.7 GB (BF16) | 33.1 GB | 19.2 GB | RTX 3090 |
| MiniCPM5 2B | 2.5B | 6.02 GB (BF16) | 3.60 GB | 2.42 GB | RTX 4060 8GB |
| Llama 3.1 8B | 8.0B | 18.1 GB (BF16) | 10.3 GB | 6.58 GB | RTX 4060 8GB |
| Llama 3.1 70B | 70.6B | 148 GB (BF16) | 80.0 GB | 47.0 GB | M4 Pro Mac (64 GB) |
| Qwen3 8B | 8.2B | 18.5 GB (BF16) | 10.7 GB | 6.81 GB | RTX 4060 8GB |
| Qwen3 30B-A3B (MoE) | 30.5B | 63.9 GB (BF16) | 34.6 GB | 20.2 GB | RTX 3090 |
| gpt-oss-20b | 20.9B | 14.8 GB (MXFP4) | 23.5 GB | 13.7 GB | RTX 4060 Ti 16GB |
| gpt-oss-120b | 116.8B | 67.7 GB (MXFP4) | 128 GB | 73.2 GB | A100 80GB |
| DeepSeek V3 / R1 (671B) | 684.5B | 707 GB (FP8) | 746 GB | 425 GB | 8× H100 SXM |
你的 GPU 能跑什么?
上表所有模型逐一对照单张显卡或 Mac:能装下的最佳精度、最长上下文和速度(英文页面)。
- RTX 4060 8GB
- RTX 3060 12GB
- Arc B580 12GB
- RTX 4070 12GB
- RTX 5070 12GB
- RTX 4060 Ti 16GB
- RTX 5060 Ti 16GB
- RX 9070 XT 16GB
- RTX 4070 Ti Super 16GB
- RTX 4080 Super 16GB
- RTX 5070 Ti 16GB
- RTX 5080 16GB
- RTX 3090
- RTX 4090
- RX 7900 XTX
- RTX 5090
- M4 Pro Mac (64 GB)
- M4 Max Mac (128 GB)
- M3 Ultra Mac Studio (512 GB)
- Ryzen AI Max+ 395 (128 GB)
- DGX Spark (128 GB)
- L40S
- RTX PRO 6000 Blackwell
- A100 80GB
- H100 SXM
- H200
- B200
- M1 Mac (8 GB)
- M1 Mac (16 GB)
- M2 or M3 Mac (8 GB)
- M2 or M3 Mac (16 GB)
- M2 or M3 Mac (24 GB)
- M4 Mac (16 GB)
- M4 Mac (24 GB)
- M4 Mac (32 GB)
- M5 Mac (16 GB)
- M5 Mac (24 GB)
- M5 Mac (32 GB)
- M1 Pro or M2 Pro Mac (16 GB)
- M1 Pro or M2 Pro Mac (32 GB)
- M3 Pro Mac (18 GB)
- M3 Pro Mac (36 GB)
- M4 Pro Mac (24 GB)
- M4 Pro Mac (48 GB)
- M5 Pro Mac (24 GB)
- M5 Pro Mac (48 GB)
- M5 Pro Mac (64 GB)
- M1 Max or M2 Max Mac (32 GB)
- M1–M3 Max Mac (64 GB)
- M3 Max Mac (36 GB)
- M3 Max Mac (128 GB)
- M4 Max Mac (36 GB)
- M4 Max Mac (48 GB)
- M4 Max Mac (64 GB)
- M5 Max Mac (36 GB)
- M5 Max Mac (48 GB)
- M5 Max Mac (64 GB)
- M5 Max Mac (128 GB)
- CPU only, DDR4-3200 dual channel (16 GB)
- CPU only, DDR4-3200 dual channel (32 GB)
- CPU only, DDR4-3200 dual channel (64 GB)
- CPU only, DDR5-5600 dual channel (32 GB)
- CPU only, DDR5-5600 dual channel (64 GB)
- CPU only, DDR5-5600 dual channel (128 GB)
- CPU only, DDR4-3200 quad channel (128 GB)
- CPU only, DDR4-3200 quad channel (256 GB)
- 2× RTX 3060 12GB
- 2× RTX 3090
- 4× RTX 3090
- 2× RTX 4090
- 2× RTX 5090
- 8× H100 SXM
- 8× H200
用 vLLM 部署服务?vLLM KV cache 计算器会算出启动时分配的缓存池有多少 token、能同时处理多少请求,并给出 vllm serve 命令。
看看 8–96 GB 显存能跑哪些本地大模型(例如 24 GB),或在可复现的对比报告(英文)中比较各模型与 GPU 显存。这些数字也是开放数据集(CSV 与 JSON,CC BY 4.0)。所有精度的数据也发布在 GitHub 上的 CSV 文件中,可自由使用。不确定选哪种 GGUF?请看 GGUF 量化类型详解(英文);想在 8–16 GB 显卡上跑 Qwen3.8 27B,请看 Ternary Bonsai 2、GSQ-RCO 与 UD 量化对比。估算和实测差多少,见估算准确度:预测与实测对比;自己测过,欢迎在 GitHub 上提交实测(附原始日志行)。
使用方法
- 选择模型,或输入 Hugging Face 模型 id(如 Qwen/Qwen3-8B)后点击“加载”。
- 选择打算使用的权重精度,比如 llama.cpp 常用 Q4_K_M,vLLM 常用 FP8。
- 设置上下文长度和同时处理的请求数。
- 查看总显存和 GPU 表格。展开“高级”可以查看或修改估算用到的每个数字。
常见问题
Qwen3.6 27B 在 Q4_K_M 下需要多少显存?
8,192 token 上下文约需 18.3 GB,32,768 token 约需 19.9 GB(单个请求、FP16 KV 缓存);仅权重就占 15.7 GB。所以它能以 32K 上下文放进一张 24 GB 显卡,比如 RTX 3090 或 4090。
大模型显存是怎么计算的?
权重 = 参数量 × 每个权重的位数 ÷ 8。KV cache = 2 × 层数 × KV 头数 × 头维度 × 每个值的字节数 × token 数 × 请求数。运行开销 = CUDA 上下文 0.5 GB,再加上权重与缓存之和的 10%,用于激活值和显存碎片;这个 10% 可以在“高级”里修改。
为什么上下文长度影响这么大?
KV cache 随每个请求的每个 token 增长。Llama 3.1 8B 每个 token 需要 128 KB 的 FP16 缓存,所以一段 128K token 的对话要在权重之外再占 16 GB。改用 FP8 缓存可以减半。
Qwen3-30B-A3B 这类 MoE 模型需要的显存更少吗?
每个 token 只有少数几个专家参与计算,但所有专家都必须加载,所以权重显存取决于总参数量:Qwen3-30B-A3B 是 305 亿,而不是 30 亿。
该选哪种 GGUF 量化?
Q4_K_M 是最常用的默认选择,体积约为 BF16 的三分之一;Q5_K_M 和 Q6_K 保留更多质量,适合写代码和小模型;Q3_K_M 和 Q2_K 能让模型塞进更小的显存,但质量损失明显。本站的 GGUF 量化指南列出了每种类型的每权重位数和热门模型的体积。
量化权重会让 KV cache 变小吗?
不会。权重精度和 KV cache 精度是两个独立的设置,Q4 权重配 FP16 缓存时,缓存仍是完整大小。
新架构是怎么处理的?
所有数据都来自模型的 config.json。多头潜在注意力(MLA,用于 DeepSeek V3、GLM-5.3、Kimi K3)每层每个 token 只缓存 576 个值,而不是完整的 K 和 V;DeepSeek V3.2 和 GLM-5 还会为稀疏注意力索引器给每个 token 额外存一个 128 维的 FP8 key。滑动窗口层只保留窗口内的内容:gpt-oss 有一半层的窗口是 128 个 token;Gemma 4 31B 的 60 层中有 50 层窗口为 1,024 个 token,其余 10 层缓存 4 个 512 维的头,同时充当 K 和 V。线性注意力层保存固定大小的状态,不会随上下文增长:Qwen3.8 27B 的 64 层中有 48 层,Kimi K3 的 93 层中有 69 层。DeepSeek V4 还会跨层共享并压缩缓存,计算器没有建模这一点,所以它的 KV 数字是上限。
“原始格式”是什么意思?
它直接使用模型在 Hugging Face 上的权重文件大小,所以即使是混合格式的检查点,比如 gpt-oss 的 MXFP4 专家,或 DeepSeek V4、MiMo V2.6 的 4-bit 专家,结果也和下载大小一致。
显存估算准确吗?
这是估算值。推理引擎会分配自己的缓冲区:vLLM 启动时会预留固定比例的显存,llama.cpp 启动时就按完整上下文分配缓存。请留出余量,尤其是这块 GPU 还要驱动显示器的时候。
我输入的内容会被上传吗?
计算在你的浏览器中进行。唯一的网络请求是加载模型时访问 Hugging Face。
更多计算器
- 微调显存计算器 Transformers 或 Unsloth 中全参数微调、LoRA、QLoRA 需要的显存,并与公开实测对比。 打开 →
- vLLM KV cache 与并发计算器 vLLM 分配的 KV cache 池有多少 token、能同时处理多少请求,并给出 vllm serve 命令。 打开 →
- 我的电脑能跑什么? 在浏览器里识别你的 GPU,列出它能跑的本地大模型,以及最佳量化和速度。 打开 →
- MiniMax H3 显存计算器
(ComfyUI) MiniMax H3 视频在 ComfyUI 中的显存与系统内存:剪枝版、INT8、NVFP4 和 GGUF 文件在 8–96 GB 显卡上的表现。 打开 → - MoE 卸载计算器
(--n-cpu-moe) 根据 GGUF 真实张量大小,找出能装进你显卡的最小 llama.cpp --n-cpu-moe。 打开 → - Qwen3.8 27B 新 GGUF 量化:Bonsai 2、GSQ-RCO 与 UD 对比 Qwen3.8 27B 的 Ternary Bonsai 2、GSQ-RCO 与 Unsloth UD 文件:显存、质量、速度,以及各自需要的推理引擎。 打开 →
更新于