8–96 GB 显存能跑哪些本地大模型
单张 24 GB 显卡、Q4_K_M、32K 上下文下,最大的稠密模型是 Muse Glimmer 30B(29.8B,19.5 GB,在一张 RTX 4090 上约 29–40 token/s);最大的 MoE 是并列的 Ornith 1.5 35B-A3B 和 Qwen3.6 35B-A3B(总参数 36.0B、激活 3.0B,23.5 GB,约 103–184 token/s);占用 12 GB 以上的模型中,上下文最长的是 Nemotron 3 Nano 30B-A3B(完整 256K 上下文占 21.7 GB);Q8_0 下最大的是 Gemma 4 12B(12.0B,14.6 GB)。
下表列出每档显存在 32,768 token 上下文、单个请求、FP16 KV 缓存下能放进单张显卡的最大模型,点击容量查看该档的完整列表、最新模型和常见问题。这是容量对比,不是质量排名。总显存 = 权重 + KV 缓存 + 0.5 GB + 10% 开销;GB = GiB。速度为该档一张代表显卡上的带宽估算。数据更新于 。
不确定自己的显存有多大?让浏览器识别你的 GPU,直接看电脑能跑什么。
各档显存的首选模型(Q4_K_M、32K 上下文)
| 显存 | 最大稠密模型 | 最大 MoE | 最长上下文(占用过半显存的模型) | Q8_0 下最大 | 能放进 |
|---|---|---|---|---|---|
| 8 GB RTX 4060 8GB | MiMo V2.6 Distill Qwen 9B 7.4 GB, 21–30 tok/s | LFM2.5 8B-A1B (MoE) 6.2 GB, 57–99 tok/s | Ling 3.0 Tiny 7.9B-A1.3B (MoE) 128K, 6.3 GB | Spark-X2.5 4B 6.3 GB | 10 / 61 |
| 12 GB RTX 4070 12GB | Gemma 4 12B 9.0 GB, 32–45 tok/s | LFM2.5 8B-A1B (MoE) 6.2 GB, 98–175 tok/s | Gemma 4 12B 178K, 11.5 GB | LFM2.5 8B-A1B (MoE) 10.1 GB | 17 / 61 |
| 16 GB RTX 5060 Ti 16GB | Gemma 4 12B 9.0 GB, 29–40 tok/s | gpt-oss-20b MXFP4, 15.4 GB, 40–68 tok/s | Gemma 4 12B 256K, 12.8 GB | Gemma 4 12B 14.6 GB | 18 / 61 |
| 24 GB RTX 4090 | Muse Glimmer 30B 19.5 GB, 29–40 tok/s | Ornith 1.5 35B-A3B (MoE) 23.5 GB, 103–184 tok/s | Nemotron 3 Nano 30B-A3B (MoE) 256K, 21.7 GB | Gemma 4 12B 14.6 GB | 32 / 61 |
| 32 GB RTX 5090 | Gemma 4 31B 23.9 GB, 40–57 tok/s | K2-Horizon MoVA 36B-A4B (MoE) 30.3 GB, 56–96 tok/s | Ornith 1.5 35B-A3B (MoE) 256K, 28.3 GB | Gemma 4 26B-A4B (MoE) 29.6 GB | 35 / 61 |
| 48 GB L40S | Gemma 4 31B 23.9 GB, 20–28 tok/s | K2-Horizon MoVA 36B-A4B (MoE) 30.3 GB, 28–48 tok/s | K2-Horizon MoVA 36B-A4B (MoE) 115K, 47.5 GB | Ornith 1.5 35B-A3B (MoE) 40.3 GB | 35 / 61 |
| 96 GB RTX PRO 6000 Blackwell | Mistral Medium 3.5 128B 91.8 GB, 11–15 tok/s | Qwen3.5 122B-A10B (MoE) 78.8 GB, 70–123 tok/s | Qwen3.5 122B-A10B (MoE) 256K, 84.6 GB | AliceAI Foundation 80B-A3B (MoE) 89.8 GB | 42 / 61 |
每档显存的直接答案
- 8 GB 显存最佳本地大模型:单张 8 GB 显卡、Q4_K_M、32K 上下文下,最大的稠密模型是并列的 MiMo V2.6 Distill Qwen 9B 和 Ornith 1.0 9B(9.4B,7.4 GB,在一张 RTX 4060 8GB 上约 21–30 token/s);最大的 MoE 是 LFM2.5 8B-A1B(总参数 8.5B、激活 1.5B,6.2 GB,约 57–99 token/s);占用 4 GB 以上的模型中,上下文最长的是 Ling 3.0 Tiny 7.9B-A1.3B(完整 128K 上下文占 6.3 GB);Q8_0 下最大的是 Spark-X2.5 4B(4.1B,6.3 GB)。
- 12 GB 显存最佳本地大模型:单张 12 GB 显卡、Q4_K_M、32K 上下文下,最大的稠密模型是 Gemma 4 12B(12.0B,9.0 GB,在一张 RTX 4070 12GB 上约 32–45 token/s);最大的 MoE 是 LFM2.5 8B-A1B(总参数 8.5B、激活 1.5B,6.2 GB,约 98–175 token/s);占用 6 GB 以上的模型中,上下文最长的是 Gemma 4 12B(最多 178K 上下文占 11.5 GB);Q8_0 下最大的是 LFM2.5 8B-A1B(MoE,总参数 8.5B、激活 1.5B,10.1 GB)。
- 16 GB 显存最佳本地大模型:单张 16 GB 显卡、Q4_K_M、32K 上下文下,最大的稠密模型是 Gemma 4 12B(12.0B,9.0 GB,在一张 RTX 5060 Ti 16GB 上约 29–40 token/s);最大的 MoE 是 gpt-oss-20b(总参数 20.9B、激活 3.6B,MXFP4,15.4 GB,约 40–68 token/s);占用 8 GB 以上的模型中,上下文最长的是 Gemma 4 12B(完整 256K 上下文占 12.8 GB);Q8_0 下最大的是 Gemma 4 12B(12.0B,14.6 GB)。
- 24 GB 显存最佳本地大模型:单张 24 GB 显卡、Q4_K_M、32K 上下文下,最大的稠密模型是 Muse Glimmer 30B(29.8B,19.5 GB,在一张 RTX 4090 上约 29–40 token/s);最大的 MoE 是并列的 Ornith 1.5 35B-A3B 和 Qwen3.6 35B-A3B(总参数 36.0B、激活 3.0B,23.5 GB,约 103–184 token/s);占用 12 GB 以上的模型中,上下文最长的是 Nemotron 3 Nano 30B-A3B(完整 256K 上下文占 21.7 GB);Q8_0 下最大的是 Gemma 4 12B(12.0B,14.6 GB)。
- 32 GB 显存最佳本地大模型:单张 32 GB 显卡、Q4_K_M、32K 上下文下,最大的稠密模型是 Gemma 4 31B(31.3B,23.9 GB,在一张 RTX 5090 上约 40–57 token/s);最大的 MoE 是 K2-Horizon MoVA 36B-A4B(总参数 37.4B、激活 4.0B,30.3 GB,约 56–96 token/s);占用 16 GB 以上的模型中,上下文最长的是并列的 Ornith 1.5 35B-A3B 和 Qwen3.6 35B-A3B(完整 256K 上下文占 28.3 GB);Q8_0 下最大的是 Gemma 4 26B-A4B(MoE,总参数 25.8B、激活 4.0B,29.6 GB)。
- 48 GB 显存最佳本地大模型:单张 48 GB 显卡、Q4_K_M、32K 上下文下,最大的稠密模型是 Gemma 4 31B(31.3B,23.9 GB,在一张 L40S 上约 20–28 token/s);最大的 MoE 是 K2-Horizon MoVA 36B-A4B(总参数 37.4B、激活 4.0B,30.3 GB,约 28–48 token/s);占用 24 GB 以上的模型中,上下文最长的是 K2-Horizon MoVA 36B-A4B(最多 115K 上下文占 47.5 GB);Q8_0 下最大的是并列的 Ornith 1.5 35B-A3B 和 Qwen3.6 35B-A3B(MoE,总参数 36.0B、激活 3.0B,40.3 GB)。
- 96 GB 显存最佳本地大模型:单张 96 GB 显卡、Q4_K_M、32K 上下文下,最大的稠密模型是 Mistral Medium 3.5 128B(127.7B,91.8 GB,在一张 RTX PRO 6000 Blackwell 上约 11–15 token/s);最大的 MoE 是 Qwen3.5 122B-A10B(总参数 125.1B、激活 10.0B,78.8 GB,约 70–123 token/s);占用 48 GB 以上的模型中,上下文最长的是 Qwen3.5 122B-A10B(完整 256K 上下文占 84.6 GB);Q8_0 下最大的是 AliceAI Foundation 80B-A3B(MoE,总参数 81.3B、激活 3.0B,89.8 GB)。
完整的数字(含 8K 和 128K 上下文、FP16 以及 80 GB 显卡)见开放数据集和模型与 GPU 对比报告(英文);由这些数据算出的汇总数字见大模型显存统计。模型页(英文)列出了每一步计算。