8–96 GB 显存能跑哪些本地大模型

单张 24 GB 显卡、Q4_K_M、32K 上下文下,最大的稠密模型是 Muse Glimmer 30B(29.8B,19.5 GB,在一张 RTX 4090 上约 29–40 token/s);最大的 MoE 是并列的 Ornith 1.5 35B-A3B 和 Qwen3.6 35B-A3B(总参数 36.0B、激活 3.0B,23.5 GB,约 103–184 token/s);占用 12 GB 以上的模型中,上下文最长的是 Nemotron 3 Nano 30B-A3B(完整 256K 上下文占 21.7 GB);Q8_0 下最大的是 Gemma 4 12B(12.0B,14.6 GB)。

下表列出每档显存在 32,768 token 上下文、单个请求、FP16 KV 缓存下能放进单张显卡的最大模型,点击容量查看该档的完整列表、最新模型和常见问题。这是容量对比,不是质量排名。总显存 = 权重 + KV 缓存 + 0.5 GB + 10% 开销;GB = GiB。速度为该档一张代表显卡上的带宽估算。数据更新于 。

不确定自己的显存有多大?让浏览器识别你的 GPU,直接看电脑能跑什么。

各档显存的首选模型(Q4_K_M、32K 上下文)

显存 最大稠密模型 最大 MoE 最长上下文(占用过半显存的模型) Q8_0 下最大 能放进
8 GB
RTX 4060 8GB
MiMo V2.6 Distill Qwen 9B
7.4 GB, 21–30 tok/s
LFM2.5 8B-A1B (MoE)
6.2 GB, 57–99 tok/s
Ling 3.0 Tiny 7.9B-A1.3B (MoE)
128K, 6.3 GB
Spark-X2.5 4B
6.3 GB
10 / 61
12 GB
RTX 4070 12GB
Gemma 4 12B
9.0 GB, 32–45 tok/s
LFM2.5 8B-A1B (MoE)
6.2 GB, 98–175 tok/s
Gemma 4 12B
178K, 11.5 GB
LFM2.5 8B-A1B (MoE)
10.1 GB
17 / 61
16 GB
RTX 5060 Ti 16GB
Gemma 4 12B
9.0 GB, 29–40 tok/s
gpt-oss-20b
MXFP4, 15.4 GB, 40–68 tok/s
Gemma 4 12B
256K, 12.8 GB
Gemma 4 12B
14.6 GB
18 / 61
24 GB
RTX 4090
Muse Glimmer 30B
19.5 GB, 29–40 tok/s
Ornith 1.5 35B-A3B (MoE)
23.5 GB, 103–184 tok/s
Nemotron 3 Nano 30B-A3B (MoE)
256K, 21.7 GB
Gemma 4 12B
14.6 GB
32 / 61
32 GB
RTX 5090
Gemma 4 31B
23.9 GB, 40–57 tok/s
K2-Horizon MoVA 36B-A4B (MoE)
30.3 GB, 56–96 tok/s
Ornith 1.5 35B-A3B (MoE)
256K, 28.3 GB
Gemma 4 26B-A4B (MoE)
29.6 GB
35 / 61
48 GB
L40S
Gemma 4 31B
23.9 GB, 20–28 tok/s
K2-Horizon MoVA 36B-A4B (MoE)
30.3 GB, 28–48 tok/s
K2-Horizon MoVA 36B-A4B (MoE)
115K, 47.5 GB
Ornith 1.5 35B-A3B (MoE)
40.3 GB
35 / 61
96 GB
RTX PRO 6000 Blackwell
Mistral Medium 3.5 128B
91.8 GB, 11–15 tok/s
Qwen3.5 122B-A10B (MoE)
78.8 GB, 70–123 tok/s
Qwen3.5 122B-A10B (MoE)
256K, 84.6 GB
AliceAI Foundation 80B-A3B (MoE)
89.8 GB
42 / 61

每档显存的直接答案

完整的数字(含 8K 和 128K 上下文、FP16 以及 80 GB 显卡)见开放数据集和模型与 GPU 对比报告(英文);由这些数据算出的汇总数字见大模型显存统计。模型页(英文)列出了每一步计算。