大模型显存统计
15 个数字,全部在构建时由 55 个开源模型的开放数据集计算得出,与计算器使用同一套公式。每一条都附有计算方法和引用格式。数据版本 1.2026-09-29b,模型数据核对于 。GB = GiB。
24 GB 显卡能装下多少个开源大模型?
28 / 55
55 个开源模型中有 28 个(51%)能以 Q4_K_M、32K token 上下文放进单张 24 GB 显卡。
方法:权重按每参数 4.84 位,FP16 KV 缓存按 32,768 token、单个请求,另加 0.5 GB 和 10% 开销,与 24 GiB 比较;最长上下文不足 32K 的模型不算能放下。
引用:来源:ModelVRAM,modelvram.com/llm-vram-stats/,数据版本 1.2026-09-29b
16 GB 显卡能装下多少个开源大模型?
15 / 55
55 个开源模型中有 15 个(27%)能以 Q4_K_M、32K token 上下文放进单张 16 GB 显卡。
方法:规则同 24 GB,与 16 GiB 比较。
引用:来源:ModelVRAM,modelvram.com/llm-vram-stats/,数据版本 1.2026-09-29b
要跑一半的开源大模型需要多少显存?
24 GB
要以 Q4_K_M、32K token 上下文装下 55 个模型中的至少一半,显卡需要 24 GB 显存(可装下 28 个),例如 RTX 3090、RTX 4090、RX 7900 XTX。
方法:在本站有页面的 GPU 和 Mac 的显存容量中,按上面的规则能装下至少一半模型的最小容量。
引用:来源:ModelVRAM,modelvram.com/llm-vram-stats/,数据版本 1.2026-09-29b
典型的开源大模型需要多少显存?
23.9 GB
开源模型在 Q4_K_M、32K token 上下文下的显存中位数为 23.9 GB。
方法:对最长上下文达到 32,768 token 的 55 个模型,取 q4_k_m_32k_total_gib 列的中位数。
引用:来源:ModelVRAM,modelvram.com/llm-vram-stats/,数据版本 1.2026-09-29b
MoE 模型每个 token 用到多少参数?
5.4%
MoE 模型每个 token 用到的参数比例中位数为 5.4%,但全部参数都必须放在显存里。
方法:模型卡给出的激活参数 ÷ 总参数,对 36 个 MoE 模型取中位数。
引用:来源:ModelVRAM,modelvram.com/llm-vram-stats/,数据版本 1.2026-09-29b
混合注意力模型的 KV 缓存少多少?
24 KB 对 121 KB
混合架构模型每个 token 上下文的 FP16 KV 缓存中位数为 24 KB,每层都是全注意力的模型为 121 KB。
方法:混合架构:34 个含线性注意力、状态空间、滑动窗口或共享缓存层的模型。全注意力:14 个每层都缓存 K 和 V 的模型;7 个每层都是 MLA 的模型不计入任何一组。KB = 1,024 字节,按滑动窗口填满后计算。
引用:来源:ModelVRAM,modelvram.com/llm-vram-stats/,数据版本 1.2026-09-29b
128K 上下文要多占多少显存?
+5.4 GB
上下文从 8K 增加到 128K token,Q4_K_M 下显存增加量的中位数为 5.4 GB。
方法:对最长上下文达到 131,072 token 的 51 个模型,取 q4_k_m_128k_total_gib 减 q4_k_m_8k_total_gib 的中位数;FP16 缓存、单个请求、含开销。
引用:来源:ModelVRAM,modelvram.com/llm-vram-stats/,数据版本 1.2026-09-29b
KV 缓存什么时候比模型权重还大?
6 / 51
51 个模型中有 6 个(12%)单个 128K token 请求的 FP16 KV 缓存比 Q4_K_M 权重还大。
方法:对最长上下文达到 131,072 token 的模型,比较 kv_cache_128k_gib 与 q4_k_m_weights_gib。
引用:来源:ModelVRAM,modelvram.com/llm-vram-stats/,数据版本 1.2026-09-29b
多少开源大模型支持 256K 上下文?
67%
55 个开源模型中有 37 个(67%)支持 256K token 或更长的上下文。
方法:max_context 列(config.json 中的最长上下文)不小于 262,144 token。
引用:来源:ModelVRAM,modelvram.com/llm-vram-stats/,数据版本 1.2026-09-29b
24 GB 显卡能装下的最大模型是哪个?
36.0B
能以 Q4_K_M、32K token 上下文放进单张 24 GB 显卡的最大开源模型是 Ornith 1.5 35B-A3B、Qwen3.6 35B-A3B,36.0B 参数,需要 23.5 GB。 模型页(英文)。
方法:在 24 GB 统计中能放下的模型里,总参数最多的一个。
引用:来源:ModelVRAM,modelvram.com/llm-vram-stats/,数据版本 1.2026-09-29b
多少开源大模型一张 80 GB 显卡装不下?
20 / 55
55 个开源模型中有 20 个(36%)即使用 Q4_K_M、32K token 上下文,也放不进单张 80 GB 显卡。
方法:规则同 24 GB,与 80 GiB 比较;上下文取 32,768 token,模型更短时取其最长上下文。
引用:来源:ModelVRAM,modelvram.com/llm-vram-stats/,数据版本 1.2026-09-29b
多少开源大模型的 FP16 权重超过 80 GB?
26 / 55
55 个开源模型中有 26 个(47%)仅 FP16 权重就超过 80 GB,还未计入 KV 缓存。
方法:fp16_weights_gib 大于 80,即总参数 × 2 字节。
引用:来源:ModelVRAM,modelvram.com/llm-vram-stats/,数据版本 1.2026-09-29b
开源大模型的参数量中位数是多少?
36.0B
本站收录的开源模型参数量中位数为 36.0B(MoE 模型计入全部专家)。
方法:对全部 55 个模型取 total_params 的中位数。
引用:来源:ModelVRAM,modelvram.com/llm-vram-stats/,数据版本 1.2026-09-29b
数据从哪里来?
每个模型的层数、注意力结构和参数量读取自 Hugging Face 上的 config.json 和文件大小;显存 = 权重 + FP16 KV 缓存(单个请求)+ 0.5 GB + 10% 开销。这些是估算值,不是实测峰值。这里的统计对每个模型(包括 gpt-oss)都按 Q4_K_M 计算、不另留余量;显存分档和“能否运行”页面对 gpt-oss 按 MXFP4 计算并要求剩余至少 0.5 GB,所以数量可能略有不同。逐模型的数字见开放数据集(CSV、JSON),按显存分档的模型列表见8–96 GB 显存能跑哪些模型,任意设置可在显存计算器中重算。数据以 CC BY 4.0 许可发布。
我的显存能跑哪些模型?
每档显存的首选模型、最新模型和常见问题: 8 GB 显存最佳本地大模型、12 GB 显存最佳本地大模型、16 GB 显存最佳本地大模型、24 GB 显存最佳本地大模型、32 GB 显存最佳本地大模型、48 GB 显存最佳本地大模型、96 GB 显存最佳本地大模型。