大模型显存开放数据集
55 个开源模型的显存估算,与计算器、模型页和对比报告使用同一套函数在构建时生成。
- modelvram-vram.csv (每个模型一行)
- modelvram-vram.json (同样的数据,另附列说明、单位和假设)
版本 1.2026-09-29b;模型数据最近核对于 。
从这些数据算出的可引用数字(例如多少模型能放进 24 GB 显卡)见大模型显存统计。
每个模型还有一枚可贴进 Hugging Face README 的静态显存徽章,见显存徽章(英文)。
许可与署名
数据以 CC BY 4.0 许可发布:可以复制、修改和商用,只需署名:
Data: ModelVRAM (modelvram.com),并附上 https://modelvram.com/
单位
列名以 _gib 结尾的数值单位是 GiB(1024³ 字节),站内写作 GB。参数以个数计,上下文以 token 计,kv_bytes_per_token_fp16 以字节计。模型没有的值(例如超过最长上下文的总显存)为空。
计算方法
权重显存 = 全部参数 × 每参数位数 ÷ 8(Q4_K_M 4.84,Q8_0 8.5,FP16 / BF16 16 位;MoE 模型计入全部专家)。KV 缓存按每个模型的注意力结构计算,FP16,单个请求:全注意力随上下文增长,滑动窗口层只保留窗口,MLA 存压缩的潜向量,线性注意力和状态空间层不随上下文增长。总显存 = 权重 + KV 缓存 + 0.5 GB + 权重与缓存的 10%。“fits”列表示 32,768 token 时能否放进单张该容量的显卡。上下文取值为 8,192、32,768、131,072 token。gpt-oss 也按各列的每参数位数计算;它以 MXFP4 发布,GGUF 量化版本同样以 MXFP4 保存专家权重,实际文件都接近 MXFP4 的大小,所以“能否运行”、GPU 和显存分档页面只按 MXFP4 列出它,并要求剩余至少 0.5 GB。
这些是估算值,不是实测峰值。vLLM、CUDA Graph、视觉编码器等可能需要更多显存。详见 KV 缓存说明(英文)。与公开实测的对比见估算准确度。自己测过?欢迎提交实测(英文表单)。
来源
模型结构和参数量来自各仓库在 Hugging Face 上的 config.json 与文件大小,读取日期见 source_checked 列。计算代码与测试在 GitHub 上公开;同样的数据也发布在 Hugging Face 数据集。
JSON API
同样的数字也以静态 JSON 提供,构建时生成,无需密钥,允许跨域(Access-Control-Allow-Origin: *),许可同为 CC BY 4.0。每个响应都带 version(与上面的数据版本相同)、checked 日期、license 和 source。只覆盖站内的 55 个模型和 73 种 GPU 配置;任意 Hugging Face 模型请用计算器。
/api/v1/models.json: 全部模型:参数、结构、f16 与 q8_0 下每 token 的 KV 字节数、各精度权重(GiB)和链接/api/v1/models/<id>.json: 单个模型:各精度在 4K、8K、32K、128K 和最长上下文下的总显存(f16 与 q8_0 KV),已核对的 GGUF 仓库、最小配置,以及每张单卡的“能否运行”结论/api/v1/gpus.json: 全部 GPU 与多卡配置/api/v1/gpus/<id>.json: 单个配置能装下的模型(8K 上下文下的最佳精度、总显存、最长上下文、速度)和装不下的模型
curl -s https://modelvram.com/api/v1/models/qwen3.6-35b-a3b.json | jq '.precisions[] | select(.id=="q4_k_m") | .totals_gib.f16'
curl -s https://modelvram.com/api/v1/gpus/rtx-4090.json | jq '.fits[] | {name, best_precision, total_gib}' ID 与页面地址相同,例如 qwen3.6-35b-a3b、rtx-4090、2x-rtx-3090。面向 AI 助手的站点概览见 /llms.txt,计算器的 URL 参数见 /agent.md(英文)。v1 只会增加字段,不会删改已有字段的含义。
列说明
| 列名 | 单位 | 说明 |
|---|---|---|
model | 站内显示的模型名称 | |
hf_id | Hugging Face 仓库 ID | |
hf_url | URL | Hugging Face 上的来源仓库 |
model_url | URL | ModelVRAM 上带完整计算的模型页 |
source_checked | date | 读取 config.json 和文件大小的日期 |
total_params | parameters | 全部参数,含所有专家 |
active_params | parameters | 每个 token 实际参与计算的参数(MoE);稠密模型为空 |
experts | count | 路由专家数(MoE);稠密模型为空 |
layers | count | Transformer 层数 |
max_context | tokens | 模型配置中的最长上下文 |
kv_bytes_per_token_fp16 | bytes | FP16 下单个请求每增加一个 token 的 KV 缓存(滑动窗口填满后) |
attention_layout | 决定 KV 缓存大小的层结构 | |
q4_k_m_weights_gib | GiB | Q4_K_M 权重显存 |
q8_0_weights_gib | GiB | Q8_0 权重显存 |
fp16_weights_gib | GiB | FP16 / BF16 权重显存 |
q4_k_m_8k_total_gib | GiB | Q4_K_M、8,192 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空 |
q4_k_m_32k_total_gib | GiB | Q4_K_M、32,768 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空 |
q4_k_m_128k_total_gib | GiB | Q4_K_M、131,072 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空 |
q8_0_8k_total_gib | GiB | Q8_0、8,192 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空 |
q8_0_32k_total_gib | GiB | Q8_0、32,768 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空 |
q8_0_128k_total_gib | GiB | Q8_0、131,072 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空 |
fp16_8k_total_gib | GiB | FP16 / BF16、8,192 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空 |
fp16_32k_total_gib | GiB | FP16 / BF16、32,768 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空 |
fp16_128k_total_gib | GiB | FP16 / BF16、131,072 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空 |
kv_cache_8k_gib | GiB | 单个请求 8,192 token 的 FP16 KV 缓存 |
kv_cache_32k_gib | GiB | 单个请求 32,768 token 的 FP16 KV 缓存 |
kv_cache_128k_gib | GiB | 单个请求 131,072 token 的 FP16 KV 缓存 |
q4_k_m_32k_fits_16gib | boolean | Q4_K_M、32,768 token 上下文能否放进单张 16 GB 显卡 |
q4_k_m_32k_fits_24gib | boolean | Q4_K_M、32,768 token 上下文能否放进单张 24 GB 显卡 |
q4_k_m_32k_fits_32gib | boolean | Q4_K_M、32,768 token 上下文能否放进单张 32 GB 显卡 |
q4_k_m_32k_fits_48gib | boolean | Q4_K_M、32,768 token 上下文能否放进单张 48 GB 显卡 |
q4_k_m_32k_fits_80gib | boolean | Q4_K_M、32,768 token 上下文能否放进单张 80 GB 显卡 |
q8_0_32k_fits_16gib | boolean | Q8_0、32,768 token 上下文能否放进单张 16 GB 显卡 |
q8_0_32k_fits_24gib | boolean | Q8_0、32,768 token 上下文能否放进单张 24 GB 显卡 |
q8_0_32k_fits_32gib | boolean | Q8_0、32,768 token 上下文能否放进单张 32 GB 显卡 |
q8_0_32k_fits_48gib | boolean | Q8_0、32,768 token 上下文能否放进单张 48 GB 显卡 |
q8_0_32k_fits_80gib | boolean | Q8_0、32,768 token 上下文能否放进单张 80 GB 显卡 |
fp16_32k_fits_16gib | boolean | FP16 / BF16、32,768 token 上下文能否放进单张 16 GB 显卡 |
fp16_32k_fits_24gib | boolean | FP16 / BF16、32,768 token 上下文能否放进单张 24 GB 显卡 |
fp16_32k_fits_32gib | boolean | FP16 / BF16、32,768 token 上下文能否放进单张 32 GB 显卡 |
fp16_32k_fits_48gib | boolean | FP16 / BF16、32,768 token 上下文能否放进单张 48 GB 显卡 |
fp16_32k_fits_80gib | boolean | FP16 / BF16、32,768 token 上下文能否放进单张 80 GB 显卡 |
note | 估算未计入的已知缓存优化 |