大模型显存开放数据集

55 个开源模型的显存估算,与计算器、模型页和对比报告使用同一套函数在构建时生成。

版本 1.2026-09-29b;模型数据最近核对于 。

从这些数据算出的可引用数字(例如多少模型能放进 24 GB 显卡)见大模型显存统计。

每个模型还有一枚可贴进 Hugging Face README 的静态显存徽章,见显存徽章(英文)。

许可与署名

数据以 CC BY 4.0 许可发布:可以复制、修改和商用,只需署名:

Data: ModelVRAM (modelvram.com),并附上 https://modelvram.com/data/。

单位

列名以 _gib 结尾的数值单位是 GiB(1024³ 字节),站内写作 GB。参数以个数计,上下文以 token 计,kv_bytes_per_token_fp16 以字节计。模型没有的值(例如超过最长上下文的总显存)为空。

计算方法

权重显存 = 全部参数 × 每参数位数 ÷ 8(Q4_K_M 4.84,Q8_0 8.5,FP16 / BF16 16 位;MoE 模型计入全部专家)。KV 缓存按每个模型的注意力结构计算,FP16,单个请求:全注意力随上下文增长,滑动窗口层只保留窗口,MLA 存压缩的潜向量,线性注意力和状态空间层不随上下文增长。总显存 = 权重 + KV 缓存 + 0.5 GB + 权重与缓存的 10%。“fits”列表示 32,768 token 时能否放进单张该容量的显卡。上下文取值为 8,192、32,768、131,072 token。gpt-oss 也按各列的每参数位数计算;它以 MXFP4 发布,GGUF 量化版本同样以 MXFP4 保存专家权重,实际文件都接近 MXFP4 的大小,所以“能否运行”、GPU 和显存分档页面只按 MXFP4 列出它,并要求剩余至少 0.5 GB。

这些是估算值,不是实测峰值。vLLM、CUDA Graph、视觉编码器等可能需要更多显存。详见 KV 缓存说明(英文)。与公开实测的对比见估算准确度。自己测过?欢迎提交实测(英文表单)。

来源

模型结构和参数量来自各仓库在 Hugging Face 上的 config.json 与文件大小,读取日期见 source_checked 列。计算代码与测试在 GitHub 上公开;同样的数据也发布在 Hugging Face 数据集。

JSON API

同样的数字也以静态 JSON 提供,构建时生成,无需密钥,允许跨域(Access-Control-Allow-Origin: *),许可同为 CC BY 4.0。每个响应都带 version(与上面的数据版本相同)、checked 日期、license 和 source。只覆盖站内的 55 个模型和 73 种 GPU 配置;任意 Hugging Face 模型请用计算器。

curl -s https://modelvram.com/api/v1/models/qwen3.6-35b-a3b.json | jq '.precisions[] | select(.id=="q4_k_m") | .totals_gib.f16'
curl -s https://modelvram.com/api/v1/gpus/rtx-4090.json | jq '.fits[] | {name, best_precision, total_gib}'

ID 与页面地址相同,例如 qwen3.6-35b-a3b、rtx-4090、2x-rtx-3090。面向 AI 助手的站点概览见 /llms.txt,计算器的 URL 参数见 /agent.md(英文)。v1 只会增加字段,不会删改已有字段的含义。

列说明

列名单位说明
model站内显示的模型名称
hf_idHugging Face 仓库 ID
hf_urlURLHugging Face 上的来源仓库
model_urlURLModelVRAM 上带完整计算的模型页
source_checkeddate读取 config.json 和文件大小的日期
total_paramsparameters全部参数,含所有专家
active_paramsparameters每个 token 实际参与计算的参数(MoE);稠密模型为空
expertscount路由专家数(MoE);稠密模型为空
layerscountTransformer 层数
max_contexttokens模型配置中的最长上下文
kv_bytes_per_token_fp16bytesFP16 下单个请求每增加一个 token 的 KV 缓存(滑动窗口填满后)
attention_layout决定 KV 缓存大小的层结构
q4_k_m_weights_gibGiBQ4_K_M 权重显存
q8_0_weights_gibGiBQ8_0 权重显存
fp16_weights_gibGiBFP16 / BF16 权重显存
q4_k_m_8k_total_gibGiBQ4_K_M、8,192 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空
q4_k_m_32k_total_gibGiBQ4_K_M、32,768 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空
q4_k_m_128k_total_gibGiBQ4_K_M、131,072 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空
q8_0_8k_total_gibGiBQ8_0、8,192 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空
q8_0_32k_total_gibGiBQ8_0、32,768 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空
q8_0_128k_total_gibGiBQ8_0、131,072 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空
fp16_8k_total_gibGiBFP16 / BF16、8,192 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空
fp16_32k_total_gibGiBFP16 / BF16、32,768 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空
fp16_128k_total_gibGiBFP16 / BF16、131,072 token 上下文的总显存:权重 + KV 缓存 + 开销;超出 max_context 时为空
kv_cache_8k_gibGiB单个请求 8,192 token 的 FP16 KV 缓存
kv_cache_32k_gibGiB单个请求 32,768 token 的 FP16 KV 缓存
kv_cache_128k_gibGiB单个请求 131,072 token 的 FP16 KV 缓存
q4_k_m_32k_fits_16gibbooleanQ4_K_M、32,768 token 上下文能否放进单张 16 GB 显卡
q4_k_m_32k_fits_24gibbooleanQ4_K_M、32,768 token 上下文能否放进单张 24 GB 显卡
q4_k_m_32k_fits_32gibbooleanQ4_K_M、32,768 token 上下文能否放进单张 32 GB 显卡
q4_k_m_32k_fits_48gibbooleanQ4_K_M、32,768 token 上下文能否放进单张 48 GB 显卡
q4_k_m_32k_fits_80gibbooleanQ4_K_M、32,768 token 上下文能否放进单张 80 GB 显卡
q8_0_32k_fits_16gibbooleanQ8_0、32,768 token 上下文能否放进单张 16 GB 显卡
q8_0_32k_fits_24gibbooleanQ8_0、32,768 token 上下文能否放进单张 24 GB 显卡
q8_0_32k_fits_32gibbooleanQ8_0、32,768 token 上下文能否放进单张 32 GB 显卡
q8_0_32k_fits_48gibbooleanQ8_0、32,768 token 上下文能否放进单张 48 GB 显卡
q8_0_32k_fits_80gibbooleanQ8_0、32,768 token 上下文能否放进单张 80 GB 显卡
fp16_32k_fits_16gibbooleanFP16 / BF16、32,768 token 上下文能否放进单张 16 GB 显卡
fp16_32k_fits_24gibbooleanFP16 / BF16、32,768 token 上下文能否放进单张 24 GB 显卡
fp16_32k_fits_32gibbooleanFP16 / BF16、32,768 token 上下文能否放进单张 32 GB 显卡
fp16_32k_fits_48gibbooleanFP16 / BF16、32,768 token 上下文能否放进单张 48 GB 显卡
fp16_32k_fits_80gibbooleanFP16 / BF16、32,768 token 上下文能否放进单张 80 GB 显卡
note估算未计入的已知缓存优化