VRAM badges for model cards

A small badge for a model's README that shows how much GPU memory it needs and links to the model's page here. Each one is a static SVG file, rebuilt with the site from the same estimate as the model page.

Qwen3.6 35B-A3B VRAM: 23.0 GB at Q4_K_M, 8K context

How to use it

Paste the Markdown into the README of a Hugging Face or GitHub repository, for example a GGUF upload:

[![VRAM](https://modelvram.com/badge/qwen3.6-35b-a3b.svg)](https://modelvram.com/llm-vram-calculator/qwen3.6-35b-a3b/)

Or, where Markdown is not available, the HTML:

<a href="https://modelvram.com/llm-vram-calculator/qwen3.6-35b-a3b/"><img src="https://modelvram.com/badge/qwen3.6-35b-a3b.svg" alt="Qwen3.6 35B-A3B VRAM: 23.0 GB at Q4_K_M, 8K context"></a>

Replace qwen3.6-35b-a3b with the last part of the model page's address (the table below links every one); the model page and the calculator show the code ready to copy. The address is https://modelvram.com/badge/<model>.svg for Q4_K_M, with -q8 or -fp16 before .svg for Q8_0 and FP16.

What the number means

The total GPU memory for one request with 8,192 tokens of context and an FP16 KV cache: the weights at that precision, the cache for the model's attention layout, and 0.5 GB plus 10% for the runtime. GB means GiB. It is an estimate, not a measured peak; the model page breaks it down and the calculator changes the context, the number of requests and the cache precision.

Models with a badge

55 models, each at Q4_K_M, Q8_0 and FP16. The model name opens its page. For gpt-oss-20b and gpt-oss-120b, the Q8_0 badge shows MXFP4 as published: their GGUF quants keep the experts in MXFP4, so a Q8_0 file is about that size.

ModelQ4_K_M badgeQ4_K_MQ8_0FP16
AliceAI Foundation 80B-A3B AliceAI Foundation 80B-A3B VRAM: 51.1 GB at Q4_K_M, 8K context 51.1 GB89.2 GB167 GB
DeepSeek V3 / R1 DeepSeek V3 / R1 VRAM: 425 GB at Q4_K_M, 8K context 425 GB746 GB1,404 GB
DeepSeek V3.2 DeepSeek V3.2 VRAM: 426 GB at Q4_K_M, 8K context 426 GB747 GB1,405 GB
DeepSeek V4 Flash DeepSeek V4 Flash VRAM: 182 GB at Q4_K_M, 8K context 182 GB318 GB597 GB
DeepSeek V4 Flash 0731 DeepSeek V4 Flash 0731 VRAM: 190 GB at Q4_K_M, 8K context 190 GB332 GB624 GB
DeepSeek V4 Pro DeepSeek V4 Pro VRAM: 993 GB at Q4_K_M, 8K context 993 GB1,742 GB3,277 GB
DeepSeek V4.1 Flash DeepSeek V4.1 Flash VRAM: 474 GB at Q4_K_M, 8K context 474 GB832 GB1,565 GB
Gemma 4 12B Gemma 4 12B VRAM: 8.57 GB at Q4_K_M, 8K context 8.57 GB14.2 GB25.7 GB
Gemma 4 26B-A4B Gemma 4 26B-A4B VRAM: 17.0 GB at Q4_K_M, 8K context 17.0 GB29.1 GB53.9 GB
Gemma 4 31B Gemma 4 31B VRAM: 21.9 GB at Q4_K_M, 8K context 21.9 GB36.5 GB66.6 GB
Gemma 4 E4B Gemma 4 E4B VRAM: 5.64 GB at Q4_K_M, 8K context 5.64 GB9.38 GB17.1 GB
GLM-4.7 Flash GLM-4.7 Flash VRAM: 20.3 GB at Q4_K_M, 8K context 20.3 GB34.9 GB64.9 GB
GLM-5.2 GLM-5.2 VRAM: 468 GB at Q4_K_M, 8K context 468 GB821 GB1,545 GB
GLM-5.3 GLM-5.3 VRAM: 468 GB at Q4_K_M, 8K context 468 GB821 GB1,545 GB
GLM-5.3 Flash GLM-5.3 Flash VRAM: 200 GB at Q4_K_M, 8K context 200 GB350 GB659 GB
gpt-oss-120b gpt-oss-120b VRAM: 67.7 GB at MXFP4, 8K context 67.7 GB67.7 GB240 GB
gpt-oss-20b gpt-oss-20b VRAM: 14.8 GB at MXFP4, 8K context 14.8 GB14.8 GB43.6 GB
Hemmingway-1 27B Hemmingway-1 27B VRAM: 18.0 GB at Q4_K_M, 8K context 18.0 GB30.8 GB57.0 GB
Hy4 Preview 770B-A49B Hy4 Preview 770B-A49B VRAM: 485 GB at Q4_K_M, 8K context 485 GB850 GB1,599 GB
IQuest-Q1 320B-A15B IQuest-Q1 320B-A15B VRAM: 201 GB at Q4_K_M, 8K context 201 GB351 GB659 GB
K2-Horizon MoVA 36B-A4B K2-Horizon MoVA 36B-A4B VRAM: 25.4 GB at Q4_K_M, 8K context 25.4 GB42.9 GB78.9 GB
Kimi K3 Kimi K3 VRAM: 1,724 GB at Q4_K_M, 8K context 1,724 GB3,027 GB5,697 GB
LFM2.5 8B-A1B LFM2.5 8B-A1B VRAM: 5.85 GB at Q4_K_M, 8K context 5.85 GB9.82 GB18.0 GB
Limite 1B Violetto Limite 1B Violetto VRAM: 1.31 GB at Q4_K_M, 8K context 1.31 GB1.80 GB2.79 GB
Ling 3.0 Tiny 7.9B-A1.3B Ling 3.0 Tiny 7.9B-A1.3B VRAM: 5.45 GB at Q4_K_M, 8K context 5.45 GB9.15 GB16.7 GB
Llama 3.1 70B Llama 3.1 70B VRAM: 47.0 GB at Q4_K_M, 8K context 47.0 GB80.0 GB148 GB
Llama 3.1 8B Llama 3.1 8B VRAM: 6.58 GB at Q4_K_M, 8K context 6.58 GB10.3 GB18.1 GB
LLM-jp-4.1 32B-A3B Thinking LLM-jp-4.1 32B-A3B Thinking VRAM: 21.0 GB at Q4_K_M, 8K context 21.0 GB36.0 GB66.9 GB
MiMo V2.6 Distill Qwen 9B MiMo V2.6 Distill Qwen 9B VRAM: 6.61 GB at Q4_K_M, 8K context 6.61 GB11.0 GB20.1 GB
MiMo V2.6 Flash MiMo V2.6 Flash VRAM: 193 GB at Q4_K_M, 8K context 193 GB339 GB638 GB
MiMo V2.6 Pro MiMo V2.6 Pro VRAM: 636 GB at Q4_K_M, 8K context 636 GB1,116 GB2,100 GB
MiniCPM5 2B MiniCPM5 2B VRAM: 2.42 GB at Q4_K_M, 8K context 2.42 GB3.60 GB6.02 GB
MiniMax M2.7 MiniMax M2.7 VRAM: 144 GB at Q4_K_M, 8K context 144 GB252 GB471 GB
MiniMax M3 MiniMax M3 VRAM: 266 GB at Q4_K_M, 8K context 266 GB466 GB876 GB
Mistral Medium 3.5 128B Mistral Medium 3.5 128B VRAM: 82.7 GB at Q4_K_M, 8K context 82.7 GB143 GB265 GB
Muse Glimmer 30B Muse Glimmer 30B VRAM: 19.2 GB at Q4_K_M, 8K context 19.2 GB33.1 GB61.7 GB
Nemotron 3 Nano 30B-A3B Nemotron 3 Nano 30B-A3B VRAM: 20.1 GB at Q4_K_M, 8K context 20.1 GB34.9 GB65.3 GB
Nemotron 3 Nano 4B Nemotron 3 Nano 4B VRAM: 3.10 GB at Q4_K_M, 8K context 3.10 GB4.96 GB8.78 GB
Nemotron 3 Super 120B-A12B Nemotron 3 Super 120B-A12B VRAM: 77.2 GB at Q4_K_M, 8K context 77.2 GB135 GB254 GB
Ornith 1.5 35B-A3B Ornith 1.5 35B-A3B VRAM: 23.0 GB at Q4_K_M, 8K context 23.0 GB39.8 GB74.3 GB
Ornith 1.5 9B Ornith 1.5 9B VRAM: 6.76 GB at Q4_K_M, 8K context 6.76 GB11.3 GB20.6 GB
Qwen3 30B-A3B Qwen3 30B-A3B VRAM: 20.2 GB at Q4_K_M, 8K context 20.2 GB34.6 GB63.9 GB
Qwen3 8B Qwen3 8B VRAM: 6.81 GB at Q4_K_M, 8K context 6.81 GB10.7 GB18.5 GB
Qwen3-Coder-Next Qwen3-Coder-Next VRAM: 50.1 GB at Q4_K_M, 8K context 50.1 GB87.4 GB164 GB
Qwen3.5 122B-A10B Qwen3.5 122B-A10B VRAM: 78.2 GB at Q4_K_M, 8K context 78.2 GB137 GB257 GB
Qwen3.5 9B Qwen3.5 9B VRAM: 6.76 GB at Q4_K_M, 8K context 6.76 GB11.3 GB20.6 GB
Qwen3.6 27B Qwen3.6 27B VRAM: 18.3 GB at Q4_K_M, 8K context 18.3 GB31.3 GB58.0 GB
Qwen3.6 35B-A3B Qwen3.6 35B-A3B VRAM: 23.0 GB at Q4_K_M, 8K context 23.0 GB39.8 GB74.3 GB
Qwen3.8 2.4T-A95B Qwen3.8 2.4T-A95B VRAM: 1,517 GB at Q4_K_M, 8K context 1,517 GB2,664 GB5,013 GB
Qwen3.8 27B Qwen3.8 27B VRAM: 18.3 GB at Q4_K_M, 8K context 18.3 GB31.3 GB58.0 GB
Qwen3.8 Flash Next Qwen3.8 Flash Next VRAM: 112 GB at Q4_K_M, 8K context 112 GB197 GB370 GB
Spark-X2.5 4B Spark-X2.5 4B VRAM: 3.47 GB at Q4_K_M, 8K context 3.47 GB5.40 GB9.35 GB
Step 3.7 Flash 196B-A11B Step 3.7 Flash 196B-A11B VRAM: 126 GB at Q4_K_M, 8K context 126 GB220 GB414 GB
Xing 4.0 29B-A4B Xing 4.0 29B-A4B VRAM: 20.2 GB at Q4_K_M, 8K context 20.2 GB34.9 GB64.8 GB
ZDTaichu 5.0 9B ZDTaichu 5.0 9B VRAM: 6.85 GB at Q4_K_M, 8K context 6.85 GB11.4 GB20.8 GB