{
  "name": "ModelVRAM LLM VRAM requirements",
  "version": "1.2026-09-29b",
  "schema_version": 1,
  "source_checked": "2026-09-29",
  "url": "https://modelvram.com/data/",
  "csv": "https://modelvram.com/data/modelvram-vram.csv",
  "license": {
    "name": "CC BY 4.0",
    "url": "https://creativecommons.org/licenses/by/4.0/"
  },
  "attribution": "Data: ModelVRAM (modelvram.com) https://modelvram.com/data/",
  "units": {
    "gib": "GiB (1024^3 bytes); the site writes it as GB",
    "params": "parameters",
    "tokens": "tokens"
  },
  "assumptions": {
    "requests": 1,
    "kv_cache": "FP16",
    "overhead": "0.5 GiB + 10% of weights and KV cache",
    "bits_per_weight": {
      "q4_k_m": 4.84,
      "q8_0": 8.5,
      "fp16": 16
    }
  },
  "columns": [
    {
      "name": "model",
      "unit": "",
      "description": "Model name as shown on the site"
    },
    {
      "name": "hf_id",
      "unit": "",
      "description": "Hugging Face repository ID"
    },
    {
      "name": "hf_url",
      "unit": "URL",
      "description": "Source repository on Hugging Face"
    },
    {
      "name": "model_url",
      "unit": "URL",
      "description": "ModelVRAM page with the full calculations"
    },
    {
      "name": "source_checked",
      "unit": "date",
      "description": "When config.json and file sizes were read"
    },
    {
      "name": "total_params",
      "unit": "parameters",
      "description": "All parameters, every expert included"
    },
    {
      "name": "active_params",
      "unit": "parameters",
      "description": "Parameters used per token (MoE); empty for dense models"
    },
    {
      "name": "experts",
      "unit": "count",
      "description": "Routed experts (MoE); empty for dense models"
    },
    {
      "name": "layers",
      "unit": "count",
      "description": "Transformer layers"
    },
    {
      "name": "max_context",
      "unit": "tokens",
      "description": "Longest context in the model config"
    },
    {
      "name": "kv_bytes_per_token_fp16",
      "unit": "bytes",
      "description": "KV cache added per token of one request at FP16, once sliding windows are full"
    },
    {
      "name": "attention_layout",
      "unit": "",
      "description": "Layers that decide the KV cache"
    },
    {
      "name": "q4_k_m_weights_gib",
      "unit": "GiB",
      "description": "Weight memory at Q4_K_M"
    },
    {
      "name": "q8_0_weights_gib",
      "unit": "GiB",
      "description": "Weight memory at Q8_0"
    },
    {
      "name": "fp16_weights_gib",
      "unit": "GiB",
      "description": "Weight memory at FP16 / BF16"
    },
    {
      "name": "q4_k_m_8k_total_gib",
      "unit": "GiB",
      "description": "Total VRAM at Q4_K_M, 8,192 tokens: weights + KV cache + overhead; empty past max_context"
    },
    {
      "name": "q4_k_m_32k_total_gib",
      "unit": "GiB",
      "description": "Total VRAM at Q4_K_M, 32,768 tokens: weights + KV cache + overhead; empty past max_context"
    },
    {
      "name": "q4_k_m_128k_total_gib",
      "unit": "GiB",
      "description": "Total VRAM at Q4_K_M, 131,072 tokens: weights + KV cache + overhead; empty past max_context"
    },
    {
      "name": "q8_0_8k_total_gib",
      "unit": "GiB",
      "description": "Total VRAM at Q8_0, 8,192 tokens: weights + KV cache + overhead; empty past max_context"
    },
    {
      "name": "q8_0_32k_total_gib",
      "unit": "GiB",
      "description": "Total VRAM at Q8_0, 32,768 tokens: weights + KV cache + overhead; empty past max_context"
    },
    {
      "name": "q8_0_128k_total_gib",
      "unit": "GiB",
      "description": "Total VRAM at Q8_0, 131,072 tokens: weights + KV cache + overhead; empty past max_context"
    },
    {
      "name": "fp16_8k_total_gib",
      "unit": "GiB",
      "description": "Total VRAM at FP16 / BF16, 8,192 tokens: weights + KV cache + overhead; empty past max_context"
    },
    {
      "name": "fp16_32k_total_gib",
      "unit": "GiB",
      "description": "Total VRAM at FP16 / BF16, 32,768 tokens: weights + KV cache + overhead; empty past max_context"
    },
    {
      "name": "fp16_128k_total_gib",
      "unit": "GiB",
      "description": "Total VRAM at FP16 / BF16, 131,072 tokens: weights + KV cache + overhead; empty past max_context"
    },
    {
      "name": "kv_cache_8k_gib",
      "unit": "GiB",
      "description": "FP16 KV cache of one request at 8,192 tokens"
    },
    {
      "name": "kv_cache_32k_gib",
      "unit": "GiB",
      "description": "FP16 KV cache of one request at 32,768 tokens"
    },
    {
      "name": "kv_cache_128k_gib",
      "unit": "GiB",
      "description": "FP16 KV cache of one request at 131,072 tokens"
    },
    {
      "name": "q4_k_m_32k_fits_16gib",
      "unit": "boolean",
      "description": "Q4_K_M with 32,768 tokens fits on one 16 GB GPU"
    },
    {
      "name": "q4_k_m_32k_fits_24gib",
      "unit": "boolean",
      "description": "Q4_K_M with 32,768 tokens fits on one 24 GB GPU"
    },
    {
      "name": "q4_k_m_32k_fits_32gib",
      "unit": "boolean",
      "description": "Q4_K_M with 32,768 tokens fits on one 32 GB GPU"
    },
    {
      "name": "q4_k_m_32k_fits_48gib",
      "unit": "boolean",
      "description": "Q4_K_M with 32,768 tokens fits on one 48 GB GPU"
    },
    {
      "name": "q4_k_m_32k_fits_80gib",
      "unit": "boolean",
      "description": "Q4_K_M with 32,768 tokens fits on one 80 GB GPU"
    },
    {
      "name": "q8_0_32k_fits_16gib",
      "unit": "boolean",
      "description": "Q8_0 with 32,768 tokens fits on one 16 GB GPU"
    },
    {
      "name": "q8_0_32k_fits_24gib",
      "unit": "boolean",
      "description": "Q8_0 with 32,768 tokens fits on one 24 GB GPU"
    },
    {
      "name": "q8_0_32k_fits_32gib",
      "unit": "boolean",
      "description": "Q8_0 with 32,768 tokens fits on one 32 GB GPU"
    },
    {
      "name": "q8_0_32k_fits_48gib",
      "unit": "boolean",
      "description": "Q8_0 with 32,768 tokens fits on one 48 GB GPU"
    },
    {
      "name": "q8_0_32k_fits_80gib",
      "unit": "boolean",
      "description": "Q8_0 with 32,768 tokens fits on one 80 GB GPU"
    },
    {
      "name": "fp16_32k_fits_16gib",
      "unit": "boolean",
      "description": "FP16 / BF16 with 32,768 tokens fits on one 16 GB GPU"
    },
    {
      "name": "fp16_32k_fits_24gib",
      "unit": "boolean",
      "description": "FP16 / BF16 with 32,768 tokens fits on one 24 GB GPU"
    },
    {
      "name": "fp16_32k_fits_32gib",
      "unit": "boolean",
      "description": "FP16 / BF16 with 32,768 tokens fits on one 32 GB GPU"
    },
    {
      "name": "fp16_32k_fits_48gib",
      "unit": "boolean",
      "description": "FP16 / BF16 with 32,768 tokens fits on one 48 GB GPU"
    },
    {
      "name": "fp16_32k_fits_80gib",
      "unit": "boolean",
      "description": "FP16 / BF16 with 32,768 tokens fits on one 80 GB GPU"
    },
    {
      "name": "note",
      "unit": "",
      "description": "Known cache optimization the estimate leaves out"
    }
  ],
  "models": [
    {
      "model": "Spark-X2.5 4B",
      "hf_id": "XHToken/Spark-X2.5-4B",
      "hf_url": "https://huggingface.co/XHToken/Spark-X2.5-4B",
      "model_url": "https://modelvram.com/llm-vram-calculator/spark-x2.5-4b/",
      "source_checked": "2026-09-29",
      "total_params": 4112079360,
      "active_params": null,
      "experts": null,
      "layers": 36,
      "max_context": 1048576,
      "kv_bytes_per_token_fp16": 36864,
      "attention_layout": "9 of its 36 layers use full attention and 27 keep a sliding window of 512 tokens",
      "q4_k_m_weights_gib": 2.32,
      "q8_0_weights_gib": 4.07,
      "fp16_weights_gib": 7.66,
      "q4_k_m_8k_total_gib": 3.47,
      "q4_k_m_32k_total_gib": 4.4,
      "q4_k_m_128k_total_gib": 8.11,
      "q8_0_8k_total_gib": 5.4,
      "q8_0_32k_total_gib": 6.33,
      "q8_0_128k_total_gib": 10.04,
      "fp16_8k_total_gib": 9.35,
      "fp16_32k_total_gib": 10.28,
      "fp16_128k_total_gib": 13.99,
      "kv_cache_8k_gib": 0.39,
      "kv_cache_32k_gib": 1.23,
      "kv_cache_128k_gib": 4.61,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": true,
      "q8_0_32k_fits_24gib": true,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": true,
      "fp16_32k_fits_24gib": true,
      "fp16_32k_fits_32gib": true,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Ling 3.0 Tiny 7.9B-A1.3B (MoE)",
      "hf_id": "inclusionAI/Ling-3.0-tiny",
      "hf_url": "https://huggingface.co/inclusionAI/Ling-3.0-tiny",
      "model_url": "https://modelvram.com/llm-vram-calculator/ling-3.0-tiny/",
      "source_checked": "2026-09-29",
      "total_params": 7893392800,
      "active_params": 1300000000,
      "experts": 128,
      "layers": 24,
      "max_context": 131072,
      "kv_bytes_per_token_fp16": 6912,
      "attention_layout": "6 of its 24 layers use multi-head latent attention and 18 are KDA recurrent layers with no growing cache",
      "q4_k_m_weights_gib": 4.45,
      "q8_0_weights_gib": 7.81,
      "fp16_weights_gib": 14.7,
      "q4_k_m_8k_total_gib": 5.45,
      "q4_k_m_32k_total_gib": 5.62,
      "q4_k_m_128k_total_gib": 6.32,
      "q8_0_8k_total_gib": 9.15,
      "q8_0_32k_total_gib": 9.32,
      "q8_0_128k_total_gib": 10.02,
      "fp16_8k_total_gib": 16.73,
      "fp16_32k_total_gib": 16.9,
      "fp16_128k_total_gib": 17.6,
      "kv_cache_8k_gib": 0.05,
      "kv_cache_32k_gib": 0.21,
      "kv_cache_128k_gib": 0.84,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": true,
      "q8_0_32k_fits_24gib": true,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": true,
      "fp16_32k_fits_32gib": true,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": "The 18 KDA layers keep a fixed recurrent state, which this estimate does not include; only the 6 MLA layers add a context-growing KV cache. Real serving memory may be higher."
    },
    {
      "model": "LFM2.5 8B-A1B (MoE)",
      "hf_id": "LiquidAI/LFM2.5-8B-A1B",
      "hf_url": "https://huggingface.co/LiquidAI/LFM2.5-8B-A1B",
      "model_url": "https://modelvram.com/llm-vram-calculator/lfm2.5-8b-a1b/",
      "source_checked": "2026-09-29",
      "total_params": 8467856832,
      "active_params": 1500000000,
      "experts": 32,
      "layers": 24,
      "max_context": 128000,
      "kv_bytes_per_token_fp16": 12288,
      "attention_layout": "6 of its 24 layers use full attention and 18 are short-convolution layers with no growing cache",
      "q4_k_m_weights_gib": 4.77,
      "q8_0_weights_gib": 8.38,
      "fp16_weights_gib": 15.77,
      "q4_k_m_8k_total_gib": 5.85,
      "q4_k_m_32k_total_gib": 6.16,
      "q4_k_m_128k_total_gib": null,
      "q8_0_8k_total_gib": 9.82,
      "q8_0_32k_total_gib": 10.13,
      "q8_0_128k_total_gib": null,
      "fp16_8k_total_gib": 17.95,
      "fp16_32k_total_gib": 18.26,
      "fp16_128k_total_gib": null,
      "kv_cache_8k_gib": 0.09,
      "kv_cache_32k_gib": 0.38,
      "kv_cache_128k_gib": null,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": true,
      "q8_0_32k_fits_24gib": true,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": true,
      "fp16_32k_fits_32gib": true,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Step 3.7 Flash 196B-A11B (MoE)",
      "hf_id": "stepfun-ai/Step-3.7-Flash",
      "hf_url": "https://huggingface.co/stepfun-ai/Step-3.7-Flash",
      "model_url": "https://modelvram.com/llm-vram-calculator/step-3.7-flash/",
      "source_checked": "2026-09-29",
      "total_params": 201365316160,
      "active_params": 11000000000,
      "experts": 288,
      "layers": 45,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 49152,
      "attention_layout": "12 of its 45 layers use full attention and 33 keep a sliding window of 512 tokens",
      "q4_k_m_weights_gib": 113.46,
      "q8_0_weights_gib": 199.26,
      "fp16_weights_gib": 375.07,
      "q4_k_m_8k_total_gib": 125.86,
      "q4_k_m_32k_total_gib": 127.1,
      "q4_k_m_128k_total_gib": 132.05,
      "q8_0_8k_total_gib": 220.24,
      "q8_0_32k_total_gib": 221.47,
      "q8_0_128k_total_gib": 226.42,
      "fp16_8k_total_gib": 413.63,
      "fp16_32k_total_gib": 414.87,
      "fp16_128k_total_gib": 419.82,
      "kv_cache_8k_gib": 0.5,
      "kv_cache_32k_gib": 1.63,
      "kv_cache_128k_gib": 6.13,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "Hy4 Preview 770B-A49B (MoE)",
      "hf_id": "tencent/Hy4-preview",
      "hf_url": "https://huggingface.co/tencent/Hy4-preview",
      "model_url": "https://modelvram.com/llm-vram-calculator/hy4-preview/",
      "source_checked": "2026-09-29",
      "total_params": 779960992733,
      "active_params": 49000000000,
      "experts": 256,
      "layers": 78,
      "max_context": 1048576,
      "kv_bytes_per_token_fp16": 92544,
      "attention_layout": "All 78 layers use multi-head latent attention",
      "q4_k_m_weights_gib": 439.47,
      "q8_0_weights_gib": 771.79,
      "fp16_weights_gib": 1452.79,
      "q4_k_m_8k_total_gib": 484.69,
      "q4_k_m_32k_total_gib": 487.02,
      "q4_k_m_128k_total_gib": 496.34,
      "q8_0_8k_total_gib": 850.25,
      "q8_0_32k_total_gib": 852.58,
      "q8_0_128k_total_gib": 861.9,
      "fp16_8k_total_gib": 1599.35,
      "fp16_32k_total_gib": 1601.68,
      "fp16_128k_total_gib": 1611,
      "kv_cache_8k_gib": 0.71,
      "kv_cache_32k_gib": 2.82,
      "kv_cache_128k_gib": 11.3,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "Limite 1B Violetto",
      "hf_id": "paradigma-inc/limite-1b-violetto",
      "hf_url": "https://huggingface.co/paradigma-inc/limite-1b-violetto",
      "model_url": "https://modelvram.com/llm-vram-calculator/limite-1b-violetto/",
      "source_checked": "2026-09-29",
      "total_params": 1035253888,
      "active_params": null,
      "experts": null,
      "layers": 48,
      "max_context": 131072,
      "kv_bytes_per_token_fp16": 12288,
      "attention_layout": "12 of its 48 layers use full attention and 36 keep a sliding window of 1,025 tokens",
      "q4_k_m_weights_gib": 0.58,
      "q8_0_weights_gib": 1.02,
      "fp16_weights_gib": 1.93,
      "q4_k_m_8k_total_gib": 1.31,
      "q4_k_m_32k_total_gib": 1.62,
      "q4_k_m_128k_total_gib": 2.86,
      "q8_0_8k_total_gib": 1.8,
      "q8_0_32k_total_gib": 2.11,
      "q8_0_128k_total_gib": 3.34,
      "fp16_8k_total_gib": 2.79,
      "fp16_32k_total_gib": 3.1,
      "fp16_128k_total_gib": 4.34,
      "kv_cache_8k_gib": 0.16,
      "kv_cache_32k_gib": 0.44,
      "kv_cache_128k_gib": 1.56,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": true,
      "q8_0_32k_fits_24gib": true,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": true,
      "fp16_32k_fits_24gib": true,
      "fp16_32k_fits_32gib": true,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "ZDTaichu 5.0 9B",
      "hf_id": "TaichuAI/ZDTaichu5.0-9B",
      "hf_url": "https://huggingface.co/TaichuAI/ZDTaichu5.0-9B",
      "model_url": "https://modelvram.com/llm-vram-calculator/zdtaichu5.0-9b/",
      "source_checked": "2026-09-29",
      "total_params": 9794197512,
      "active_params": null,
      "experts": null,
      "layers": 32,
      "max_context": 131072,
      "kv_bytes_per_token_fp16": 32768,
      "attention_layout": "8 of its 32 layers use full attention and 24 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 5.52,
      "q8_0_weights_gib": 9.69,
      "fp16_weights_gib": 18.24,
      "q4_k_m_8k_total_gib": 6.85,
      "q4_k_m_32k_total_gib": 7.67,
      "q4_k_m_128k_total_gib": 10.97,
      "q8_0_8k_total_gib": 11.44,
      "q8_0_32k_total_gib": 12.26,
      "q8_0_128k_total_gib": 15.56,
      "fp16_8k_total_gib": 20.84,
      "fp16_32k_total_gib": 21.67,
      "fp16_128k_total_gib": 24.97,
      "kv_cache_8k_gib": 0.25,
      "kv_cache_32k_gib": 1,
      "kv_cache_128k_gib": 4,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": true,
      "q8_0_32k_fits_24gib": true,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": true,
      "fp16_32k_fits_32gib": true,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Hemmingway-1 27B",
      "hf_id": "Altworld/Hemmingway-1",
      "hf_url": "https://huggingface.co/Altworld/Hemmingway-1",
      "model_url": "https://modelvram.com/llm-vram-calculator/hemmingway-1/",
      "source_checked": "2026-09-29",
      "total_params": 27320697856,
      "active_params": null,
      "experts": null,
      "layers": 64,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 65536,
      "attention_layout": "16 of its 64 layers use full attention and 48 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 15.39,
      "q8_0_weights_gib": 27.03,
      "fp16_weights_gib": 50.89,
      "q4_k_m_8k_total_gib": 17.98,
      "q4_k_m_32k_total_gib": 19.63,
      "q4_k_m_128k_total_gib": 26.23,
      "q8_0_8k_total_gib": 30.79,
      "q8_0_32k_total_gib": 32.44,
      "q8_0_128k_total_gib": 39.04,
      "fp16_8k_total_gib": 57.03,
      "fp16_32k_total_gib": 58.68,
      "fp16_128k_total_gib": 65.28,
      "kv_cache_8k_gib": 0.5,
      "kv_cache_32k_gib": 2,
      "kv_cache_128k_gib": 8,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "MiMo V2.6 Distill Qwen 9B",
      "hf_id": "XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B",
      "hf_url": "https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B",
      "model_url": "https://modelvram.com/llm-vram-calculator/mimo-v2.6-distill-qwen-9b/",
      "source_checked": "2026-09-29",
      "total_params": 9409813744,
      "active_params": null,
      "experts": null,
      "layers": 32,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 32768,
      "attention_layout": "8 of its 32 layers use full attention and 24 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 5.3,
      "q8_0_weights_gib": 9.31,
      "fp16_weights_gib": 17.53,
      "q4_k_m_8k_total_gib": 6.61,
      "q4_k_m_32k_total_gib": 7.43,
      "q4_k_m_128k_total_gib": 10.73,
      "q8_0_8k_total_gib": 11.02,
      "q8_0_32k_total_gib": 11.84,
      "q8_0_128k_total_gib": 15.14,
      "fp16_8k_total_gib": 20.05,
      "fp16_32k_total_gib": 20.88,
      "fp16_128k_total_gib": 24.18,
      "kv_cache_8k_gib": 0.25,
      "kv_cache_32k_gib": 1,
      "kv_cache_128k_gib": 4,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": true,
      "q8_0_32k_fits_24gib": true,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": true,
      "fp16_32k_fits_32gib": true,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "K2-Horizon MoVA 36B-A4B (MoE)",
      "hf_id": "IFM/K2-Horizon-MoVA-36B-A4B",
      "hf_url": "https://huggingface.co/IFM/K2-Horizon-MoVA-36B-A4B",
      "model_url": "https://modelvram.com/llm-vram-calculator/k2-horizon-mova-36b-a4b/",
      "source_checked": "2026-09-29",
      "total_params": 37444792020,
      "active_params": 4000000000,
      "experts": 100,
      "layers": 48,
      "max_context": 524288,
      "kv_bytes_per_token_fp16": 196608,
      "attention_layout": "All 48 layers use full attention",
      "q4_k_m_weights_gib": 21.1,
      "q8_0_weights_gib": 37.05,
      "fp16_weights_gib": 69.75,
      "q4_k_m_8k_total_gib": 25.36,
      "q4_k_m_32k_total_gib": 30.31,
      "q4_k_m_128k_total_gib": 50.11,
      "q8_0_8k_total_gib": 42.91,
      "q8_0_32k_total_gib": 47.86,
      "q8_0_128k_total_gib": 67.66,
      "fp16_8k_total_gib": 78.87,
      "fp16_32k_total_gib": 83.82,
      "fp16_128k_total_gib": 103.62,
      "kv_cache_8k_gib": 1.5,
      "kv_cache_32k_gib": 6,
      "kv_cache_128k_gib": 24,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "IQuest-Q1 320B-A15B (MoE)",
      "hf_id": "IQuestLab/IQuest-Q1",
      "hf_url": "https://huggingface.co/IQuestLab/IQuest-Q1",
      "model_url": "https://modelvram.com/llm-vram-calculator/iquest-q1/",
      "source_checked": "2026-09-29",
      "total_params": 320318615552,
      "active_params": 15000000000,
      "experts": 256,
      "layers": 88,
      "max_context": 524288,
      "kv_bytes_per_token_fp16": 102400,
      "attention_layout": "25 of its 88 layers use full attention and 63 keep a sliding window of 4,096 tokens",
      "q4_k_m_weights_gib": 180.48,
      "q8_0_weights_gib": 316.96,
      "fp16_weights_gib": 596.64,
      "q4_k_m_8k_total_gib": 201.11,
      "q4_k_m_32k_total_gib": 203.69,
      "q4_k_m_128k_total_gib": 214,
      "q8_0_8k_total_gib": 351.24,
      "q8_0_32k_total_gib": 353.82,
      "q8_0_128k_total_gib": 364.13,
      "fp16_8k_total_gib": 658.88,
      "fp16_32k_total_gib": 661.46,
      "fp16_128k_total_gib": 671.77,
      "kv_cache_8k_gib": 1.89,
      "kv_cache_32k_gib": 4.23,
      "kv_cache_128k_gib": 13.61,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "LLM-jp-4.1 32B-A3B Thinking (MoE)",
      "hf_id": "llm-jp/llm-jp-4.1-32b-a3b-thinking",
      "hf_url": "https://huggingface.co/llm-jp/llm-jp-4.1-32b-a3b-thinking",
      "model_url": "https://modelvram.com/llm-vram-calculator/llm-jp-4.1-32b-a3b-thinking/",
      "source_checked": "2026-09-29",
      "total_params": 32139028992,
      "active_params": 3827476992,
      "experts": 128,
      "layers": 32,
      "max_context": 65536,
      "kv_bytes_per_token_fp16": 65536,
      "attention_layout": "All 32 layers use full attention",
      "q4_k_m_weights_gib": 18.11,
      "q8_0_weights_gib": 31.8,
      "fp16_weights_gib": 59.86,
      "q4_k_m_8k_total_gib": 20.97,
      "q4_k_m_32k_total_gib": 22.62,
      "q4_k_m_128k_total_gib": null,
      "q8_0_8k_total_gib": 36.03,
      "q8_0_32k_total_gib": 37.68,
      "q8_0_128k_total_gib": null,
      "fp16_8k_total_gib": 66.9,
      "fp16_32k_total_gib": 68.55,
      "fp16_128k_total_gib": null,
      "kv_cache_8k_gib": 0.5,
      "kv_cache_32k_gib": 2,
      "kv_cache_128k_gib": null,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Ornith 1.5 35B-A3B (MoE)",
      "hf_id": "ornith-ai/Ornith-1.5-35B-A3B",
      "hf_url": "https://huggingface.co/ornith-ai/Ornith-1.5-35B-A3B",
      "model_url": "https://modelvram.com/llm-vram-calculator/ornith-1.5-35b-a3b/",
      "source_checked": "2026-09-26",
      "total_params": 35951822704,
      "active_params": 3000000000,
      "experts": 256,
      "layers": 40,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 20480,
      "attention_layout": "10 of its 40 layers use full attention and 30 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 20.26,
      "q8_0_weights_gib": 35.58,
      "fp16_weights_gib": 66.97,
      "q4_k_m_8k_total_gib": 22.95,
      "q4_k_m_32k_total_gib": 23.47,
      "q4_k_m_128k_total_gib": 25.53,
      "q8_0_8k_total_gib": 39.8,
      "q8_0_32k_total_gib": 40.32,
      "q8_0_128k_total_gib": 42.38,
      "fp16_8k_total_gib": 74.33,
      "fp16_32k_total_gib": 74.85,
      "fp16_128k_total_gib": 76.91,
      "kv_cache_8k_gib": 0.16,
      "kv_cache_32k_gib": 0.63,
      "kv_cache_128k_gib": 2.5,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Ornith 1.5 9B",
      "hf_id": "ornith-ai/Ornith-1.5-9B",
      "hf_url": "https://huggingface.co/ornith-ai/Ornith-1.5-9B",
      "model_url": "https://modelvram.com/llm-vram-calculator/ornith-1.5-9b/",
      "source_checked": "2026-09-26",
      "total_params": 9653104368,
      "active_params": null,
      "experts": null,
      "layers": 32,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 32768,
      "attention_layout": "8 of its 32 layers use full attention and 24 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 5.44,
      "q8_0_weights_gib": 9.55,
      "fp16_weights_gib": 17.98,
      "q4_k_m_8k_total_gib": 6.76,
      "q4_k_m_32k_total_gib": 7.58,
      "q4_k_m_128k_total_gib": 10.88,
      "q8_0_8k_total_gib": 11.28,
      "q8_0_32k_total_gib": 12.11,
      "q8_0_128k_total_gib": 15.41,
      "fp16_8k_total_gib": 20.55,
      "fp16_32k_total_gib": 21.38,
      "fp16_128k_total_gib": 24.68,
      "kv_cache_8k_gib": 0.25,
      "kv_cache_32k_gib": 1,
      "kv_cache_128k_gib": 4,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": true,
      "q8_0_32k_fits_24gib": true,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": true,
      "fp16_32k_fits_32gib": true,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "AliceAI Foundation 80B-A3B (MoE)",
      "hf_id": "yandex/AliceAI-Foundation-80B-A3B-Base",
      "hf_url": "https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base",
      "model_url": "https://modelvram.com/llm-vram-calculator/aliceai-foundation-80b-a3b-base/",
      "source_checked": "2026-09-27",
      "total_params": 81286433408,
      "active_params": 3000000000,
      "experts": 512,
      "layers": 48,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 24576,
      "attention_layout": "12 of its 48 layers use full attention and 36 are KDA recurrent layers with no growing cache",
      "q4_k_m_weights_gib": 45.8,
      "q8_0_weights_gib": 80.44,
      "fp16_weights_gib": 151.41,
      "q4_k_m_8k_total_gib": 51.09,
      "q4_k_m_32k_total_gib": 51.71,
      "q4_k_m_128k_total_gib": 54.18,
      "q8_0_8k_total_gib": 89.19,
      "q8_0_32k_total_gib": 89.8,
      "q8_0_128k_total_gib": 92.28,
      "fp16_8k_total_gib": 167.25,
      "fp16_32k_total_gib": 167.87,
      "fp16_128k_total_gib": 170.35,
      "kv_cache_8k_gib": 0.19,
      "kv_cache_32k_gib": 0.75,
      "kv_cache_128k_gib": 3,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": "The 36 KDA layers keep a fixed recurrent state, which this estimate does not include; only the 12 gated-attention layers add a context-growing KV cache. Real serving memory may be higher."
    },
    {
      "model": "DeepSeek V4 Flash 0731",
      "hf_id": "deepseek-ai/DeepSeek-V4-Flash-0731",
      "hf_url": "https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731",
      "model_url": "https://modelvram.com/llm-vram-calculator/deepseek-v4-flash-0731/",
      "source_checked": "2026-09-26",
      "total_params": 304180418494,
      "active_params": 13000000000,
      "experts": 256,
      "layers": 43,
      "max_context": 1048576,
      "kv_bytes_per_token_fp16": 88064,
      "attention_layout": "All 43 layers use full attention",
      "q4_k_m_weights_gib": 171.39,
      "q8_0_weights_gib": 301,
      "fp16_weights_gib": 566.58,
      "q4_k_m_8k_total_gib": 189.77,
      "q4_k_m_32k_total_gib": 191.99,
      "q4_k_m_128k_total_gib": 200.85,
      "q8_0_8k_total_gib": 332.33,
      "q8_0_32k_total_gib": 334.55,
      "q8_0_128k_total_gib": 343.42,
      "fp16_8k_total_gib": 624.48,
      "fp16_32k_total_gib": 626.69,
      "fp16_128k_total_gib": 635.56,
      "kv_cache_8k_gib": 0.67,
      "kv_cache_32k_gib": 2.69,
      "kv_cache_128k_gib": 10.75,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": "This model shares and compresses its KV cache across layers, which the calculator does not model, so the KV cache figure is an upper bound."
    },
    {
      "model": "Qwen3.6 35B-A3B (MoE)",
      "hf_id": "Qwen/Qwen3.6-35B-A3B",
      "hf_url": "https://huggingface.co/Qwen/Qwen3.6-35B-A3B",
      "model_url": "https://modelvram.com/llm-vram-calculator/qwen3.6-35b-a3b/",
      "source_checked": "2026-09-26",
      "total_params": 35951822704,
      "active_params": 3000000000,
      "experts": 256,
      "layers": 40,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 20480,
      "attention_layout": "10 of its 40 layers use full attention and 30 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 20.26,
      "q8_0_weights_gib": 35.58,
      "fp16_weights_gib": 66.97,
      "q4_k_m_8k_total_gib": 22.95,
      "q4_k_m_32k_total_gib": 23.47,
      "q4_k_m_128k_total_gib": 25.53,
      "q8_0_8k_total_gib": 39.8,
      "q8_0_32k_total_gib": 40.32,
      "q8_0_128k_total_gib": 42.38,
      "fp16_8k_total_gib": 74.33,
      "fp16_32k_total_gib": 74.85,
      "fp16_128k_total_gib": 76.91,
      "kv_cache_8k_gib": 0.16,
      "kv_cache_32k_gib": 0.63,
      "kv_cache_128k_gib": 2.5,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Qwen3.6 27B",
      "hf_id": "Qwen/Qwen3.6-27B",
      "hf_url": "https://huggingface.co/Qwen/Qwen3.6-27B",
      "model_url": "https://modelvram.com/llm-vram-calculator/qwen3.6-27b/",
      "source_checked": "2026-09-26",
      "total_params": 27781427952,
      "active_params": null,
      "experts": null,
      "layers": 64,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 65536,
      "attention_layout": "16 of its 64 layers use full attention and 48 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 15.65,
      "q8_0_weights_gib": 27.49,
      "fp16_weights_gib": 51.75,
      "q4_k_m_8k_total_gib": 18.27,
      "q4_k_m_32k_total_gib": 19.92,
      "q4_k_m_128k_total_gib": 26.52,
      "q8_0_8k_total_gib": 31.29,
      "q8_0_32k_total_gib": 32.94,
      "q8_0_128k_total_gib": 39.54,
      "fp16_8k_total_gib": 57.97,
      "fp16_32k_total_gib": 59.62,
      "fp16_128k_total_gib": 66.22,
      "kv_cache_8k_gib": 0.5,
      "kv_cache_32k_gib": 2,
      "kv_cache_128k_gib": 8,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Qwen3.8 27B",
      "hf_id": "Qwen/Qwen3.8-27B",
      "hf_url": "https://huggingface.co/Qwen/Qwen3.8-27B",
      "model_url": "https://modelvram.com/llm-vram-calculator/qwen3.8-27b/",
      "source_checked": "2026-09-26",
      "total_params": 27781427952,
      "active_params": null,
      "experts": null,
      "layers": 64,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 65536,
      "attention_layout": "16 of its 64 layers use full attention and 48 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 15.65,
      "q8_0_weights_gib": 27.49,
      "fp16_weights_gib": 51.75,
      "q4_k_m_8k_total_gib": 18.27,
      "q4_k_m_32k_total_gib": 19.92,
      "q4_k_m_128k_total_gib": 26.52,
      "q8_0_8k_total_gib": 31.29,
      "q8_0_32k_total_gib": 32.94,
      "q8_0_128k_total_gib": 39.54,
      "fp16_8k_total_gib": 57.97,
      "fp16_32k_total_gib": 59.62,
      "fp16_128k_total_gib": 66.22,
      "kv_cache_8k_gib": 0.5,
      "kv_cache_32k_gib": 2,
      "kv_cache_128k_gib": 8,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Qwen3.8 Flash Next (180B MoE)",
      "hf_id": "Qwen/Qwen3.8-Flash-Next",
      "hf_url": "https://huggingface.co/Qwen/Qwen3.8-Flash-Next",
      "model_url": "https://modelvram.com/llm-vram-calculator/qwen3.8-flash-next/",
      "source_checked": "2026-09-26",
      "total_params": 179999981459,
      "active_params": 6000000000,
      "experts": 512,
      "layers": 48,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 24576,
      "attention_layout": "12 of its 48 layers use full attention and 36 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 101.42,
      "q8_0_weights_gib": 178.12,
      "fp16_weights_gib": 335.28,
      "q4_k_m_8k_total_gib": 112.27,
      "q4_k_m_32k_total_gib": 112.89,
      "q4_k_m_128k_total_gib": 115.36,
      "q8_0_8k_total_gib": 196.63,
      "q8_0_32k_total_gib": 197.25,
      "q8_0_128k_total_gib": 199.73,
      "fp16_8k_total_gib": 369.51,
      "fp16_32k_total_gib": 370.13,
      "fp16_128k_total_gib": 372.6,
      "kv_cache_8k_gib": 0.19,
      "kv_cache_32k_gib": 0.75,
      "kv_cache_128k_gib": 3,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "Qwen3.8 2.4T-A95B (MoE)",
      "hf_id": "Qwen/Qwen3.8-2.4T-A95B",
      "hf_url": "https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B",
      "model_url": "https://modelvram.com/llm-vram-calculator/qwen3.8-2.4t-a95b/",
      "source_checked": "2026-09-26",
      "total_params": 2446182725504,
      "active_params": 95000000000,
      "experts": 512,
      "layers": 92,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 94208,
      "attention_layout": "23 of its 92 layers use full attention and 69 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 1378.3,
      "q8_0_weights_gib": 2420.57,
      "fp16_weights_gib": 4556.37,
      "q4_k_m_8k_total_gib": 1517.42,
      "q4_k_m_32k_total_gib": 1519.79,
      "q4_k_m_128k_total_gib": 1529.28,
      "q8_0_8k_total_gib": 2663.92,
      "q8_0_32k_total_gib": 2666.29,
      "q8_0_128k_total_gib": 2675.78,
      "fp16_8k_total_gib": 5013.3,
      "fp16_32k_total_gib": 5015.67,
      "fp16_128k_total_gib": 5025.16,
      "kv_cache_8k_gib": 0.72,
      "kv_cache_32k_gib": 2.88,
      "kv_cache_128k_gib": 11.5,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "Qwen3.5 9B",
      "hf_id": "Qwen/Qwen3.5-9B",
      "hf_url": "https://huggingface.co/Qwen/Qwen3.5-9B",
      "model_url": "https://modelvram.com/llm-vram-calculator/qwen3.5-9b/",
      "source_checked": "2026-09-26",
      "total_params": 9653104368,
      "active_params": null,
      "experts": null,
      "layers": 32,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 32768,
      "attention_layout": "8 of its 32 layers use full attention and 24 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 5.44,
      "q8_0_weights_gib": 9.55,
      "fp16_weights_gib": 17.98,
      "q4_k_m_8k_total_gib": 6.76,
      "q4_k_m_32k_total_gib": 7.58,
      "q4_k_m_128k_total_gib": 10.88,
      "q8_0_8k_total_gib": 11.28,
      "q8_0_32k_total_gib": 12.11,
      "q8_0_128k_total_gib": 15.41,
      "fp16_8k_total_gib": 20.55,
      "fp16_32k_total_gib": 21.38,
      "fp16_128k_total_gib": 24.68,
      "kv_cache_8k_gib": 0.25,
      "kv_cache_32k_gib": 1,
      "kv_cache_128k_gib": 4,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": true,
      "q8_0_32k_fits_24gib": true,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": true,
      "fp16_32k_fits_32gib": true,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Qwen3.5 122B-A10B (MoE)",
      "hf_id": "Qwen/Qwen3.5-122B-A10B",
      "hf_url": "https://huggingface.co/Qwen/Qwen3.5-122B-A10B",
      "model_url": "https://modelvram.com/llm-vram-calculator/qwen3.5-122b-a10b/",
      "source_checked": "2026-09-26",
      "total_params": 125086497008,
      "active_params": 10000000000,
      "experts": 256,
      "layers": 48,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 24576,
      "attention_layout": "12 of its 48 layers use full attention and 36 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 70.48,
      "q8_0_weights_gib": 123.78,
      "fp16_weights_gib": 232.99,
      "q4_k_m_8k_total_gib": 78.23,
      "q4_k_m_32k_total_gib": 78.85,
      "q4_k_m_128k_total_gib": 81.33,
      "q8_0_8k_total_gib": 136.86,
      "q8_0_32k_total_gib": 137.48,
      "q8_0_128k_total_gib": 139.95,
      "fp16_8k_total_gib": 257,
      "fp16_32k_total_gib": 257.62,
      "fp16_128k_total_gib": 260.09,
      "kv_cache_8k_gib": 0.19,
      "kv_cache_32k_gib": 0.75,
      "kv_cache_128k_gib": 3,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "Qwen3-Coder-Next (80B MoE)",
      "hf_id": "Qwen/Qwen3-Coder-Next",
      "hf_url": "https://huggingface.co/Qwen/Qwen3-Coder-Next",
      "model_url": "https://modelvram.com/llm-vram-calculator/qwen3-coder-next/",
      "source_checked": "2026-09-26",
      "total_params": 79674391296,
      "active_params": 3000000000,
      "experts": 512,
      "layers": 48,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 24576,
      "attention_layout": "12 of its 48 layers use full attention and 36 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 44.89,
      "q8_0_weights_gib": 78.84,
      "fp16_weights_gib": 148.41,
      "q4_k_m_8k_total_gib": 50.09,
      "q4_k_m_32k_total_gib": 50.71,
      "q4_k_m_128k_total_gib": 53.18,
      "q8_0_8k_total_gib": 87.43,
      "q8_0_32k_total_gib": 88.05,
      "q8_0_128k_total_gib": 90.52,
      "fp16_8k_total_gib": 163.95,
      "fp16_32k_total_gib": 164.57,
      "fp16_128k_total_gib": 167.05,
      "kv_cache_8k_gib": 0.19,
      "kv_cache_32k_gib": 0.75,
      "kv_cache_128k_gib": 3,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "DeepSeek V4.1 Flash",
      "hf_id": "deepseek-ai/DeepSeek-V4.1-Flash",
      "hf_url": "https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash",
      "model_url": "https://modelvram.com/llm-vram-calculator/deepseek-v4.1-flash/",
      "source_checked": "2026-09-26",
      "total_params": 763205315794,
      "active_params": 16000000000,
      "experts": 384,
      "layers": 40,
      "max_context": 1048576,
      "kv_bytes_per_token_fp16": 81920,
      "attention_layout": "All 40 layers use full attention",
      "q4_k_m_weights_gib": 430.03,
      "q8_0_weights_gib": 755.21,
      "fp16_weights_gib": 1421.58,
      "q4_k_m_8k_total_gib": 474.22,
      "q4_k_m_32k_total_gib": 476.28,
      "q4_k_m_128k_total_gib": 484.53,
      "q8_0_8k_total_gib": 831.92,
      "q8_0_32k_total_gib": 833.99,
      "q8_0_128k_total_gib": 842.24,
      "fp16_8k_total_gib": 1564.93,
      "fp16_32k_total_gib": 1566.99,
      "fp16_128k_total_gib": 1575.24,
      "kv_cache_8k_gib": 0.63,
      "kv_cache_32k_gib": 2.5,
      "kv_cache_128k_gib": 10,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": "This model shares and compresses its KV cache across layers, which the calculator does not model, so the KV cache figure is an upper bound."
    },
    {
      "model": "DeepSeek V4 Flash",
      "hf_id": "deepseek-ai/DeepSeek-V4-Flash",
      "hf_url": "https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash",
      "model_url": "https://modelvram.com/llm-vram-calculator/deepseek-v4-flash/",
      "source_checked": "2026-09-26",
      "total_params": 290944616402,
      "active_params": 13000000000,
      "experts": 256,
      "layers": 43,
      "max_context": 1048576,
      "kv_bytes_per_token_fp16": 88064,
      "attention_layout": "All 43 layers use full attention",
      "q4_k_m_weights_gib": 163.93,
      "q8_0_weights_gib": 287.9,
      "fp16_weights_gib": 541.93,
      "q4_k_m_8k_total_gib": 181.57,
      "q4_k_m_32k_total_gib": 183.78,
      "q4_k_m_128k_total_gib": 192.65,
      "q8_0_8k_total_gib": 317.93,
      "q8_0_32k_total_gib": 320.14,
      "q8_0_128k_total_gib": 329.01,
      "fp16_8k_total_gib": 597.36,
      "fp16_32k_total_gib": 599.58,
      "fp16_128k_total_gib": 608.44,
      "kv_cache_8k_gib": 0.67,
      "kv_cache_32k_gib": 2.69,
      "kv_cache_128k_gib": 10.75,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": "This model shares and compresses its KV cache across layers, which the calculator does not model, so the KV cache figure is an upper bound."
    },
    {
      "model": "DeepSeek V4 Pro",
      "hf_id": "deepseek-ai/DeepSeek-V4-Pro",
      "hf_url": "https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro",
      "model_url": "https://modelvram.com/llm-vram-calculator/deepseek-v4-pro/",
      "source_checked": "2026-09-26",
      "total_params": 1598839674782,
      "active_params": 49000000000,
      "experts": 384,
      "layers": 61,
      "max_context": 1048576,
      "kv_bytes_per_token_fp16": 124928,
      "attention_layout": "All 61 layers use full attention",
      "q4_k_m_weights_gib": 900.87,
      "q8_0_weights_gib": 1582.1,
      "fp16_weights_gib": 2978.07,
      "q4_k_m_8k_total_gib": 992.5,
      "q4_k_m_32k_total_gib": 995.65,
      "q4_k_m_128k_total_gib": 1008.23,
      "q8_0_8k_total_gib": 1741.86,
      "q8_0_32k_total_gib": 1745,
      "q8_0_128k_total_gib": 1757.59,
      "fp16_8k_total_gib": 3277.43,
      "fp16_32k_total_gib": 3280.57,
      "fp16_128k_total_gib": 3293.15,
      "kv_cache_8k_gib": 0.95,
      "kv_cache_32k_gib": 3.81,
      "kv_cache_128k_gib": 15.25,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": "This model shares and compresses its KV cache across layers, which the calculator does not model, so the KV cache figure is an upper bound."
    },
    {
      "model": "DeepSeek V3.2",
      "hf_id": "deepseek-ai/DeepSeek-V3.2",
      "hf_url": "https://huggingface.co/deepseek-ai/DeepSeek-V3.2",
      "model_url": "https://modelvram.com/llm-vram-calculator/deepseek-v3.2/",
      "source_checked": "2026-09-26",
      "total_params": 685355329792,
      "active_params": 37000000000,
      "experts": 256,
      "layers": 61,
      "max_context": 163840,
      "kv_bytes_per_token_fp16": 78080,
      "attention_layout": "All 61 layers use multi-head latent attention",
      "q4_k_m_weights_gib": 386.16,
      "q8_0_weights_gib": 678.18,
      "fp16_weights_gib": 1276.57,
      "q4_k_m_8k_total_gib": 425.94,
      "q4_k_m_32k_total_gib": 427.9,
      "q4_k_m_128k_total_gib": 435.76,
      "q8_0_8k_total_gib": 747.15,
      "q8_0_32k_total_gib": 749.12,
      "q8_0_128k_total_gib": 756.98,
      "fp16_8k_total_gib": 1405.39,
      "fp16_32k_total_gib": 1407.35,
      "fp16_128k_total_gib": 1415.22,
      "kv_cache_8k_gib": 0.6,
      "kv_cache_32k_gib": 2.38,
      "kv_cache_128k_gib": 9.53,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "GLM-5.3",
      "hf_id": "zai-org/GLM-5.3",
      "hf_url": "https://huggingface.co/zai-org/GLM-5.3",
      "model_url": "https://modelvram.com/llm-vram-calculator/glm-5.3/",
      "source_checked": "2026-09-26",
      "total_params": 753329940480,
      "active_params": 40000000000,
      "experts": 256,
      "layers": 78,
      "max_context": 1048576,
      "kv_bytes_per_token_fp16": 92544,
      "attention_layout": "All 78 layers use multi-head latent attention",
      "q4_k_m_weights_gib": 424.46,
      "q8_0_weights_gib": 745.44,
      "fp16_weights_gib": 1403.19,
      "q4_k_m_8k_total_gib": 468.19,
      "q4_k_m_32k_total_gib": 470.52,
      "q4_k_m_128k_total_gib": 479.84,
      "q8_0_8k_total_gib": 821.26,
      "q8_0_32k_total_gib": 823.59,
      "q8_0_128k_total_gib": 832.91,
      "fp16_8k_total_gib": 1544.78,
      "fp16_32k_total_gib": 1547.11,
      "fp16_128k_total_gib": 1556.43,
      "kv_cache_8k_gib": 0.71,
      "kv_cache_32k_gib": 2.82,
      "kv_cache_128k_gib": 11.3,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "GLM-5.3 Flash",
      "hf_id": "zai-org/GLM-5.3-Flash",
      "hf_url": "https://huggingface.co/zai-org/GLM-5.3-Flash",
      "model_url": "https://modelvram.com/llm-vram-calculator/glm-5.3-flash/",
      "source_checked": "2026-09-26",
      "total_params": 321323031390,
      "active_params": 18000000000,
      "experts": 288,
      "layers": 45,
      "max_context": 1048576,
      "kv_bytes_per_token_fp16": 12672,
      "attention_layout": "11 of its 45 layers use multi-head latent attention and 34 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 181.05,
      "q8_0_weights_gib": 317.96,
      "fp16_weights_gib": 598.51,
      "q4_k_m_8k_total_gib": 199.76,
      "q4_k_m_32k_total_gib": 200.08,
      "q4_k_m_128k_total_gib": 201.36,
      "q8_0_8k_total_gib": 350.36,
      "q8_0_32k_total_gib": 350.68,
      "q8_0_128k_total_gib": 351.96,
      "fp16_8k_total_gib": 658.97,
      "fp16_32k_total_gib": 659.29,
      "fp16_128k_total_gib": 660.56,
      "kv_cache_8k_gib": 0.1,
      "kv_cache_32k_gib": 0.39,
      "kv_cache_128k_gib": 1.55,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "GLM-5.2",
      "hf_id": "zai-org/GLM-5.2",
      "hf_url": "https://huggingface.co/zai-org/GLM-5.2",
      "model_url": "https://modelvram.com/llm-vram-calculator/glm-5.2/",
      "source_checked": "2026-09-26",
      "total_params": 753329940480,
      "active_params": 40000000000,
      "experts": 256,
      "layers": 78,
      "max_context": 1048576,
      "kv_bytes_per_token_fp16": 92544,
      "attention_layout": "All 78 layers use multi-head latent attention",
      "q4_k_m_weights_gib": 424.46,
      "q8_0_weights_gib": 745.44,
      "fp16_weights_gib": 1403.19,
      "q4_k_m_8k_total_gib": 468.19,
      "q4_k_m_32k_total_gib": 470.52,
      "q4_k_m_128k_total_gib": 479.84,
      "q8_0_8k_total_gib": 821.26,
      "q8_0_32k_total_gib": 823.59,
      "q8_0_128k_total_gib": 832.91,
      "fp16_8k_total_gib": 1544.78,
      "fp16_32k_total_gib": 1547.11,
      "fp16_128k_total_gib": 1556.43,
      "kv_cache_8k_gib": 0.71,
      "kv_cache_32k_gib": 2.82,
      "kv_cache_128k_gib": 11.3,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "GLM-4.7 Flash",
      "hf_id": "zai-org/GLM-4.7-Flash",
      "hf_url": "https://huggingface.co/zai-org/GLM-4.7-Flash",
      "model_url": "https://modelvram.com/llm-vram-calculator/glm-4.7-flash/",
      "source_checked": "2026-09-26",
      "total_params": 31221488576,
      "active_params": 3000000000,
      "experts": 64,
      "layers": 47,
      "max_context": 202752,
      "kv_bytes_per_token_fp16": 54144,
      "attention_layout": "All 47 layers use multi-head latent attention",
      "q4_k_m_weights_gib": 17.59,
      "q8_0_weights_gib": 30.89,
      "fp16_weights_gib": 58.15,
      "q4_k_m_8k_total_gib": 20.31,
      "q4_k_m_32k_total_gib": 21.67,
      "q4_k_m_128k_total_gib": 27.12,
      "q8_0_8k_total_gib": 34.94,
      "q8_0_32k_total_gib": 36.3,
      "q8_0_128k_total_gib": 41.75,
      "fp16_8k_total_gib": 64.92,
      "fp16_32k_total_gib": 66.29,
      "fp16_128k_total_gib": 71.74,
      "kv_cache_8k_gib": 0.41,
      "kv_cache_32k_gib": 1.65,
      "kv_cache_128k_gib": 6.61,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Gemma 4 31B",
      "hf_id": "google/gemma-4-31B-it",
      "hf_url": "https://huggingface.co/google/gemma-4-31B-it",
      "model_url": "https://modelvram.com/llm-vram-calculator/gemma-4-31b-it/",
      "source_checked": "2026-09-26",
      "total_params": 31273088876,
      "active_params": null,
      "experts": null,
      "layers": 60,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 81920,
      "attention_layout": "10 of its 60 layers use full attention and 50 keep a sliding window of 1,024 tokens",
      "q4_k_m_weights_gib": 17.62,
      "q8_0_weights_gib": 30.95,
      "fp16_weights_gib": 58.25,
      "q4_k_m_8k_total_gib": 21.86,
      "q4_k_m_32k_total_gib": 23.92,
      "q4_k_m_128k_total_gib": 32.17,
      "q8_0_8k_total_gib": 36.52,
      "q8_0_32k_total_gib": 38.58,
      "q8_0_128k_total_gib": 46.83,
      "fp16_8k_total_gib": 66.55,
      "fp16_32k_total_gib": 68.61,
      "fp16_128k_total_gib": 76.86,
      "kv_cache_8k_gib": 1.8,
      "kv_cache_32k_gib": 3.67,
      "kv_cache_128k_gib": 11.17,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Gemma 4 26B-A4B (MoE)",
      "hf_id": "google/gemma-4-26B-A4B-it",
      "hf_url": "https://huggingface.co/google/gemma-4-26B-A4B-it",
      "model_url": "https://modelvram.com/llm-vram-calculator/gemma-4-26b-a4b-it/",
      "source_checked": "2026-09-26",
      "total_params": 25805936206,
      "active_params": 4000000000,
      "experts": 128,
      "layers": 30,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 20480,
      "attention_layout": "5 of its 30 layers use full attention and 25 keep a sliding window of 1,024 tokens",
      "q4_k_m_weights_gib": 14.54,
      "q8_0_weights_gib": 25.54,
      "fp16_weights_gib": 48.07,
      "q4_k_m_8k_total_gib": 16.99,
      "q4_k_m_32k_total_gib": 17.5,
      "q4_k_m_128k_total_gib": 19.57,
      "q8_0_8k_total_gib": 29.08,
      "q8_0_32k_total_gib": 29.6,
      "q8_0_128k_total_gib": 31.66,
      "fp16_8k_total_gib": 53.87,
      "fp16_32k_total_gib": 54.38,
      "fp16_128k_total_gib": 56.45,
      "kv_cache_8k_gib": 0.45,
      "kv_cache_32k_gib": 0.92,
      "kv_cache_128k_gib": 2.79,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Gemma 4 12B",
      "hf_id": "google/gemma-4-12B-it",
      "hf_url": "https://huggingface.co/google/gemma-4-12B-it",
      "model_url": "https://modelvram.com/llm-vram-calculator/gemma-4-12b-it/",
      "source_checked": "2026-09-26",
      "total_params": 11959730224,
      "active_params": null,
      "experts": null,
      "layers": 48,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 16384,
      "attention_layout": "8 of its 48 layers use full attention and 40 keep a sliding window of 1,024 tokens",
      "q4_k_m_weights_gib": 6.74,
      "q8_0_weights_gib": 11.83,
      "fp16_weights_gib": 22.28,
      "q4_k_m_8k_total_gib": 8.57,
      "q4_k_m_32k_total_gib": 8.98,
      "q4_k_m_128k_total_gib": 10.63,
      "q8_0_8k_total_gib": 14.17,
      "q8_0_32k_total_gib": 14.58,
      "q8_0_128k_total_gib": 16.23,
      "fp16_8k_total_gib": 25.66,
      "fp16_32k_total_gib": 26.07,
      "fp16_128k_total_gib": 27.72,
      "kv_cache_8k_gib": 0.59,
      "kv_cache_32k_gib": 0.97,
      "kv_cache_128k_gib": 2.47,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": true,
      "q8_0_32k_fits_24gib": true,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": true,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Gemma 4 E4B",
      "hf_id": "google/gemma-4-E4B-it",
      "hf_url": "https://huggingface.co/google/gemma-4-E4B-it",
      "model_url": "https://modelvram.com/llm-vram-calculator/gemma-4-e4b-it/",
      "source_checked": "2026-09-26",
      "total_params": 7996156490,
      "active_params": null,
      "experts": null,
      "layers": 42,
      "max_context": 131072,
      "kv_bytes_per_token_fp16": 16384,
      "attention_layout": "4 of its 42 layers use full attention, 20 keep a sliding window of 512 tokens and 18 reuse the cache of earlier layers",
      "q4_k_m_weights_gib": 4.51,
      "q8_0_weights_gib": 7.91,
      "fp16_weights_gib": 14.89,
      "q4_k_m_8k_total_gib": 5.64,
      "q4_k_m_32k_total_gib": 6.05,
      "q4_k_m_128k_total_gib": 7.7,
      "q8_0_8k_total_gib": 9.38,
      "q8_0_32k_total_gib": 9.8,
      "q8_0_128k_total_gib": 11.45,
      "fp16_8k_total_gib": 17.06,
      "fp16_32k_total_gib": 17.48,
      "fp16_128k_total_gib": 19.13,
      "kv_cache_8k_gib": 0.16,
      "kv_cache_32k_gib": 0.54,
      "kv_cache_128k_gib": 2.04,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": true,
      "q8_0_32k_fits_24gib": true,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": true,
      "fp16_32k_fits_32gib": true,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Kimi K3",
      "hf_id": "moonshotai/Kimi-K3",
      "hf_url": "https://huggingface.co/moonshotai/Kimi-K3",
      "model_url": "https://modelvram.com/llm-vram-calculator/kimi-k3/",
      "source_checked": "2026-09-26",
      "total_params": 2779931837184,
      "active_params": 104000000000,
      "experts": 896,
      "layers": 93,
      "max_context": 1048576,
      "kv_bytes_per_token_fp16": 27648,
      "attention_layout": "24 of its 93 layers use multi-head latent attention and 69 are linear-attention layers with no growing cache",
      "q4_k_m_weights_gib": 1566.35,
      "q8_0_weights_gib": 2750.83,
      "fp16_weights_gib": 5178.03,
      "q4_k_m_8k_total_gib": 1723.72,
      "q4_k_m_32k_total_gib": 1724.42,
      "q4_k_m_128k_total_gib": 1727.2,
      "q8_0_8k_total_gib": 3026.64,
      "q8_0_32k_total_gib": 3027.34,
      "q8_0_128k_total_gib": 3030.12,
      "fp16_8k_total_gib": 5696.56,
      "fp16_32k_total_gib": 5697.26,
      "fp16_128k_total_gib": 5700.04,
      "kv_cache_8k_gib": 0.21,
      "kv_cache_32k_gib": 0.84,
      "kv_cache_128k_gib": 3.38,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "MiniMax M3",
      "hf_id": "MiniMaxAI/MiniMax-M3",
      "hf_url": "https://huggingface.co/MiniMaxAI/MiniMax-M3",
      "model_url": "https://modelvram.com/llm-vram-calculator/minimax-m3/",
      "source_checked": "2026-09-26",
      "total_params": 427040140160,
      "active_params": 23000000000,
      "experts": 128,
      "layers": 60,
      "max_context": 1048576,
      "kv_bytes_per_token_fp16": 122880,
      "attention_layout": "All 60 layers use full attention",
      "q4_k_m_weights_gib": 240.62,
      "q8_0_weights_gib": 422.57,
      "fp16_weights_gib": 795.42,
      "q4_k_m_8k_total_gib": 266.21,
      "q4_k_m_32k_total_gib": 269.3,
      "q4_k_m_128k_total_gib": 281.68,
      "q8_0_8k_total_gib": 466.36,
      "q8_0_32k_total_gib": 469.45,
      "q8_0_128k_total_gib": 481.83,
      "fp16_8k_total_gib": 876.5,
      "fp16_32k_total_gib": 879.59,
      "fp16_128k_total_gib": 891.97,
      "kv_cache_8k_gib": 0.94,
      "kv_cache_32k_gib": 3.75,
      "kv_cache_128k_gib": 15,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "MiniMax M2.7",
      "hf_id": "MiniMaxAI/MiniMax-M2.7",
      "hf_url": "https://huggingface.co/MiniMaxAI/MiniMax-M2.7",
      "model_url": "https://modelvram.com/llm-vram-calculator/minimax-m2.7/",
      "source_checked": "2026-09-26",
      "total_params": 228689764864,
      "active_params": 10000000000,
      "experts": 256,
      "layers": 62,
      "max_context": 204800,
      "kv_bytes_per_token_fp16": 253952,
      "attention_layout": "All 62 layers use full attention",
      "q4_k_m_weights_gib": 128.86,
      "q8_0_weights_gib": 226.3,
      "fp16_weights_gib": 425.97,
      "q4_k_m_8k_total_gib": 144.37,
      "q4_k_m_32k_total_gib": 150.77,
      "q4_k_m_128k_total_gib": 176.34,
      "q8_0_8k_total_gib": 251.56,
      "q8_0_32k_total_gib": 257.95,
      "q8_0_128k_total_gib": 283.52,
      "fp16_8k_total_gib": 471.2,
      "fp16_32k_total_gib": 477.59,
      "fp16_128k_total_gib": 503.16,
      "kv_cache_8k_gib": 1.94,
      "kv_cache_32k_gib": 7.75,
      "kv_cache_128k_gib": 31,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "MiMo V2.6 Flash",
      "hf_id": "XiaomiMiMo/MiMo-V2.6-Flash-RL",
      "hf_url": "https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-RL",
      "model_url": "https://modelvram.com/llm-vram-calculator/mimo-v2.6-flash-rl/",
      "source_checked": "2026-09-26",
      "total_params": 310756322688,
      "active_params": 15000000000,
      "experts": 256,
      "layers": 48,
      "max_context": 1048576,
      "kv_bytes_per_token_fp16": 23040,
      "attention_layout": "9 of its 48 layers use full attention and 39 keep a sliding window of 128 tokens",
      "q4_k_m_weights_gib": 175.1,
      "q8_0_weights_gib": 307.5,
      "fp16_weights_gib": 578.83,
      "q4_k_m_8k_total_gib": 193.46,
      "q4_k_m_32k_total_gib": 194.04,
      "q4_k_m_128k_total_gib": 196.36,
      "q8_0_8k_total_gib": 339.1,
      "q8_0_32k_total_gib": 339.68,
      "q8_0_128k_total_gib": 342,
      "fp16_8k_total_gib": 637.56,
      "fp16_32k_total_gib": 638.14,
      "fp16_128k_total_gib": 640.46,
      "kv_cache_8k_gib": 0.32,
      "kv_cache_32k_gib": 0.85,
      "kv_cache_128k_gib": 2.96,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "MiMo V2.6 Pro",
      "hf_id": "XiaomiMiMo/MiMo-V2.6-Pro-RL",
      "hf_url": "https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL",
      "model_url": "https://modelvram.com/llm-vram-calculator/mimo-v2.6-pro-rl/",
      "source_checked": "2026-09-26",
      "total_params": 1024216603392,
      "active_params": 42000000000,
      "experts": 384,
      "layers": 70,
      "max_context": 1048576,
      "kv_bytes_per_token_fp16": 51200,
      "attention_layout": "10 of its 70 layers use full attention and 60 keep a sliding window of 128 tokens",
      "q4_k_m_weights_gib": 577.1,
      "q8_0_weights_gib": 1013.49,
      "fp16_weights_gib": 1907.75,
      "q4_k_m_8k_total_gib": 635.98,
      "q4_k_m_32k_total_gib": 637.26,
      "q4_k_m_128k_total_gib": 642.42,
      "q8_0_8k_total_gib": 1116.01,
      "q8_0_32k_total_gib": 1117.3,
      "q8_0_128k_total_gib": 1122.46,
      "fp16_8k_total_gib": 2099.7,
      "fp16_32k_total_gib": 2100.99,
      "fp16_128k_total_gib": 2106.14,
      "kv_cache_8k_gib": 0.61,
      "kv_cache_32k_gib": 1.78,
      "kv_cache_128k_gib": 6.47,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "Mistral Medium 3.5 128B",
      "hf_id": "mistralai/Mistral-Medium-3.5-128B",
      "hf_url": "https://huggingface.co/mistralai/Mistral-Medium-3.5-128B",
      "model_url": "https://modelvram.com/llm-vram-calculator/mistral-medium-3.5-128b/",
      "source_checked": "2026-09-26",
      "total_params": 127704210176,
      "active_params": null,
      "experts": null,
      "layers": 88,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 360448,
      "attention_layout": "All 88 layers use full attention",
      "q4_k_m_weights_gib": 71.95,
      "q8_0_weights_gib": 126.37,
      "fp16_weights_gib": 237.87,
      "q4_k_m_8k_total_gib": 82.68,
      "q4_k_m_32k_total_gib": 91.75,
      "q4_k_m_128k_total_gib": 128.05,
      "q8_0_8k_total_gib": 142.53,
      "q8_0_32k_total_gib": 151.6,
      "q8_0_128k_total_gib": 187.9,
      "fp16_8k_total_gib": 265.18,
      "fp16_32k_total_gib": 274.25,
      "fp16_128k_total_gib": 310.55,
      "kv_cache_8k_gib": 2.75,
      "kv_cache_32k_gib": 11,
      "kv_cache_128k_gib": 44,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "Nemotron 3 Nano 4B",
      "hf_id": "nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16",
      "hf_url": "https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16",
      "model_url": "https://modelvram.com/llm-vram-calculator/nemotron-3-nano-4b/",
      "source_checked": "2026-09-26",
      "total_params": 3973556832,
      "active_params": null,
      "experts": null,
      "layers": 42,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 16384,
      "attention_layout": "4 of its 42 layers use full attention and 38 are Mamba or feed-forward layers with no growing cache",
      "q4_k_m_weights_gib": 2.24,
      "q8_0_weights_gib": 3.93,
      "fp16_weights_gib": 7.4,
      "q4_k_m_8k_total_gib": 3.1,
      "q4_k_m_32k_total_gib": 3.51,
      "q4_k_m_128k_total_gib": 5.16,
      "q8_0_8k_total_gib": 4.96,
      "q8_0_32k_total_gib": 5.38,
      "q8_0_128k_total_gib": 7.03,
      "fp16_8k_total_gib": 8.78,
      "fp16_32k_total_gib": 9.19,
      "fp16_128k_total_gib": 10.84,
      "kv_cache_8k_gib": 0.13,
      "kv_cache_32k_gib": 0.5,
      "kv_cache_128k_gib": 2,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": true,
      "q8_0_32k_fits_24gib": true,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": true,
      "fp16_32k_fits_24gib": true,
      "fp16_32k_fits_32gib": true,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Nemotron 3 Nano 30B-A3B (MoE)",
      "hf_id": "nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16",
      "hf_url": "https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16",
      "model_url": "https://modelvram.com/llm-vram-calculator/nemotron-3-nano-30b-a3b/",
      "source_checked": "2026-09-26",
      "total_params": 31577937344,
      "active_params": 3500000000,
      "experts": 128,
      "layers": 52,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 6144,
      "attention_layout": "6 of its 52 layers use full attention and 46 are Mamba or feed-forward layers with no growing cache",
      "q4_k_m_weights_gib": 17.79,
      "q8_0_weights_gib": 31.25,
      "fp16_weights_gib": 58.82,
      "q4_k_m_8k_total_gib": 20.12,
      "q4_k_m_32k_total_gib": 20.28,
      "q4_k_m_128k_total_gib": 20.9,
      "q8_0_8k_total_gib": 34.92,
      "q8_0_32k_total_gib": 35.08,
      "q8_0_128k_total_gib": 35.7,
      "fp16_8k_total_gib": 65.25,
      "fp16_32k_total_gib": 65.41,
      "fp16_128k_total_gib": 66.03,
      "kv_cache_8k_gib": 0.05,
      "kv_cache_32k_gib": 0.19,
      "kv_cache_128k_gib": 0.75,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Nemotron 3 Super 120B-A12B (MoE)",
      "hf_id": "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16",
      "hf_url": "https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16",
      "model_url": "https://modelvram.com/llm-vram-calculator/nemotron-3-super-120b-a12b/",
      "source_checked": "2026-09-26",
      "total_params": 123611012096,
      "active_params": 12000000000,
      "experts": 512,
      "layers": 88,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 8192,
      "attention_layout": "8 of its 88 layers use full attention and 80 are Mamba or feed-forward layers with no growing cache",
      "q4_k_m_weights_gib": 69.65,
      "q8_0_weights_gib": 122.32,
      "fp16_weights_gib": 230.24,
      "q4_k_m_8k_total_gib": 77.18,
      "q4_k_m_32k_total_gib": 77.39,
      "q4_k_m_128k_total_gib": 78.21,
      "q8_0_8k_total_gib": 135.12,
      "q8_0_32k_total_gib": 135.32,
      "q8_0_128k_total_gib": 136.15,
      "fp16_8k_total_gib": 253.84,
      "fp16_32k_total_gib": 254.04,
      "fp16_128k_total_gib": 254.87,
      "kv_cache_8k_gib": 0.06,
      "kv_cache_32k_gib": 0.25,
      "kv_cache_128k_gib": 1,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "Xing 4.0 29B-A4B (MoE)",
      "hf_id": "XingChen-AGI/Xing4.0-29B-A4B",
      "hf_url": "https://huggingface.co/XingChen-AGI/Xing4.0-29B-A4B",
      "model_url": "https://modelvram.com/llm-vram-calculator/xing4.0-29b-a4b/",
      "source_checked": "2026-09-26",
      "total_params": 31215031088,
      "active_params": 4000000000,
      "experts": 64,
      "layers": 40,
      "max_context": 262144,
      "kv_bytes_per_token_fp16": 46080,
      "attention_layout": "All 40 layers use multi-head latent attention",
      "q4_k_m_weights_gib": 17.59,
      "q8_0_weights_gib": 30.89,
      "fp16_weights_gib": 58.14,
      "q4_k_m_8k_total_gib": 20.23,
      "q4_k_m_32k_total_gib": 21.39,
      "q4_k_m_128k_total_gib": 26.03,
      "q8_0_8k_total_gib": 34.86,
      "q8_0_32k_total_gib": 36.02,
      "q8_0_128k_total_gib": 40.66,
      "fp16_8k_total_gib": 64.84,
      "fp16_32k_total_gib": 66,
      "fp16_128k_total_gib": 70.64,
      "kv_cache_8k_gib": 0.35,
      "kv_cache_32k_gib": 1.41,
      "kv_cache_128k_gib": 5.63,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Muse Glimmer 30B",
      "hf_id": "meta-models/Muse-Glimmer-30B",
      "hf_url": "https://huggingface.co/meta-models/Muse-Glimmer-30B",
      "model_url": "https://modelvram.com/llm-vram-calculator/muse-glimmer-30b/",
      "source_checked": "2026-09-26",
      "total_params": 29776626688,
      "active_params": null,
      "experts": null,
      "layers": 52,
      "max_context": 131072,
      "kv_bytes_per_token_fp16": 13312,
      "attention_layout": "13 of its 52 layers use full attention and 39 keep a sliding window of 2,048 tokens",
      "q4_k_m_weights_gib": 16.78,
      "q8_0_weights_gib": 29.46,
      "fp16_weights_gib": 55.46,
      "q4_k_m_8k_total_gib": 19.17,
      "q4_k_m_32k_total_gib": 19.51,
      "q4_k_m_128k_total_gib": 20.85,
      "q8_0_8k_total_gib": 33.13,
      "q8_0_32k_total_gib": 33.46,
      "q8_0_128k_total_gib": 34.8,
      "fp16_8k_total_gib": 61.73,
      "fp16_32k_total_gib": 62.06,
      "fp16_128k_total_gib": 63.4,
      "kv_cache_8k_gib": 0.2,
      "kv_cache_32k_gib": 0.5,
      "kv_cache_128k_gib": 1.72,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "MiniCPM5 2B",
      "hf_id": "openbmb/MiniCPM5-2B",
      "hf_url": "https://huggingface.co/openbmb/MiniCPM5-2B",
      "model_url": "https://modelvram.com/llm-vram-calculator/minicpm5-2b/",
      "source_checked": "2026-09-26",
      "total_params": 2516756480,
      "active_params": null,
      "experts": null,
      "layers": 42,
      "max_context": 131072,
      "kv_bytes_per_token_fp16": 43008,
      "attention_layout": "All 42 layers use full attention",
      "q4_k_m_weights_gib": 1.42,
      "q8_0_weights_gib": 2.49,
      "fp16_weights_gib": 4.69,
      "q4_k_m_8k_total_gib": 2.42,
      "q4_k_m_32k_total_gib": 3.5,
      "q4_k_m_128k_total_gib": 7.83,
      "q8_0_8k_total_gib": 3.6,
      "q8_0_32k_total_gib": 4.68,
      "q8_0_128k_total_gib": 9.01,
      "fp16_8k_total_gib": 6.02,
      "fp16_32k_total_gib": 7.1,
      "fp16_128k_total_gib": 11.43,
      "kv_cache_8k_gib": 0.33,
      "kv_cache_32k_gib": 1.31,
      "kv_cache_128k_gib": 5.25,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": true,
      "q8_0_32k_fits_24gib": true,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": true,
      "fp16_32k_fits_24gib": true,
      "fp16_32k_fits_32gib": true,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Llama 3.1 8B",
      "hf_id": "meta-llama/Llama-3.1-8B-Instruct",
      "hf_url": "https://huggingface.co/meta-llama/Llama-3.1-8B-Instruct",
      "model_url": "https://modelvram.com/llm-vram-calculator/llama-3.1-8b-instruct/",
      "source_checked": "2026-09-26",
      "total_params": 8030261248,
      "active_params": null,
      "experts": null,
      "layers": 32,
      "max_context": 131072,
      "kv_bytes_per_token_fp16": 131072,
      "attention_layout": "All 32 layers use full attention",
      "q4_k_m_weights_gib": 4.52,
      "q8_0_weights_gib": 7.95,
      "fp16_weights_gib": 14.96,
      "q4_k_m_8k_total_gib": 6.58,
      "q4_k_m_32k_total_gib": 9.88,
      "q4_k_m_128k_total_gib": 23.08,
      "q8_0_8k_total_gib": 10.34,
      "q8_0_32k_total_gib": 13.64,
      "q8_0_128k_total_gib": 26.84,
      "fp16_8k_total_gib": 18.05,
      "fp16_32k_total_gib": 21.35,
      "fp16_128k_total_gib": 34.55,
      "kv_cache_8k_gib": 1,
      "kv_cache_32k_gib": 4,
      "kv_cache_128k_gib": 16,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": true,
      "q8_0_32k_fits_24gib": true,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": true,
      "fp16_32k_fits_32gib": true,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Llama 3.1 70B",
      "hf_id": "meta-llama/Llama-3.1-70B-Instruct",
      "hf_url": "https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct",
      "model_url": "https://modelvram.com/llm-vram-calculator/llama-3.1-70b-instruct/",
      "source_checked": "2026-09-26",
      "total_params": 70553706496,
      "active_params": null,
      "experts": null,
      "layers": 80,
      "max_context": 131072,
      "kv_bytes_per_token_fp16": 327680,
      "attention_layout": "All 80 layers use full attention",
      "q4_k_m_weights_gib": 39.75,
      "q8_0_weights_gib": 69.82,
      "fp16_weights_gib": 131.42,
      "q4_k_m_8k_total_gib": 46.98,
      "q4_k_m_32k_total_gib": 55.23,
      "q4_k_m_128k_total_gib": 88.23,
      "q8_0_8k_total_gib": 80.05,
      "q8_0_32k_total_gib": 88.3,
      "q8_0_128k_total_gib": 121.3,
      "fp16_8k_total_gib": 147.81,
      "fp16_32k_total_gib": 156.06,
      "fp16_128k_total_gib": 189.06,
      "kv_cache_8k_gib": 2.5,
      "kv_cache_32k_gib": 10,
      "kv_cache_128k_gib": 40,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "Qwen3 8B",
      "hf_id": "Qwen/Qwen3-8B",
      "hf_url": "https://huggingface.co/Qwen/Qwen3-8B",
      "model_url": "https://modelvram.com/llm-vram-calculator/qwen3-8b/",
      "source_checked": "2026-09-26",
      "total_params": 8190735360,
      "active_params": null,
      "experts": null,
      "layers": 36,
      "max_context": 40960,
      "kv_bytes_per_token_fp16": 147456,
      "attention_layout": "All 36 layers use full attention",
      "q4_k_m_weights_gib": 4.62,
      "q8_0_weights_gib": 8.1,
      "fp16_weights_gib": 15.26,
      "q4_k_m_8k_total_gib": 6.81,
      "q4_k_m_32k_total_gib": 10.53,
      "q4_k_m_128k_total_gib": null,
      "q8_0_8k_total_gib": 10.65,
      "q8_0_32k_total_gib": 14.37,
      "q8_0_128k_total_gib": null,
      "fp16_8k_total_gib": 18.52,
      "fp16_32k_total_gib": 22.23,
      "fp16_128k_total_gib": null,
      "kv_cache_8k_gib": 1.13,
      "kv_cache_32k_gib": 4.5,
      "kv_cache_128k_gib": null,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": true,
      "q8_0_32k_fits_24gib": true,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": true,
      "fp16_32k_fits_32gib": true,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "Qwen3 30B-A3B (MoE)",
      "hf_id": "Qwen/Qwen3-30B-A3B",
      "hf_url": "https://huggingface.co/Qwen/Qwen3-30B-A3B",
      "model_url": "https://modelvram.com/llm-vram-calculator/qwen3-30b-a3b/",
      "source_checked": "2026-09-26",
      "total_params": 30532122624,
      "active_params": 3300000000,
      "experts": 128,
      "layers": 48,
      "max_context": 40960,
      "kv_bytes_per_token_fp16": 98304,
      "attention_layout": "All 48 layers use full attention",
      "q4_k_m_weights_gib": 17.2,
      "q8_0_weights_gib": 30.21,
      "fp16_weights_gib": 56.87,
      "q4_k_m_8k_total_gib": 20.25,
      "q4_k_m_32k_total_gib": 22.72,
      "q4_k_m_128k_total_gib": null,
      "q8_0_8k_total_gib": 34.56,
      "q8_0_32k_total_gib": 37.03,
      "q8_0_128k_total_gib": null,
      "fp16_8k_total_gib": 63.88,
      "fp16_32k_total_gib": 66.36,
      "fp16_128k_total_gib": null,
      "kv_cache_8k_gib": 0.75,
      "kv_cache_32k_gib": 3,
      "kv_cache_128k_gib": null,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "gpt-oss-20b",
      "hf_id": "openai/gpt-oss-20b",
      "hf_url": "https://huggingface.co/openai/gpt-oss-20b",
      "model_url": "https://modelvram.com/llm-vram-calculator/gpt-oss-20b/",
      "source_checked": "2026-09-26",
      "total_params": 20914757184,
      "active_params": 3600000000,
      "experts": 32,
      "layers": 24,
      "max_context": 131072,
      "kv_bytes_per_token_fp16": 24576,
      "attention_layout": "12 of its 24 layers use full attention and 12 keep a sliding window of 128 tokens",
      "q4_k_m_weights_gib": 11.78,
      "q8_0_weights_gib": 20.7,
      "fp16_weights_gib": 38.96,
      "q4_k_m_8k_total_gib": 13.69,
      "q4_k_m_32k_total_gib": 14.31,
      "q4_k_m_128k_total_gib": 16.78,
      "q8_0_8k_total_gib": 23.49,
      "q8_0_32k_total_gib": 24.11,
      "q8_0_128k_total_gib": 26.58,
      "fp16_8k_total_gib": 43.58,
      "fp16_32k_total_gib": 44.2,
      "fp16_128k_total_gib": 46.67,
      "kv_cache_8k_gib": 0.21,
      "kv_cache_32k_gib": 0.77,
      "kv_cache_128k_gib": 3.02,
      "q4_k_m_32k_fits_16gib": true,
      "q4_k_m_32k_fits_24gib": true,
      "q4_k_m_32k_fits_32gib": true,
      "q4_k_m_32k_fits_48gib": true,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": true,
      "q8_0_32k_fits_48gib": true,
      "q8_0_32k_fits_80gib": true,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": true,
      "fp16_32k_fits_80gib": true,
      "note": ""
    },
    {
      "model": "gpt-oss-120b",
      "hf_id": "openai/gpt-oss-120b",
      "hf_url": "https://huggingface.co/openai/gpt-oss-120b",
      "model_url": "https://modelvram.com/llm-vram-calculator/gpt-oss-120b/",
      "source_checked": "2026-09-26",
      "total_params": 116829156672,
      "active_params": 5100000000,
      "experts": 128,
      "layers": 36,
      "max_context": 131072,
      "kv_bytes_per_token_fp16": 36864,
      "attention_layout": "18 of its 36 layers use full attention and 18 keep a sliding window of 128 tokens",
      "q4_k_m_weights_gib": 65.83,
      "q8_0_weights_gib": 115.61,
      "fp16_weights_gib": 217.61,
      "q4_k_m_8k_total_gib": 73.25,
      "q4_k_m_32k_total_gib": 74.18,
      "q4_k_m_128k_total_gib": 77.89,
      "q8_0_8k_total_gib": 128,
      "q8_0_32k_total_gib": 128.93,
      "q8_0_128k_total_gib": 132.65,
      "fp16_8k_total_gib": 240.21,
      "fp16_32k_total_gib": 241.14,
      "fp16_128k_total_gib": 244.85,
      "kv_cache_8k_gib": 0.31,
      "kv_cache_32k_gib": 1.15,
      "kv_cache_128k_gib": 4.53,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": true,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    },
    {
      "model": "DeepSeek V3 / R1 (671B)",
      "hf_id": "deepseek-ai/DeepSeek-V3",
      "hf_url": "https://huggingface.co/deepseek-ai/DeepSeek-V3",
      "model_url": "https://modelvram.com/llm-vram-calculator/deepseek-v3/",
      "source_checked": "2026-09-26",
      "total_params": 684531386000,
      "active_params": 37000000000,
      "experts": 256,
      "layers": 61,
      "max_context": 163840,
      "kv_bytes_per_token_fp16": 70272,
      "attention_layout": "All 61 layers use multi-head latent attention",
      "q4_k_m_weights_gib": 385.7,
      "q8_0_weights_gib": 677.36,
      "fp16_weights_gib": 1275.04,
      "q4_k_m_8k_total_gib": 425.36,
      "q4_k_m_32k_total_gib": 427.13,
      "q4_k_m_128k_total_gib": 434.21,
      "q8_0_8k_total_gib": 746.19,
      "q8_0_32k_total_gib": 747.96,
      "q8_0_128k_total_gib": 755.04,
      "fp16_8k_total_gib": 1403.63,
      "fp16_32k_total_gib": 1405.4,
      "fp16_128k_total_gib": 1412.48,
      "kv_cache_8k_gib": 0.54,
      "kv_cache_32k_gib": 2.14,
      "kv_cache_128k_gib": 8.58,
      "q4_k_m_32k_fits_16gib": false,
      "q4_k_m_32k_fits_24gib": false,
      "q4_k_m_32k_fits_32gib": false,
      "q4_k_m_32k_fits_48gib": false,
      "q4_k_m_32k_fits_80gib": false,
      "q8_0_32k_fits_16gib": false,
      "q8_0_32k_fits_24gib": false,
      "q8_0_32k_fits_32gib": false,
      "q8_0_32k_fits_48gib": false,
      "q8_0_32k_fits_80gib": false,
      "fp16_32k_fits_16gib": false,
      "fp16_32k_fits_24gib": false,
      "fp16_32k_fits_32gib": false,
      "fp16_32k_fits_48gib": false,
      "fp16_32k_fits_80gib": false,
      "note": ""
    }
  ]
}
