按 GPU 查大模型显存:全部显卡、Mac 与纯 CPU 配置

共 73 种配置,每种都有独立页面(英文):24 款显卡和统一内存主机、7 组多卡配置、34 款 Mac 和 8 台纯 CPU 电脑。“Q4_K_M 装得下”统计本站 64 个模型中,有几个能以 Q4_K_M(gpt-oss 为 MXFP4)、8,192 token 上下文装下并留出 0.5 GB 余量;“最大可跑模型”是能装下的参数量最大的模型及其最佳精度。点开任一配置,可以看到每个模型的精度、最长上下文和生成速度。

目录: 显卡 (24)、多卡配置 (7)、Mac (34)、纯 CPU 电脑 (8)

显卡

配置 显存 带宽 Q4_K_M 装得下(共 64 个) 最大可跑模型
RTX 4060 8GB 8 GB 272 GB/s 18 Gemma 4 12B(GGUF Q3_K_M)
RTX 3060 12GB 12 GB 360 GB/s 19 Gemma 4 12B(GGUF Q6_K)
Arc B580 12GB 12 GB 456 GB/s 19 Gemma 4 12B(GGUF Q6_K)
RTX 4070 12GB 12 GB 504 GB/s 19 Gemma 4 12B(GGUF Q6_K)
RTX 5070 12GB 12 GB 672 GB/s 19 Gemma 4 12B(GGUF Q6_K)
RTX 4060 Ti 16GB 16 GB 288 GB/s 20 LLM-jp-4.1 32B-A3B Thinking(GGUF Q2_K)
RTX 5060 Ti 16GB 16 GB 448 GB/s 20 LLM-jp-4.1 32B-A3B Thinking(GGUF Q2_K)
RX 9070 XT 16GB 16 GB 644 GB/s 20 LLM-jp-4.1 32B-A3B Thinking(GGUF Q2_K)
RTX 4070 Ti Super 16GB 16 GB 672 GB/s 20 LLM-jp-4.1 32B-A3B Thinking(GGUF Q2_K)
RTX 4080 Super 16GB 16 GB 736 GB/s 20 LLM-jp-4.1 32B-A3B Thinking(GGUF Q2_K)
RTX 5070 Ti 16GB 16 GB 896 GB/s 20 LLM-jp-4.1 32B-A3B Thinking(GGUF Q2_K)
RTX 5080 16GB 16 GB 960 GB/s 20 LLM-jp-4.1 32B-A3B Thinking(GGUF Q2_K)
RTX 3090 24 GB 936 GB/s 37 K2-Horizon MoVA 36B-A4B(GGUF Q3_K_M)
RX 7900 XTX 24 GB 960 GB/s 37 K2-Horizon MoVA 36B-A4B(GGUF Q3_K_M)
RTX 4090 24 GB 1,008 GB/s 37 K2-Horizon MoVA 36B-A4B(GGUF Q3_K_M)
RTX 5090 32 GB 1,792 GB/s 38 K2-Horizon MoVA 36B-A4B(GGUF Q5_K_M)
L40S 48 GB 864 GB/s 39 AliceAI Foundation 80B-A3B(GGUF Q3_K_M)
A100 80GB 80 GB 2,039 GB/s 44 Qwen3.8 Flash Next(GGUF Q2_K)
H100 SXM 80 GB 3,350 GB/s 44 Qwen3.8 Flash Next(GGUF Q2_K)
Ryzen AI Max+ 395 (128 GB) 96 GB 可用 256 GB/s 45 Step 3.7 Flash 196B-A11B(GGUF Q2_K)
RTX PRO 6000 Blackwell 96 GB 1,792 GB/s 45 Step 3.7 Flash 196B-A11B(GGUF Q2_K)
DGX Spark (128 GB) 120 GB 可用 273 GB/s 46 MiniMax M2.7(GGUF Q3_K_M)
H200 141 GB 4,800 GB/s 47 GLM-5.3 Flash(GGUF Q2_K)
B200 180 GB 8,000 GB/s 48 GLM-5.3 Flash(GGUF Q3_K_M)

多卡配置

配置 显存 带宽 Q4_K_M 装得下(共 64 个) 最大可跑模型
2× RTX 3060 12GB 24 GB 720 GB/s 37 K2-Horizon MoVA 36B-A4B(GGUF Q3_K_M)
2× RTX 3090 48 GB 1,872 GB/s 39 AliceAI Foundation 80B-A3B(GGUF Q3_K_M)
2× RTX 4090 48 GB 2,016 GB/s 39 AliceAI Foundation 80B-A3B(GGUF Q3_K_M)
2× RTX 5090 64 GB 3,584 GB/s 41 Mistral Medium 3.5 128B(GGUF Q2_K)
4× RTX 3090 96 GB 3,744 GB/s 45 Step 3.7 Flash 196B-A11B(GGUF Q2_K)
8× H100 SXM 640 GB 26,800 GB/s 61 MiMo V2.6 Pro(GGUF Q4_K_M)
8× H200 1,128 GB 38,400 GB/s 62 Qwen3.8 2.4T-A95B(GGUF Q2_K)

Mac

配置 显存 带宽 Q4_K_M 装得下(共 64 个) 最大可跑模型
M1 Mac (8 GB) 5.3 GB 可用 68.25 GB/s 5 LensVLM 9B(GGUF IQ3_XXS)
M2 or M3 Mac (8 GB) 5.3 GB 可用 100 GB/s 5 LensVLM 9B(GGUF IQ3_XXS)
M1 Mac (16 GB) 10.7 GB 可用 68.25 GB/s 19 Gemma 4 12B(GGUF Q5_K_M)
M2 or M3 Mac (16 GB) 10.7 GB 可用 100 GB/s 19 Gemma 4 12B(GGUF Q5_K_M)
M4 Mac (16 GB) 10.7 GB 可用 120 GB/s 19 Gemma 4 12B(GGUF Q5_K_M)
M5 Mac (16 GB) 10.7 GB 可用 153 GB/s 19 Gemma 4 12B(GGUF Q5_K_M)
M1 Pro or M2 Pro Mac (16 GB) 10.7 GB 可用 200 GB/s 19 Gemma 4 12B(GGUF Q5_K_M)
M3 Pro Mac (18 GB) 12 GB 可用 150 GB/s 19 Gemma 4 12B(GGUF Q6_K)
M2 or M3 Mac (24 GB) 16 GB 可用 100 GB/s 20 LLM-jp-4.1 32B-A3B Thinking(GGUF Q2_K)
M4 Mac (24 GB) 16 GB 可用 120 GB/s 20 LLM-jp-4.1 32B-A3B Thinking(GGUF Q2_K)
M5 Mac (24 GB) 16 GB 可用 153 GB/s 20 LLM-jp-4.1 32B-A3B Thinking(GGUF Q2_K)
M4 Pro Mac (24 GB) 16 GB 可用 273 GB/s 20 LLM-jp-4.1 32B-A3B Thinking(GGUF Q2_K)
M5 Pro Mac (24 GB) 16 GB 可用 307 GB/s 20 LLM-jp-4.1 32B-A3B Thinking(GGUF Q2_K)
M4 Mac (32 GB) 21.3 GB 可用 120 GB/s 31 K2-Horizon MoVA 36B-A4B(GGUF Q2_K)
M5 Mac (32 GB) 21.3 GB 可用 153 GB/s 31 K2-Horizon MoVA 36B-A4B(GGUF Q2_K)
M1 Pro or M2 Pro Mac (32 GB) 21.3 GB 可用 200 GB/s 31 K2-Horizon MoVA 36B-A4B(GGUF Q2_K)
M1 Max or M2 Max Mac (32 GB) 21.3 GB 可用 400 GB/s 31 K2-Horizon MoVA 36B-A4B(GGUF Q2_K)
M3 Pro Mac (36 GB) 27 GB 可用 150 GB/s 38 K2-Horizon MoVA 36B-A4B(GGUF Q4_K_M)
M3 Max Mac (36 GB) 27 GB 可用 300 GB/s 38 K2-Horizon MoVA 36B-A4B(GGUF Q4_K_M)
M4 Max Mac (36 GB) 27 GB 可用 410 GB/s 38 K2-Horizon MoVA 36B-A4B(GGUF Q4_K_M)
M5 Max Mac (36 GB) 27 GB 可用 460 GB/s 38 K2-Horizon MoVA 36B-A4B(GGUF Q4_K_M)
M4 Pro Mac (48 GB) 36 GB 可用 273 GB/s 38 AliceAI Foundation 80B-A3B(GGUF IQ3_XXS)
M5 Pro Mac (48 GB) 36 GB 可用 307 GB/s 38 AliceAI Foundation 80B-A3B(GGUF IQ3_XXS)
M4 Max Mac (48 GB) 36 GB 可用 546 GB/s 38 AliceAI Foundation 80B-A3B(GGUF IQ3_XXS)
M5 Max Mac (48 GB) 36 GB 可用 614 GB/s 38 AliceAI Foundation 80B-A3B(GGUF IQ3_XXS)
M4 Pro Mac (64 GB) 48 GB 可用 273 GB/s 39 AliceAI Foundation 80B-A3B(GGUF Q3_K_M)
M5 Pro Mac (64 GB) 48 GB 可用 307 GB/s 39 AliceAI Foundation 80B-A3B(GGUF Q3_K_M)
M1–M3 Max Mac (64 GB) 48 GB 可用 400 GB/s 39 AliceAI Foundation 80B-A3B(GGUF Q3_K_M)
M4 Max Mac (64 GB) 48 GB 可用 546 GB/s 39 AliceAI Foundation 80B-A3B(GGUF Q3_K_M)
M5 Max Mac (64 GB) 48 GB 可用 614 GB/s 39 AliceAI Foundation 80B-A3B(GGUF Q3_K_M)
M3 Max Mac (128 GB) 96 GB 可用 400 GB/s 45 Step 3.7 Flash 196B-A11B(GGUF Q2_K)
M4 Max Mac (128 GB) 96 GB 可用 546 GB/s 45 Step 3.7 Flash 196B-A11B(GGUF Q2_K)
M5 Max Mac (128 GB) 96 GB 可用 614 GB/s 45 Step 3.7 Flash 196B-A11B(GGUF Q2_K)
M3 Ultra Mac Studio (512 GB) 384 GB 可用 819 GB/s 54 Hy4 Preview 770B-A49B(GGUF Q2_K)

纯 CPU 电脑

配置 显存 带宽 Q4_K_M 装得下(共 64 个) 最大可跑模型
CPU only, DDR4-3200 dual channel (16 GB) 10 GB 可用 51.2 GB/s 19 Gemma 4 12B(GGUF Q4_K_M)
CPU only, DDR4-3200 dual channel (32 GB) 26 GB 可用 51.2 GB/s 38 K2-Horizon MoVA 36B-A4B(GGUF Q4_K_M)
CPU only, DDR5-5600 dual channel (32 GB) 26 GB 可用 89.6 GB/s 38 K2-Horizon MoVA 36B-A4B(GGUF Q4_K_M)
CPU only, DDR4-3200 dual channel (64 GB) 58 GB 可用 51.2 GB/s 41 Mistral Medium 3.5 128B(GGUF IQ3_XXS)
CPU only, DDR5-5600 dual channel (64 GB) 58 GB 可用 89.6 GB/s 41 Mistral Medium 3.5 128B(GGUF IQ3_XXS)
CPU only, DDR5-5600 dual channel (128 GB) 122 GB 可用 89.6 GB/s 46 MiniMax M2.7(GGUF Q3_K_M)
CPU only, DDR4-3200 quad channel (128 GB) 122 GB 可用 102.4 GB/s 46 MiniMax M2.7(GGUF Q3_K_M)
CPU only, DDR4-3200 quad channel (256 GB) 250 GB 可用 102.4 GB/s 53 MiniMax M3(GGUF Q3_K_M)

想算其他模型或其他设置?用LLM 显存计算器;想从本机出发,试试识别 GPU,看看电脑能跑什么。