96 GB 显存最佳本地大模型

单张 96 GB 显卡、Q4_K_M、32K 上下文下,最大的稠密模型是 Mistral Medium 3.5 128B(127.7B,91.8 GB,在一张 RTX PRO 6000 Blackwell 上约 11–15 token/s);最大的 MoE 是 Qwen3.5 122B-A10B(总参数 125.1B、激活 10.0B,78.8 GB,约 70–123 token/s);占用 48 GB 以上的模型中,上下文最长的是 Qwen3.5 122B-A10B(完整 256K 上下文占 84.6 GB);Q8_0 下最大的是 AliceAI Foundation 80B-A3B(MoE,总参数 81.3B、激活 3.0B,89.8 GB)。

更新于 (本页所列模型中最近一次数据核对的日期),共 61 个模型。按显存和参数量排序,不是质量排名。总显存 = 权重 + FP16 KV 缓存(单个请求)+ 0.5 GB + 10% 开销;GB = GiB。显卡上至少还剩 0.5 GB 才算能放进,与 Can I run it? 页面(英文)一致。速度是在一张 RTX PRO 6000 Blackwell(1792 GB/s)上、32K 上下文已填满时的带宽估算,不是实测。不确定显存大小?让浏览器识别你的 GPU。

gpt-oss-120b、gpt-oss-20b 按发布格式 MXFP4 列在 Q4_K_M 表中,不列入 Q8_0 表:它们的 GGUF 量化版本同样以 MXFP4 保存专家权重,各类型大小相近。

96 GB 显存的首选模型

类别 模型 总参数 激活参数 显存 token/s(RTX PRO 6000 Blackwell)
最大稠密模型(Q4_K_M) Mistral Medium 3.5 128B 127.7B 稠密 91.8 GB 11–15
最大 MoE(Q4_K_M) Qwen3.5 122B-A10B (MoE) 125.1B 10.0B 78.8 GB 70–123
48 GB 以上模型中最长上下文(Q4_K_M) Qwen3.5 122B-A10B (MoE) 125.1B 10.0B 256K(完整),84.6 GB 70–123
Q8_0 下最大 AliceAI Foundation 80B-A3B (MoE) 81.3B 3.0B 89.8 GB 112–202

96 GB 显存最好的本地大模型是什么?

按规模算,单张 96 GB 显卡在 Q4_K_M、32K 上下文下能放下的最大模型是 Mistral Medium 3.5 128B(127.7B,91.8 GB,剩余 4.3 GB);我们收录的 61 个模型中有 42 个能放进。本页按显存和参数量排序,不含跑分,我们的数据也不包含质量评测。

96 GB 显存能跑 70B 模型吗?

可以:Llama 3.1 70B(70.6B)在 Q4_K_M、32K 上下文下需要 55.2 GB,单张 96 GB 显卡还剩 40.8 GB;最高可用 Q8_0(88.3 GB)。总参数 65B 以上的 MoE 模型中,Qwen3.5 122B-A10B(78.8 GB)、Nemotron 3 Super 120B-A12B(77.4 GB)、gpt-oss-120b(MXFP4,68.6 GB)能以 Q4_K_M、32K 上下文放进。

逐步计算见 Llama 3.1 70B 显存页(英文)。

96 GB 显存上,Q8_0 和更大的模型哪个更好?

单张 96 GB 显卡、32K 上下文下,Q8_0 能放下的最大模型是 AliceAI Foundation 80B-A3B(MoE,总参数 81.3B、激活 3.0B,89.8 GB,约 112–202 token/s),Q4_K_M 则是 Mistral Medium 3.5 128B(127.7B,91.8 GB,约 11–15 token/s),总参数是前者的 1.6 倍。Q8_0 每个权重约 8.5 位,Q4_K_M 约 4.84 位;我们的数据只覆盖显存和速度,不评测输出质量,所以这里不给两者打分。

各 GGUF 类型的位数与取舍见 GGUF 量化类型详解(英文)。

能放进 96 GB 的最新模型

按模型数据加入或核对的日期排序,最新在前(Q4_K_M、32K 上下文)。新加入的模型会自动出现在这里。

模型 加入/核对 总参数 激活参数 显存 (GB) token/s
Qwen3-Coder 30B-A3B (MoE) 30.5B 3.3B 22.72 89–158
Ornith 1.0 35B (MoE) 35.1B 3.0B 22.95 163–305
Ornith 1.0 9B 9.4B 稠密 7.43 120–181
Granite 4.2 30B 29.3B 稠密 27.45 35–50
Granite 4.2 8B 8.8B 稠密 11.45 81–118
Granite 4.2 3B 3.7B 稠密 5.52 155–241
Spark-X2.5 4B 4.1B 稠密 4.40 186–300
Ling 3.0 Tiny 7.9B-A1.3B (MoE) 7.9B 1.3B 5.62 295–613

Q4_K_M 下能放进 96 GB 的全部 42 个模型

模型 总参数 激活参数 显存 (GB) 剩余 (GB) token/s 计算器
Mistral Medium 3.5 128B 127.7B 稠密 91.75 4.25 11–15 打开
Qwen3.5 122B-A10B (MoE) 125.1B 10.0B 78.85 17.15 70–123 打开
Nemotron 3 Super 120B-A12B (MoE) 123.6B 12.0B 77.39 18.61 65–112 打开
gpt-oss-120b MXFP4 116.8B 5.1B 68.61 27.39 110–198 打开
AliceAI Foundation 80B-A3B (MoE) 81.3B 3.0B 51.71 44.29 157–292 打开
Qwen3-Coder-Next (80B MoE) 79.7B 3.0B 50.71 45.29 157–292 打开
Llama 3.1 70B 70.6B 稠密 55.23 40.77 18–25 打开
K2-Horizon MoVA 36B-A4B (MoE) 37.4B 4.0B 30.31 65.69 56–96 打开
Ornith 1.5 35B-A3B (MoE) 36.0B 3.0B 23.47 72.53 163–305 打开
Qwen3.6 35B-A3B (MoE) 36.0B 3.0B 23.47 72.53 163–305 打开
Ornith 1.0 35B (MoE) 35.1B 3.0B 22.95 73.05 163–305 打开
LLM-jp-4.1 32B-A3B Thinking (MoE) 32.1B 3.8B 22.62 73.38 102–182 打开
Nemotron 3 Nano 30B-A3B (MoE) 31.6B 3.5B 20.28 75.72 172–324 打开
Gemma 4 31B 31.3B 稠密 23.92 72.08 40–57 打开
GLM-4.7 Flash 31.2B 3.0B 21.67 74.33 122–222 打开
Xing 4.0 29B-A4B (MoE) 31.2B 4.0B 21.39 74.61 114–205 打开
Qwen3 30B-A3B (MoE) 30.5B 3.3B 22.72 73.28 89–158 打开
Qwen3-Coder 30B-A3B (MoE) 30.5B 3.3B 22.72 73.28 89–158 打开
Muse Glimmer 30B 29.8B 稠密 19.51 76.49 49–70 打开
Granite 4.2 30B 29.3B 稠密 27.45 68.55 35–50 打开
Qwen3.6 27B 27.8B 稠密 19.92 76.08 48–68 打开
Qwen3.8 27B 27.8B 稠密 19.92 76.08 48–68 打开
Hemmingway-1 27B 27.3B 稠密 19.63 76.37 49–69 打开
Gemma 4 26B-A4B (MoE) 25.8B 4.0B 17.50 78.50 128–233 打开
gpt-oss-20b MXFP4 20.9B 3.6B 15.44 80.56 134–246 打开
Gemma 4 12B 12.0B 稠密 8.98 87.02 101–150 打开
ZDTaichu 5.0 9B 9.8B 稠密 7.67 88.33 116–175 打开
Ornith 1.5 9B 9.7B 稠密 7.58 88.42 117–177 打开
Qwen3.5 9B 9.7B 稠密 7.58 88.42 117–177 打开
MiMo V2.6 Distill Qwen 9B 9.4B 稠密 7.43 88.57 120–181 打开
Ornith 1.0 9B 9.4B 稠密 7.43 88.57 120–181 打开
Granite 4.2 8B 8.8B 稠密 11.45 84.55 81–118 打开
LFM2.5 8B-A1B (MoE) 8.5B 1.5B 6.16 89.84 254–510 打开
Qwen3 8B 8.2B 稠密 10.53 85.47 87–128 打开
Llama 3.1 8B 8.0B 稠密 9.88 86.12 93–137 打开
Gemma 4 E4B 8.0B 稠密 6.05 89.95 143–221 打开
Ling 3.0 Tiny 7.9B-A1.3B (MoE) 7.9B 1.3B 5.62 90.38 295–613 打开
Spark-X2.5 4B 4.1B 稠密 4.40 91.60 186–300 打开
Nemotron 3 Nano 4B 4.0B 稠密 3.51 92.49 223–372 打开
Granite 4.2 3B 3.7B 稠密 5.52 90.48 155–241 打开
MiniCPM5 2B 2.5B 稠密 3.50 92.50 223–373 打开
Limite 1B Violetto 1.0B 稠密 1.62 94.38 383–761 打开

Q8_0 下能放进 96 GB 的全部 37 个模型

模型 总参数 激活参数 显存 (GB) 剩余 (GB) token/s 计算器
AliceAI Foundation 80B-A3B (MoE) 81.3B 3.0B 89.80 6.20 112–202 打开
Qwen3-Coder-Next (80B MoE) 79.7B 3.0B 88.05 7.95 112–202 打开
Llama 3.1 70B 70.6B 稠密 88.30 7.70 11–16 打开
K2-Horizon MoVA 36B-A4B (MoE) 37.4B 4.0B 47.86 48.14 47–80 打开
Ornith 1.5 35B-A3B (MoE) 36.0B 3.0B 40.32 55.68 115–208 打开
Qwen3.6 35B-A3B (MoE) 36.0B 3.0B 40.32 55.68 115–208 打开
Ornith 1.0 35B (MoE) 35.1B 3.0B 39.40 56.60 115–208 打开
LLM-jp-4.1 32B-A3B Thinking (MoE) 32.1B 3.8B 37.68 58.32 77–134 打开
Nemotron 3 Nano 30B-A3B (MoE) 31.6B 3.5B 35.08 60.92 114–205 打开
Gemma 4 31B 31.3B 稠密 38.58 57.42 26–36 打开
GLM-4.7 Flash 31.2B 3.0B 36.30 59.70 93–166 打开
Xing 4.0 29B-A4B (MoE) 31.2B 4.0B 36.02 59.98 82–144 打开
Qwen3 30B-A3B (MoE) 30.5B 3.3B 37.03 58.97 71–125 打开
Qwen3-Coder 30B-A3B (MoE) 30.5B 3.3B 37.03 58.97 71–125 打开
Muse Glimmer 30B 29.8B 稠密 33.46 62.54 29–41 打开
Granite 4.2 30B 29.3B 稠密 41.17 54.83 24–33 打开
Qwen3.6 27B 27.8B 稠密 32.94 63.06 30–42 打开
Qwen3.8 27B 27.8B 稠密 32.94 63.06 30–42 打开
Hemmingway-1 27B 27.3B 稠密 32.44 63.56 30–42 打开
Gemma 4 26B-A4B (MoE) 25.8B 4.0B 29.60 66.40 89–158 打开
Gemma 4 12B 12.0B 稠密 14.58 81.42 65–93 打开
ZDTaichu 5.0 9B 9.8B 稠密 12.26 83.74 76–111 打开
Ornith 1.5 9B 9.7B 稠密 12.11 83.89 77–112 打开
Qwen3.5 9B 9.7B 稠密 12.11 83.89 77–112 打开
MiMo V2.6 Distill Qwen 9B 9.4B 稠密 11.84 84.16 79–114 打开
Ornith 1.0 9B 9.4B 稠密 11.84 84.16 79–114 打开
Granite 4.2 8B 8.8B 稠密 15.57 80.43 61–87 打开
LFM2.5 8B-A1B (MoE) 8.5B 1.5B 10.13 85.87 192–367 打开
Qwen3 8B 8.2B 稠密 14.37 81.63 66–95 打开
Llama 3.1 8B 8.0B 稠密 13.64 82.36 69–100 打开
Gemma 4 E4B 8.0B 稠密 9.80 86.20 93–138 打开
Ling 3.0 Tiny 7.9B-A1.3B (MoE) 7.9B 1.3B 9.32 86.68 223–436 打开
Spark-X2.5 4B 4.1B 稠密 6.33 89.67 137–211 打开
Nemotron 3 Nano 4B 4.0B 稠密 5.38 90.62 158–247 打开
Granite 4.2 3B 3.7B 稠密 7.23 88.77 122–186 打开
MiniCPM5 2B 2.5B 稠密 4.68 91.32 177–283 打开
Limite 1B Violetto 1.0B 稠密 2.11 93.89 323–600 打开

可用内存约 96 GB 的 Mac 与纯 CPU 电脑

这些机器留给模型的内存在 96 GB 到下一档之间:Mac 按 macOS 默认允许 GPU 使用的统一内存(32 GB 及以下约三分之二,更大约 75%,可用 sudo sysctl iogpu.wired_limit_mb 调高),纯 CPU 电脑按系统内存减去约 6 GB 系统占用。上面的列表同样适用,速度则取决于各自的带宽;纯 CPU 在处理长提示词时还会慢得多。

机器 可用内存 带宽 Q4_K_M 可放下(8K) 32K 下最大的模型 token/s
Ryzen AI Max+ 395 (128 GB) 96 GB 256 GB/s 42 Mistral Medium 3.5 128B 1.6–2.2
M3 Max Mac (128 GB) 96 GB 400 GB/s 42 Mistral Medium 3.5 128B 2.5–3.4
M4 Max Mac (128 GB) 96 GB 546 GB/s 42 Mistral Medium 3.5 128B 3.4–4.6
M5 Max Mac (128 GB) 96 GB 614 GB/s 42 Mistral Medium 3.5 128B 3.8–5.2
DGX Spark (128 GB) 120 GB 273 GB/s 43 Qwen3.8 Flash Next (180B MoE) 18–30
M3 Ultra Mac Studio (512 GB) 384 GB 819 GB/s 51 MiniMax M3 13–23
CPU only, DDR5-5600 dual channel (128 GB) 122 GB 89.6 GB/s 43 Qwen3.8 Flash Next (180B MoE) 6.0–11
CPU only, DDR4-3200 quad channel (128 GB) 122 GB 102.4 GB/s 43 Qwen3.8 Flash Next (180B MoE) 6.9–13
CPU only, DDR4-3200 quad channel (256 GB) 250 GB 102.4 GB/s 50 GLM-5.3 Flash 2.7–5.0

其他显存容量

所有数字(含 8K 与 128K 上下文)见开放数据集,汇总见大模型显存统计;任意设置可在显存计算器中重算。