96 GB 显存最佳本地大模型
单张 96 GB 显卡、Q4_K_M、32K 上下文下,最大的稠密模型是 Mistral Medium 3.5 128B(127.7B,91.8 GB,在一张 RTX PRO 6000 Blackwell 上约 11–15 token/s);最大的 MoE 是 Qwen3.5 122B-A10B(总参数 125.1B、激活 10.0B,78.8 GB,约 70–123 token/s);占用 48 GB 以上的模型中,上下文最长的是 Qwen3.5 122B-A10B(完整 256K 上下文占 84.6 GB);Q8_0 下最大的是 AliceAI Foundation 80B-A3B(MoE,总参数 81.3B、激活 3.0B,89.8 GB)。
更新于 (本页所列模型中最近一次数据核对的日期),共 61 个模型。按显存和参数量排序,不是质量排名。总显存 = 权重 + FP16 KV 缓存(单个请求)+ 0.5 GB + 10% 开销;GB = GiB。显卡上至少还剩 0.5 GB 才算能放进,与 Can I run it? 页面(英文)一致。速度是在一张 RTX PRO 6000 Blackwell(1792 GB/s)上、32K 上下文已填满时的带宽估算,不是实测。不确定显存大小?让浏览器识别你的 GPU。
gpt-oss-120b、gpt-oss-20b 按发布格式 MXFP4 列在 Q4_K_M 表中,不列入 Q8_0 表:它们的 GGUF 量化版本同样以 MXFP4 保存专家权重,各类型大小相近。
96 GB 显存的首选模型
| 类别 | 模型 | 总参数 | 激活参数 | 显存 | token/s(RTX PRO 6000 Blackwell) |
|---|---|---|---|---|---|
| 最大稠密模型(Q4_K_M) | Mistral Medium 3.5 128B | 127.7B | 稠密 | 91.8 GB | 11–15 |
| 最大 MoE(Q4_K_M) | Qwen3.5 122B-A10B (MoE) | 125.1B | 10.0B | 78.8 GB | 70–123 |
| 48 GB 以上模型中最长上下文(Q4_K_M) | Qwen3.5 122B-A10B (MoE) | 125.1B | 10.0B | 256K(完整),84.6 GB | 70–123 |
| Q8_0 下最大 | AliceAI Foundation 80B-A3B (MoE) | 81.3B | 3.0B | 89.8 GB | 112–202 |
96 GB 显存最好的本地大模型是什么?
按规模算,单张 96 GB 显卡在 Q4_K_M、32K 上下文下能放下的最大模型是 Mistral Medium 3.5 128B(127.7B,91.8 GB,剩余 4.3 GB);我们收录的 61 个模型中有 42 个能放进。本页按显存和参数量排序,不含跑分,我们的数据也不包含质量评测。
96 GB 显存能跑 70B 模型吗?
可以:Llama 3.1 70B(70.6B)在 Q4_K_M、32K 上下文下需要 55.2 GB,单张 96 GB 显卡还剩 40.8 GB;最高可用 Q8_0(88.3 GB)。总参数 65B 以上的 MoE 模型中,Qwen3.5 122B-A10B(78.8 GB)、Nemotron 3 Super 120B-A12B(77.4 GB)、gpt-oss-120b(MXFP4,68.6 GB)能以 Q4_K_M、32K 上下文放进。
逐步计算见 Llama 3.1 70B 显存页(英文)。
96 GB 显存上,Q8_0 和更大的模型哪个更好?
单张 96 GB 显卡、32K 上下文下,Q8_0 能放下的最大模型是 AliceAI Foundation 80B-A3B(MoE,总参数 81.3B、激活 3.0B,89.8 GB,约 112–202 token/s),Q4_K_M 则是 Mistral Medium 3.5 128B(127.7B,91.8 GB,约 11–15 token/s),总参数是前者的 1.6 倍。Q8_0 每个权重约 8.5 位,Q4_K_M 约 4.84 位;我们的数据只覆盖显存和速度,不评测输出质量,所以这里不给两者打分。
各 GGUF 类型的位数与取舍见 GGUF 量化类型详解(英文)。
能放进 96 GB 的最新模型
按模型数据加入或核对的日期排序,最新在前(Q4_K_M、32K 上下文)。新加入的模型会自动出现在这里。
| 模型 | 加入/核对 | 总参数 | 激活参数 | 显存 (GB) | token/s |
|---|---|---|---|---|---|
| Qwen3-Coder 30B-A3B (MoE) | 30.5B | 3.3B | 22.72 | 89–158 | |
| Ornith 1.0 35B (MoE) | 35.1B | 3.0B | 22.95 | 163–305 | |
| Ornith 1.0 9B | 9.4B | 稠密 | 7.43 | 120–181 | |
| Granite 4.2 30B | 29.3B | 稠密 | 27.45 | 35–50 | |
| Granite 4.2 8B | 8.8B | 稠密 | 11.45 | 81–118 | |
| Granite 4.2 3B | 3.7B | 稠密 | 5.52 | 155–241 | |
| Spark-X2.5 4B | 4.1B | 稠密 | 4.40 | 186–300 | |
| Ling 3.0 Tiny 7.9B-A1.3B (MoE) | 7.9B | 1.3B | 5.62 | 295–613 |
Q4_K_M 下能放进 96 GB 的全部 42 个模型
| 模型 | 总参数 | 激活参数 | 显存 (GB) | 剩余 (GB) | token/s | 计算器 |
|---|---|---|---|---|---|---|
| Mistral Medium 3.5 128B | 127.7B | 稠密 | 91.75 | 4.25 | 11–15 | 打开 |
| Qwen3.5 122B-A10B (MoE) | 125.1B | 10.0B | 78.85 | 17.15 | 70–123 | 打开 |
| Nemotron 3 Super 120B-A12B (MoE) | 123.6B | 12.0B | 77.39 | 18.61 | 65–112 | 打开 |
| gpt-oss-120b MXFP4 | 116.8B | 5.1B | 68.61 | 27.39 | 110–198 | 打开 |
| AliceAI Foundation 80B-A3B (MoE) | 81.3B | 3.0B | 51.71 | 44.29 | 157–292 | 打开 |
| Qwen3-Coder-Next (80B MoE) | 79.7B | 3.0B | 50.71 | 45.29 | 157–292 | 打开 |
| Llama 3.1 70B | 70.6B | 稠密 | 55.23 | 40.77 | 18–25 | 打开 |
| K2-Horizon MoVA 36B-A4B (MoE) | 37.4B | 4.0B | 30.31 | 65.69 | 56–96 | 打开 |
| Ornith 1.5 35B-A3B (MoE) | 36.0B | 3.0B | 23.47 | 72.53 | 163–305 | 打开 |
| Qwen3.6 35B-A3B (MoE) | 36.0B | 3.0B | 23.47 | 72.53 | 163–305 | 打开 |
| Ornith 1.0 35B (MoE) | 35.1B | 3.0B | 22.95 | 73.05 | 163–305 | 打开 |
| LLM-jp-4.1 32B-A3B Thinking (MoE) | 32.1B | 3.8B | 22.62 | 73.38 | 102–182 | 打开 |
| Nemotron 3 Nano 30B-A3B (MoE) | 31.6B | 3.5B | 20.28 | 75.72 | 172–324 | 打开 |
| Gemma 4 31B | 31.3B | 稠密 | 23.92 | 72.08 | 40–57 | 打开 |
| GLM-4.7 Flash | 31.2B | 3.0B | 21.67 | 74.33 | 122–222 | 打开 |
| Xing 4.0 29B-A4B (MoE) | 31.2B | 4.0B | 21.39 | 74.61 | 114–205 | 打开 |
| Qwen3 30B-A3B (MoE) | 30.5B | 3.3B | 22.72 | 73.28 | 89–158 | 打开 |
| Qwen3-Coder 30B-A3B (MoE) | 30.5B | 3.3B | 22.72 | 73.28 | 89–158 | 打开 |
| Muse Glimmer 30B | 29.8B | 稠密 | 19.51 | 76.49 | 49–70 | 打开 |
| Granite 4.2 30B | 29.3B | 稠密 | 27.45 | 68.55 | 35–50 | 打开 |
| Qwen3.6 27B | 27.8B | 稠密 | 19.92 | 76.08 | 48–68 | 打开 |
| Qwen3.8 27B | 27.8B | 稠密 | 19.92 | 76.08 | 48–68 | 打开 |
| Hemmingway-1 27B | 27.3B | 稠密 | 19.63 | 76.37 | 49–69 | 打开 |
| Gemma 4 26B-A4B (MoE) | 25.8B | 4.0B | 17.50 | 78.50 | 128–233 | 打开 |
| gpt-oss-20b MXFP4 | 20.9B | 3.6B | 15.44 | 80.56 | 134–246 | 打开 |
| Gemma 4 12B | 12.0B | 稠密 | 8.98 | 87.02 | 101–150 | 打开 |
| ZDTaichu 5.0 9B | 9.8B | 稠密 | 7.67 | 88.33 | 116–175 | 打开 |
| Ornith 1.5 9B | 9.7B | 稠密 | 7.58 | 88.42 | 117–177 | 打开 |
| Qwen3.5 9B | 9.7B | 稠密 | 7.58 | 88.42 | 117–177 | 打开 |
| MiMo V2.6 Distill Qwen 9B | 9.4B | 稠密 | 7.43 | 88.57 | 120–181 | 打开 |
| Ornith 1.0 9B | 9.4B | 稠密 | 7.43 | 88.57 | 120–181 | 打开 |
| Granite 4.2 8B | 8.8B | 稠密 | 11.45 | 84.55 | 81–118 | 打开 |
| LFM2.5 8B-A1B (MoE) | 8.5B | 1.5B | 6.16 | 89.84 | 254–510 | 打开 |
| Qwen3 8B | 8.2B | 稠密 | 10.53 | 85.47 | 87–128 | 打开 |
| Llama 3.1 8B | 8.0B | 稠密 | 9.88 | 86.12 | 93–137 | 打开 |
| Gemma 4 E4B | 8.0B | 稠密 | 6.05 | 89.95 | 143–221 | 打开 |
| Ling 3.0 Tiny 7.9B-A1.3B (MoE) | 7.9B | 1.3B | 5.62 | 90.38 | 295–613 | 打开 |
| Spark-X2.5 4B | 4.1B | 稠密 | 4.40 | 91.60 | 186–300 | 打开 |
| Nemotron 3 Nano 4B | 4.0B | 稠密 | 3.51 | 92.49 | 223–372 | 打开 |
| Granite 4.2 3B | 3.7B | 稠密 | 5.52 | 90.48 | 155–241 | 打开 |
| MiniCPM5 2B | 2.5B | 稠密 | 3.50 | 92.50 | 223–373 | 打开 |
| Limite 1B Violetto | 1.0B | 稠密 | 1.62 | 94.38 | 383–761 | 打开 |
Q8_0 下能放进 96 GB 的全部 37 个模型
| 模型 | 总参数 | 激活参数 | 显存 (GB) | 剩余 (GB) | token/s | 计算器 |
|---|---|---|---|---|---|---|
| AliceAI Foundation 80B-A3B (MoE) | 81.3B | 3.0B | 89.80 | 6.20 | 112–202 | 打开 |
| Qwen3-Coder-Next (80B MoE) | 79.7B | 3.0B | 88.05 | 7.95 | 112–202 | 打开 |
| Llama 3.1 70B | 70.6B | 稠密 | 88.30 | 7.70 | 11–16 | 打开 |
| K2-Horizon MoVA 36B-A4B (MoE) | 37.4B | 4.0B | 47.86 | 48.14 | 47–80 | 打开 |
| Ornith 1.5 35B-A3B (MoE) | 36.0B | 3.0B | 40.32 | 55.68 | 115–208 | 打开 |
| Qwen3.6 35B-A3B (MoE) | 36.0B | 3.0B | 40.32 | 55.68 | 115–208 | 打开 |
| Ornith 1.0 35B (MoE) | 35.1B | 3.0B | 39.40 | 56.60 | 115–208 | 打开 |
| LLM-jp-4.1 32B-A3B Thinking (MoE) | 32.1B | 3.8B | 37.68 | 58.32 | 77–134 | 打开 |
| Nemotron 3 Nano 30B-A3B (MoE) | 31.6B | 3.5B | 35.08 | 60.92 | 114–205 | 打开 |
| Gemma 4 31B | 31.3B | 稠密 | 38.58 | 57.42 | 26–36 | 打开 |
| GLM-4.7 Flash | 31.2B | 3.0B | 36.30 | 59.70 | 93–166 | 打开 |
| Xing 4.0 29B-A4B (MoE) | 31.2B | 4.0B | 36.02 | 59.98 | 82–144 | 打开 |
| Qwen3 30B-A3B (MoE) | 30.5B | 3.3B | 37.03 | 58.97 | 71–125 | 打开 |
| Qwen3-Coder 30B-A3B (MoE) | 30.5B | 3.3B | 37.03 | 58.97 | 71–125 | 打开 |
| Muse Glimmer 30B | 29.8B | 稠密 | 33.46 | 62.54 | 29–41 | 打开 |
| Granite 4.2 30B | 29.3B | 稠密 | 41.17 | 54.83 | 24–33 | 打开 |
| Qwen3.6 27B | 27.8B | 稠密 | 32.94 | 63.06 | 30–42 | 打开 |
| Qwen3.8 27B | 27.8B | 稠密 | 32.94 | 63.06 | 30–42 | 打开 |
| Hemmingway-1 27B | 27.3B | 稠密 | 32.44 | 63.56 | 30–42 | 打开 |
| Gemma 4 26B-A4B (MoE) | 25.8B | 4.0B | 29.60 | 66.40 | 89–158 | 打开 |
| Gemma 4 12B | 12.0B | 稠密 | 14.58 | 81.42 | 65–93 | 打开 |
| ZDTaichu 5.0 9B | 9.8B | 稠密 | 12.26 | 83.74 | 76–111 | 打开 |
| Ornith 1.5 9B | 9.7B | 稠密 | 12.11 | 83.89 | 77–112 | 打开 |
| Qwen3.5 9B | 9.7B | 稠密 | 12.11 | 83.89 | 77–112 | 打开 |
| MiMo V2.6 Distill Qwen 9B | 9.4B | 稠密 | 11.84 | 84.16 | 79–114 | 打开 |
| Ornith 1.0 9B | 9.4B | 稠密 | 11.84 | 84.16 | 79–114 | 打开 |
| Granite 4.2 8B | 8.8B | 稠密 | 15.57 | 80.43 | 61–87 | 打开 |
| LFM2.5 8B-A1B (MoE) | 8.5B | 1.5B | 10.13 | 85.87 | 192–367 | 打开 |
| Qwen3 8B | 8.2B | 稠密 | 14.37 | 81.63 | 66–95 | 打开 |
| Llama 3.1 8B | 8.0B | 稠密 | 13.64 | 82.36 | 69–100 | 打开 |
| Gemma 4 E4B | 8.0B | 稠密 | 9.80 | 86.20 | 93–138 | 打开 |
| Ling 3.0 Tiny 7.9B-A1.3B (MoE) | 7.9B | 1.3B | 9.32 | 86.68 | 223–436 | 打开 |
| Spark-X2.5 4B | 4.1B | 稠密 | 6.33 | 89.67 | 137–211 | 打开 |
| Nemotron 3 Nano 4B | 4.0B | 稠密 | 5.38 | 90.62 | 158–247 | 打开 |
| Granite 4.2 3B | 3.7B | 稠密 | 7.23 | 88.77 | 122–186 | 打开 |
| MiniCPM5 2B | 2.5B | 稠密 | 4.68 | 91.32 | 177–283 | 打开 |
| Limite 1B Violetto | 1.0B | 稠密 | 2.11 | 93.89 | 323–600 | 打开 |
可用内存约 96 GB 的 Mac 与纯 CPU 电脑
这些机器留给模型的内存在 96 GB 到下一档之间:Mac 按 macOS 默认允许 GPU 使用的统一内存(32 GB 及以下约三分之二,更大约 75%,可用 sudo sysctl iogpu.wired_limit_mb 调高),纯 CPU 电脑按系统内存减去约 6 GB 系统占用。上面的列表同样适用,速度则取决于各自的带宽;纯 CPU 在处理长提示词时还会慢得多。
| 机器 | 可用内存 | 带宽 | Q4_K_M 可放下(8K) | 32K 下最大的模型 | token/s |
|---|---|---|---|---|---|
| Ryzen AI Max+ 395 (128 GB) | 96 GB | 256 GB/s | 42 | Mistral Medium 3.5 128B | 1.6–2.2 |
| M3 Max Mac (128 GB) | 96 GB | 400 GB/s | 42 | Mistral Medium 3.5 128B | 2.5–3.4 |
| M4 Max Mac (128 GB) | 96 GB | 546 GB/s | 42 | Mistral Medium 3.5 128B | 3.4–4.6 |
| M5 Max Mac (128 GB) | 96 GB | 614 GB/s | 42 | Mistral Medium 3.5 128B | 3.8–5.2 |
| DGX Spark (128 GB) | 120 GB | 273 GB/s | 43 | Qwen3.8 Flash Next (180B MoE) | 18–30 |
| M3 Ultra Mac Studio (512 GB) | 384 GB | 819 GB/s | 51 | MiniMax M3 | 13–23 |
| CPU only, DDR5-5600 dual channel (128 GB) | 122 GB | 89.6 GB/s | 43 | Qwen3.8 Flash Next (180B MoE) | 6.0–11 |
| CPU only, DDR4-3200 quad channel (128 GB) | 122 GB | 102.4 GB/s | 43 | Qwen3.8 Flash Next (180B MoE) | 6.9–13 |
| CPU only, DDR4-3200 quad channel (256 GB) | 250 GB | 102.4 GB/s | 50 | GLM-5.3 Flash | 2.7–5.0 |