8 GB 显存最佳本地大模型

单张 8 GB 显卡、Q4_K_M、32K 上下文下,最大的稠密模型是并列的 MiMo V2.6 Distill Qwen 9B 和 Ornith 1.0 9B(9.4B,7.4 GB,在一张 RTX 4060 8GB 上约 21–30 token/s);最大的 MoE 是 LFM2.5 8B-A1B(总参数 8.5B、激活 1.5B,6.2 GB,约 57–99 token/s);占用 4 GB 以上的模型中,上下文最长的是 Ling 3.0 Tiny 7.9B-A1.3B(完整 128K 上下文占 6.3 GB);Q8_0 下最大的是 Spark-X2.5 4B(4.1B,6.3 GB)。

更新于 (本页所列模型中最近一次数据核对的日期),共 61 个模型。按显存和参数量排序,不是质量排名。总显存 = 权重 + FP16 KV 缓存(单个请求)+ 0.5 GB + 10% 开销;GB = GiB。显卡上至少还剩 0.5 GB 才算能放进,与 Can I run it? 页面(英文)一致。速度是在一张 RTX 4060 8GB(272 GB/s)上、32K 上下文已填满时的带宽估算,不是实测。不确定显存大小?让浏览器识别你的 GPU。

8 GB 显存的首选模型

类别 模型 总参数 激活参数 显存 token/s(RTX 4060 8GB)
最大稠密模型(Q4_K_M) MiMo V2.6 Distill Qwen 9B 9.4B 稠密 7.4 GB,与 Ornith 1.0 9B 并列 21–30
最大 MoE(Q4_K_M) LFM2.5 8B-A1B (MoE) 8.5B 1.5B 6.2 GB 57–99
4 GB 以上模型中最长上下文(Q4_K_M) Ling 3.0 Tiny 7.9B-A1.3B (MoE) 7.9B 1.3B 128K(完整),6.3 GB 72–126
Q8_0 下最大 Spark-X2.5 4B 4.1B 稠密 6.3 GB 25–35

8 GB 显存最好的本地大模型是什么?

按规模算,单张 8 GB 显卡在 Q4_K_M、32K 上下文下能放下的最大模型是并列的 MiMo V2.6 Distill Qwen 9B 和 Ornith 1.0 9B(9.4B,7.4 GB,剩余 0.6 GB);我们收录的 61 个模型中有 10 个能放进。本页按显存和参数量排序,不含跑分,我们的数据也不包含质量评测。

8 GB 显存能跑 70B 模型吗?

单卡不行:Llama 3.1 70B(70.6B)在 Q4_K_M、32K 上下文下需要 55.2 GB,即使用 IQ3_XXS 也要 41.3 GB。

逐步计算见 Llama 3.1 70B 显存页(英文)。

8 GB 显存上,Q8_0 和更大的模型哪个更好?

单张 8 GB 显卡、32K 上下文下,Q8_0 能放下的最大模型是 Spark-X2.5 4B(4.1B,6.3 GB,约 25–35 token/s),Q4_K_M 则是并列的 MiMo V2.6 Distill Qwen 9B 和 Ornith 1.0 9B(9.4B,7.4 GB,约 21–30 token/s),总参数是前者的 2.3 倍。Q8_0 每个权重约 8.5 位,Q4_K_M 约 4.84 位;我们的数据只覆盖显存和速度,不评测输出质量,所以这里不给两者打分。

各 GGUF 类型的位数与取舍见 GGUF 量化类型详解(英文)。

能放进 8 GB 的最新模型

按模型数据加入或核对的日期排序,最新在前(Q4_K_M、32K 上下文)。新加入的模型会自动出现在这里。

模型 加入/核对 总参数 激活参数 显存 (GB) token/s
Ornith 1.0 9B 9.4B 稠密 7.43 21–30
Granite 4.2 3B 3.7B 稠密 5.52 29–41
Spark-X2.5 4B 4.1B 稠密 4.40 37–52
Ling 3.0 Tiny 7.9B-A1.3B (MoE) 7.9B 1.3B 5.62 72–126
LFM2.5 8B-A1B (MoE) 8.5B 1.5B 6.16 57–99
Limite 1B Violetto 1.0B 稠密 1.62 113–170
MiMo V2.6 Distill Qwen 9B 9.4B 稠密 7.43 21–30
Gemma 4 E4B 8.0B 稠密 6.05 27–37

Q4_K_M 下能放进 8 GB 的全部 10 个模型

模型 总参数 激活参数 显存 (GB) 剩余 (GB) token/s 计算器
MiMo V2.6 Distill Qwen 9B 9.4B 稠密 7.43 0.57 21–30 打开
Ornith 1.0 9B 9.4B 稠密 7.43 0.57 21–30 打开
LFM2.5 8B-A1B (MoE) 8.5B 1.5B 6.16 1.84 57–99 打开
Gemma 4 E4B 8.0B 稠密 6.05 1.95 27–37 打开
Ling 3.0 Tiny 7.9B-A1.3B (MoE) 7.9B 1.3B 5.62 2.38 72–126 打开
Spark-X2.5 4B 4.1B 稠密 4.40 3.60 37–52 打开
Nemotron 3 Nano 4B 4.0B 稠密 3.51 4.49 47–67 打开
Granite 4.2 3B 3.7B 稠密 5.52 2.48 29–41 打开
MiniCPM5 2B 2.5B 稠密 3.50 4.50 47–67 打开
Limite 1B Violetto 1.0B 稠密 1.62 6.38 113–170 打开

Q8_0 下能放进 8 GB 的全部 5 个模型

模型 总参数 激活参数 显存 (GB) 剩余 (GB) token/s 计算器
Spark-X2.5 4B 4.1B 稠密 6.33 1.67 25–35 打开
Nemotron 3 Nano 4B 4.0B 稠密 5.38 2.62 30–42 打开
Granite 4.2 3B 3.7B 稠密 7.23 0.77 22–31 打开
MiniCPM5 2B 2.5B 稠密 4.68 3.32 35–49 打开
Limite 1B Violetto 1.0B 稠密 2.11 5.89 83–122 打开

可用内存约 8 GB 的 Mac 与纯 CPU 电脑

这些机器留给模型的内存在 8 GB 到下一档之间:Mac 按 macOS 默认允许 GPU 使用的统一内存(32 GB 及以下约三分之二,更大约 75%,可用 sudo sysctl iogpu.wired_limit_mb 调高),纯 CPU 电脑按系统内存减去约 6 GB 系统占用。上面的列表同样适用,速度则取决于各自的带宽;纯 CPU 在处理长提示词时还会慢得多。

机器 可用内存 带宽 Q4_K_M 可放下(8K) 32K 下最大的模型 token/s
M1 Mac (16 GB) 10.7 GB 68.25 GB/s 17 Gemma 4 12B 4.5–6.2
M2 or M3 Mac (16 GB) 10.7 GB 100 GB/s 17 Gemma 4 12B 6.6–9.0
M4 Mac (16 GB) 10.7 GB 120 GB/s 17 Gemma 4 12B 7.9–11
M5 Mac (16 GB) 10.7 GB 153 GB/s 17 Gemma 4 12B 10–14
M1 Pro or M2 Pro Mac (16 GB) 10.7 GB 200 GB/s 17 Gemma 4 12B 13–18
CPU only, DDR4-3200 dual channel (16 GB) 10 GB 51.2 GB/s 17 Gemma 4 12B 3.1–4.9

其他显存容量

所有数字(含 8K 与 128K 上下文)见开放数据集,汇总见大模型显存统计;任意设置可在显存计算器中重算。