8 GB 显存最佳本地大模型
单张 8 GB 显卡、Q4_K_M、32K 上下文下,最大的稠密模型是并列的 MiMo V2.6 Distill Qwen 9B 和 Ornith 1.0 9B(9.4B,7.4 GB,在一张 RTX 4060 8GB 上约 21–30 token/s);最大的 MoE 是 LFM2.5 8B-A1B(总参数 8.5B、激活 1.5B,6.2 GB,约 57–99 token/s);占用 4 GB 以上的模型中,上下文最长的是 Ling 3.0 Tiny 7.9B-A1.3B(完整 128K 上下文占 6.3 GB);Q8_0 下最大的是 Spark-X2.5 4B(4.1B,6.3 GB)。
更新于 (本页所列模型中最近一次数据核对的日期),共 61 个模型。按显存和参数量排序,不是质量排名。总显存 = 权重 + FP16 KV 缓存(单个请求)+ 0.5 GB + 10% 开销;GB = GiB。显卡上至少还剩 0.5 GB 才算能放进,与 Can I run it? 页面(英文)一致。速度是在一张 RTX 4060 8GB(272 GB/s)上、32K 上下文已填满时的带宽估算,不是实测。不确定显存大小?让浏览器识别你的 GPU。
8 GB 显存的首选模型
| 类别 | 模型 | 总参数 | 激活参数 | 显存 | token/s(RTX 4060 8GB) |
|---|---|---|---|---|---|
| 最大稠密模型(Q4_K_M) | MiMo V2.6 Distill Qwen 9B | 9.4B | 稠密 | 7.4 GB,与 Ornith 1.0 9B 并列 | 21–30 |
| 最大 MoE(Q4_K_M) | LFM2.5 8B-A1B (MoE) | 8.5B | 1.5B | 6.2 GB | 57–99 |
| 4 GB 以上模型中最长上下文(Q4_K_M) | Ling 3.0 Tiny 7.9B-A1.3B (MoE) | 7.9B | 1.3B | 128K(完整),6.3 GB | 72–126 |
| Q8_0 下最大 | Spark-X2.5 4B | 4.1B | 稠密 | 6.3 GB | 25–35 |
8 GB 显存最好的本地大模型是什么?
按规模算,单张 8 GB 显卡在 Q4_K_M、32K 上下文下能放下的最大模型是并列的 MiMo V2.6 Distill Qwen 9B 和 Ornith 1.0 9B(9.4B,7.4 GB,剩余 0.6 GB);我们收录的 61 个模型中有 10 个能放进。本页按显存和参数量排序,不含跑分,我们的数据也不包含质量评测。
8 GB 显存能跑 70B 模型吗?
单卡不行:Llama 3.1 70B(70.6B)在 Q4_K_M、32K 上下文下需要 55.2 GB,即使用 IQ3_XXS 也要 41.3 GB。
逐步计算见 Llama 3.1 70B 显存页(英文)。
8 GB 显存上,Q8_0 和更大的模型哪个更好?
单张 8 GB 显卡、32K 上下文下,Q8_0 能放下的最大模型是 Spark-X2.5 4B(4.1B,6.3 GB,约 25–35 token/s),Q4_K_M 则是并列的 MiMo V2.6 Distill Qwen 9B 和 Ornith 1.0 9B(9.4B,7.4 GB,约 21–30 token/s),总参数是前者的 2.3 倍。Q8_0 每个权重约 8.5 位,Q4_K_M 约 4.84 位;我们的数据只覆盖显存和速度,不评测输出质量,所以这里不给两者打分。
各 GGUF 类型的位数与取舍见 GGUF 量化类型详解(英文)。
能放进 8 GB 的最新模型
按模型数据加入或核对的日期排序,最新在前(Q4_K_M、32K 上下文)。新加入的模型会自动出现在这里。
| 模型 | 加入/核对 | 总参数 | 激活参数 | 显存 (GB) | token/s |
|---|---|---|---|---|---|
| Ornith 1.0 9B | 9.4B | 稠密 | 7.43 | 21–30 | |
| Granite 4.2 3B | 3.7B | 稠密 | 5.52 | 29–41 | |
| Spark-X2.5 4B | 4.1B | 稠密 | 4.40 | 37–52 | |
| Ling 3.0 Tiny 7.9B-A1.3B (MoE) | 7.9B | 1.3B | 5.62 | 72–126 | |
| LFM2.5 8B-A1B (MoE) | 8.5B | 1.5B | 6.16 | 57–99 | |
| Limite 1B Violetto | 1.0B | 稠密 | 1.62 | 113–170 | |
| MiMo V2.6 Distill Qwen 9B | 9.4B | 稠密 | 7.43 | 21–30 | |
| Gemma 4 E4B | 8.0B | 稠密 | 6.05 | 27–37 |
Q4_K_M 下能放进 8 GB 的全部 10 个模型
| 模型 | 总参数 | 激活参数 | 显存 (GB) | 剩余 (GB) | token/s | 计算器 |
|---|---|---|---|---|---|---|
| MiMo V2.6 Distill Qwen 9B | 9.4B | 稠密 | 7.43 | 0.57 | 21–30 | 打开 |
| Ornith 1.0 9B | 9.4B | 稠密 | 7.43 | 0.57 | 21–30 | 打开 |
| LFM2.5 8B-A1B (MoE) | 8.5B | 1.5B | 6.16 | 1.84 | 57–99 | 打开 |
| Gemma 4 E4B | 8.0B | 稠密 | 6.05 | 1.95 | 27–37 | 打开 |
| Ling 3.0 Tiny 7.9B-A1.3B (MoE) | 7.9B | 1.3B | 5.62 | 2.38 | 72–126 | 打开 |
| Spark-X2.5 4B | 4.1B | 稠密 | 4.40 | 3.60 | 37–52 | 打开 |
| Nemotron 3 Nano 4B | 4.0B | 稠密 | 3.51 | 4.49 | 47–67 | 打开 |
| Granite 4.2 3B | 3.7B | 稠密 | 5.52 | 2.48 | 29–41 | 打开 |
| MiniCPM5 2B | 2.5B | 稠密 | 3.50 | 4.50 | 47–67 | 打开 |
| Limite 1B Violetto | 1.0B | 稠密 | 1.62 | 6.38 | 113–170 | 打开 |
Q8_0 下能放进 8 GB 的全部 5 个模型
| 模型 | 总参数 | 激活参数 | 显存 (GB) | 剩余 (GB) | token/s | 计算器 |
|---|---|---|---|---|---|---|
| Spark-X2.5 4B | 4.1B | 稠密 | 6.33 | 1.67 | 25–35 | 打开 |
| Nemotron 3 Nano 4B | 4.0B | 稠密 | 5.38 | 2.62 | 30–42 | 打开 |
| Granite 4.2 3B | 3.7B | 稠密 | 7.23 | 0.77 | 22–31 | 打开 |
| MiniCPM5 2B | 2.5B | 稠密 | 4.68 | 3.32 | 35–49 | 打开 |
| Limite 1B Violetto | 1.0B | 稠密 | 2.11 | 5.89 | 83–122 | 打开 |
可用内存约 8 GB 的 Mac 与纯 CPU 电脑
这些机器留给模型的内存在 8 GB 到下一档之间:Mac 按 macOS 默认允许 GPU 使用的统一内存(32 GB 及以下约三分之二,更大约 75%,可用 sudo sysctl iogpu.wired_limit_mb 调高),纯 CPU 电脑按系统内存减去约 6 GB 系统占用。上面的列表同样适用,速度则取决于各自的带宽;纯 CPU 在处理长提示词时还会慢得多。
| 机器 | 可用内存 | 带宽 | Q4_K_M 可放下(8K) | 32K 下最大的模型 | token/s |
|---|---|---|---|---|---|
| M1 Mac (16 GB) | 10.7 GB | 68.25 GB/s | 17 | Gemma 4 12B | 4.5–6.2 |
| M2 or M3 Mac (16 GB) | 10.7 GB | 100 GB/s | 17 | Gemma 4 12B | 6.6–9.0 |
| M4 Mac (16 GB) | 10.7 GB | 120 GB/s | 17 | Gemma 4 12B | 7.9–11 |
| M5 Mac (16 GB) | 10.7 GB | 153 GB/s | 17 | Gemma 4 12B | 10–14 |
| M1 Pro or M2 Pro Mac (16 GB) | 10.7 GB | 200 GB/s | 17 | Gemma 4 12B | 13–18 |
| CPU only, DDR4-3200 dual channel (16 GB) | 10 GB | 51.2 GB/s | 17 | Gemma 4 12B | 3.1–4.9 |