Ternary Bonsai 2 27B 显存需求:8、12、16 GB 显卡

Ternary Bonsai 2 27B 能在 8 GB 显卡上运行:5.54 GB 的 PTQ1_0 文件在 32K 上下文、q4_0 KV 缓存下需要 7.10 GB 显存;12 GB 显卡可以跑满 256K 上下文(11.0 GB),16 GB 显卡可以用更大的 PQ2_0 文件跑 256K(12.2 GB)。它只能用 PrismML 的 llama.cpp 分支运行,Ollama、LM Studio 和官方 llama.cpp 都不行。

哪些显卡能跑 Bonsai 2 27B,能开多长上下文

每格是该显卡在至少剩余 0.5 GB 的前提下能放下的最长上下文及对应显存:整个文件放在 GPU 上(-ngl 99),加上 16 个注意力层的 KV 缓存(其余 48 层只保留固定大小的状态),再加 1 GB 计算缓冲区。仅文本,不开 MTP。

文件、KV 缓存8 GB12 GB16 GB24 GB
PTQ1_0, f16 8K · 7.04 GB64K · 10.5 GB128K · 14.5 GB256K · 22.5 GB
PTQ1_0, q8_0 16K · 7.07 GB128K · 10.8 GB256K · 15.0 GB256K · 15.0 GB
PTQ1_0, q4_0 32K · 7.10 GB256K · 11.0 GB256K · 11.0 GB256K · 11.0 GB
PQ2_0, f16 4K · 7.96 GB
勉强:剩余不到 0.5 GB
32K · 9.71 GB64K · 11.7 GB128K · 15.7 GB
PQ2_0, q8_0 8K · 7.98 GB
勉强:剩余不到 0.5 GB
64K · 9.84 GB128K · 12.0 GB256K · 16.2 GB
PQ2_0, q4_0 16K · 7.99 GB
勉强:剩余不到 0.5 GB
128K · 9.96 GB256K · 12.2 GB256K · 12.2 GB

加载视觉投影器(0.59 GB 的 Q8_0 文件,用于图片输入)后,同样的显卡可以放下:8 GB,PTQ1_0 16K(7.41 GB);12 GB,PTQ1_0 或 PQ2_0 128K(9.37 GB 和 10.5 GB);16 GB,两者都到 256K(11.6 GB 和 12.8 GB),均为 q4_0 KV 缓存。

介于“放得下”和“放不下”之间:PTQ1_0 在 64K、q4_0 下需要 7.66 GB,只有这张 8 GB 显卡没有其他占用(不接显示器)时才能加载。24 GB 显卡可以让所有文件跑满 256K,PTQ1_0 甚至可以用 f16 缓存(22.5 GB)。

Bonsai 2 27B 全部文件的真实字节数

字节数取自 Hugging Face API。“十进制 GB”除以 1,000,000,000;本站的 GB(与 nvidia-smi 相同)除以 1024³,所以同一个文件在别处写 5.95 GB,这里写 5.54 GB。

文件字节十进制 GBGB(GiB) 每权重位数运行环境
Ternary-Bonsai-2-27B-PTQ1_0.gguf
最小的文件,8 GB 显卡用它
5,946,648,928 5.95 GB 5.54 GB 1.75 PrismML 的 llama.cpp 分支
Ternary-Bonsai-2-27B-PQ2_0.gguf
更大,得分略高
7,206,168,928 7.21 GB 6.71 GB 2.13 PrismML 的 llama.cpp 分支
Ternary-Bonsai-2-27B-PTQ1_0-mtp.gguf
接回 MTP 层的 PTQ1_0(社区)
7,012,820,512 7.01 GB 6.53 GB 1.75 PrismML 的 llama.cpp 分支
Ternary-Bonsai-2-27B-mmproj-Q8_0.gguf
视觉投影器
629,246,976 0.63 GB 0.59 GB Q8_0 标准 GGUF,由分支随模型一起加载
Ternary-Bonsai-2-27B-mmproj-BF16.gguf
视觉投影器
931,145,856 0.93 GB 0.87 GB BF16 标准 GGUF,由分支随模型一起加载
Ternary-Bonsai-2-27B-F16.gguf
未量化的参考文件;官方 llama.cpp 能加载但输出是乱码
53,808,408,928 53.81 GB 50.1 GB 16 PrismML 的 llama.cpp 分支
model.safetensors
Apple Silicon 版;MLX 应用和 LM Studio(MLX)暂时无法加载
8,595,477,990 8.60 GB 8.01 GB 2.25 仓库自带的 MLX 运行时

为什么会看到 5.95 GB、7.2 GB 和 8.60 GB

5.95 GB 是 PTQ1_0 GGUF 文件(5,946,648,928 字节)按十进制 GB 计算的大小,模型卡自己的表格就是这样写的(PQ2_0 写作 7.21 GB)。换成显存通用的 GiB 是 5.54 GB。“不到 6 GB”和“5.54 GB”说的是同一个文件。

7.2 GB 是 PQ2_0 GGUF(7,206,168,928 字节,6.71 GB),即 2.13 位的文件;社区最早的几个接回 MTP 层的版本都基于它。

8.60 GB 是另一个下载:给 Apple Silicon 用的 MLX 2-bit 包,只有一个 8,595,477,990 字节的 model.safetensors(8.01 GB)。它的 README 把它拆成 7.67 GB 语言模型和 0.92 GB 视觉塔,并解释了为什么更大:MLX 每 128 个权重存一个 scale 和一个 bias,同样的三值权重每个要 2.25 位,而 GGUF 的 PTQ1_0 只要 1.75 位。写“Bonsai 2 27B 有 8.60 GB”的文章说的是 Mac 版,不是装 NVIDIA 显卡的电脑要下载的文件。

怎么运行

PTQ1_0 和 PQ2_0 是新的 GGML 张量类型,只有 PrismML 的 llama.cpp 分支实现了(版本 prism-b10743,2026-09-25)。把它们加入主线的 PR #29077 已于 2026-09-22 未合并关闭,所以 Ollama、LM Studio 和官方 llama.cpp 都无法加载这些文件。用这个分支时,命令和平常的 llama-server 一样:

huggingface-cli download prism-ml/Ternary-Bonsai-2-27B-gguf Ternary-Bonsai-2-27B-PTQ1_0.gguf --local-dir .

8 GB 显卡,32K 上下文:

llama-server -m Ternary-Bonsai-2-27B-PTQ1_0.gguf -ngl 99 -c 32768 -fa on -ctk q4_0 -ctv q4_0

12 GB 显卡,跑满 256K 上下文:

llama-server -m Ternary-Bonsai-2-27B-PTQ1_0.gguf -ngl 99 -c 262144 -fa on -ctk q4_0 -ctv q4_0

16 GB 显卡,PQ2_0 跑 256K:

llama-server -m Ternary-Bonsai-2-27B-PQ2_0.gguf -ngl 99 -c 262144 -fa on -ctk q4_0 -ctv q4_0

社区接回 MTP 层的文件(sudoingX/Ternary-Bonsai-2-27B-PTQ1_0-MTP-GGUF,6.53 GB)多 0.99 GB,可以让分支运行 --spec-type draft-mtp。作者在 RTX 3060 12GB、128K 上下文下测得不开时每秒 25.0 个 token,开 1 个草稿 token 时 27.1 个。

在 Mac 上,分支版 llama.cpp 通过 Metal 运行同样的 GGUF 文件。MLX 包的权重为 8.01 GB;按本站方法、f16 缓存计算,32K 约 11.0 GB,128K 约 17.0 GB。它的 PACK-RUNTIME.md 说明普通 MLX 加载器不会做所需的 Hadamard 变换,要用仓库自带的运行时,并且不包含视觉和 MTP 部分,尽管 README 把视觉塔算进了 8.60 GB。Mac 的内存有多少能给 GPU 用,见我的电脑能跑什么。

实测数据

单位保持各来源的原样。“已填充”表示提示词确实用到了这么多 token。

显卡上下文KV显存每秒 token来源
RTX 4070 12GB已填充 0q4_07,561 MiB51.93 github.com 2026-09-20
RTX 4070 12GB已填充 16Kq4_07,721 MiB44.54 github.com 2026-09-20
RTX 4070 12GB已填充 64Kq4_08,586 MiB30.69 github.com 2026-09-20
RTX 4070 12GB已填充 131Kq4_09,918 MiB21.77 github.com 2026-09-20
RTX 3060 12GB64K未说明7.3 GB— github.com 2026-09-19
RTX 3060 12GB262K未说明11.7 GB— github.com 2026-09-19
RTX 3060 12GB未说明未说明—26.32 github.com 2026-09-19
RTX 2060 Super 8GB32K未说明6.2–6.5 GB16.8 huggingface.co 2026-09-22

短提示时估算很接近,长提示时偏低:在已填充 131K 上下文时,RTX 4070 实测用了 9,918 MiB,这里估算为 8.79 GB,所以跑很长的提示词时请多留约 1 GB 余量。

文件大小于 从 Hugging Face API 读取:prism-ml/Ternary-Bonsai-2-27B-gguf(3,581,027 次下载,2,263 个赞,Apache 2.0)、prism-ml/Ternary-Bonsai-2-27B-mlx-2bit 和 sudoingX/Ternary-Bonsai-2-27B-PTQ1_0-MTP-GGUF。结构参数取自 Qwen3.8 27B。要把 Bonsai 2 与同一模型的 GSQ-RCO、Unsloth UD 量化对比,或试任意上下文、KV 类型和投影器设置,请打开 Qwen3.8 27B 量化计算器。

常见问题

Ternary Bonsai 2 27B 能在 8 GB 显卡上跑吗?

能,用 PTQ1_0 文件:5.54 GB 权重,32K 上下文、q4_0 KV 缓存加 1 GB 缓冲区共 7.10 GB。有人用 RTX 2060 Super 8GB 在 32K 下实测 6.2–6.5 GB、每秒 16.8 个 token。PQ2_0 在 8 GB 上只能勉强装下:8K 需要 7.85 GB,剩余不到 0.5 GB。

Bonsai 2 27B 到底是 5.95 GB 还是 8.60 GB?

两个都对,但是不同的文件。5.95 GB 是 PTQ1_0 GGUF 的 5,946,648,928 字节按十进制 GB 算(即 5.54 GiB);8.60 GB 是 Apple Silicon 用的 MLX 2-bit 包(8,595,477,990 字节),MLX 每组权重多存 scale 和 bias,所以每个权重 2.25 位而不是 1.75 位。

12 GB 和 16 GB 显卡能开多长上下文?

12 GB:PTQ1_0 用 q4_0 缓存可以跑满 256K(11.0 GB),PQ2_0 到 128K(9.96 GB)。16 GB:PQ2_0 用 q4_0 可到 256K(12.2 GB),PTQ1_0 用 q8_0 也能到 256K(15.0 GB)。只有 16 个注意力层有 KV 缓存,所以长上下文很便宜。

Ollama 或 LM Studio 能运行 Bonsai 2 吗?

目前不能。PTQ1_0 和 PQ2_0 只有 PrismML 的 llama.cpp 分支实现,加入主线的 PR #29077 已于 2026-09-22 未合并关闭。Ollama 和 LM Studio 使用官方 llama.cpp,无法加载这些文件。

本页的 GB 是 GB 还是 GiB?

GiB(字节 ÷ 1024³),与 nvidia-smi 和显卡标称容量一致,全站相同。文件表同时列出了十进制 GB,方便和其他网站的数字对照。

更多计算器

更新于