Ternary Bonsai 2 27B 显存需求:8、12、16 GB 显卡
Ternary Bonsai 2 27B 能在 8 GB 显卡上运行:5.54 GB 的 PTQ1_0 文件在 32K 上下文、q4_0 KV 缓存下需要 7.10 GB 显存;12 GB 显卡可以跑满 256K 上下文(11.0 GB),16 GB 显卡可以用更大的 PQ2_0 文件跑 256K(12.2 GB)。它只能用 PrismML 的 llama.cpp 分支运行,Ollama、LM Studio 和官方 llama.cpp 都不行。
哪些显卡能跑 Bonsai 2 27B,能开多长上下文
每格是该显卡在至少剩余 0.5 GB 的前提下能放下的最长上下文及对应显存:整个文件放在 GPU 上
| 文件、KV 缓存 | 8 GB | 12 GB | 16 GB | 24 GB |
|---|---|---|---|---|
| PTQ1_0, f16 | 8K · 7.04 GB | 64K · 10.5 GB | 128K · 14.5 GB | 256K · 22.5 GB |
| PTQ1_0, q8_0 | 16K · 7.07 GB | 128K · 10.8 GB | 256K · 15.0 GB | 256K · 15.0 GB |
| PTQ1_0, q4_0 | 32K · 7.10 GB | 256K · 11.0 GB | 256K · 11.0 GB | 256K · 11.0 GB |
| PQ2_0, f16 | 4K · 7.96 GB 勉强:剩余不到 0.5 GB | 32K · 9.71 GB | 64K · 11.7 GB | 128K · 15.7 GB |
| PQ2_0, q8_0 | 8K · 7.98 GB 勉强:剩余不到 0.5 GB | 64K · 9.84 GB | 128K · 12.0 GB | 256K · 16.2 GB |
| PQ2_0, q4_0 | 16K · 7.99 GB 勉强:剩余不到 0.5 GB | 128K · 9.96 GB | 256K · 12.2 GB | 256K · 12.2 GB |
加载视觉投影器(0.59 GB 的 Q8_0 文件,用于图片输入)后,同样的显卡可以放下:8 GB,PTQ1_0 16K(7.41 GB);12 GB,PTQ1_0 或 PQ2_0 128K(9.37 GB 和 10.5 GB);16 GB,两者都到 256K(11.6 GB 和 12.8 GB),均为 q4_0 KV 缓存。
介于“放得下”和“放不下”之间:PTQ1_0 在 64K、q4_0 下需要 7.66 GB,只有这张 8 GB 显卡没有其他占用(不接显示器)时才能加载。24 GB 显卡可以让所有文件跑满 256K,PTQ1_0 甚至可以用 f16 缓存(22.5 GB)。
Bonsai 2 27B 全部文件的真实字节数
字节数取自 Hugging Face API。“十进制 GB”除以 1,000,000,000;本站的 GB(与 nvidia-smi 相同)除以 1024³,所以同一个文件在别处写 5.95 GB,这里写 5.54 GB。
| 文件 | 字节 | 十进制 GB | GB(GiB) | 每权重位数 | 运行环境 |
|---|---|---|---|---|---|
Ternary-Bonsai-2-27B-PTQ1_0.gguf最小的文件,8 GB 显卡用它 | 5,946,648,928 | 5.95 GB | 5.54 GB | 1.75 | PrismML 的 llama.cpp 分支 |
Ternary-Bonsai-2-27B-PQ2_0.gguf更大,得分略高 | 7,206,168,928 | 7.21 GB | 6.71 GB | 2.13 | PrismML 的 llama.cpp 分支 |
Ternary-Bonsai-2-27B-PTQ1_0-mtp.gguf接回 MTP 层的 PTQ1_0(社区) | 7,012,820,512 | 7.01 GB | 6.53 GB | 1.75 | PrismML 的 llama.cpp 分支 |
Ternary-Bonsai-2-27B-mmproj-Q8_0.gguf视觉投影器 | 629,246,976 | 0.63 GB | 0.59 GB | Q8_0 | 标准 GGUF,由分支随模型一起加载 |
Ternary-Bonsai-2-27B-mmproj-BF16.gguf视觉投影器 | 931,145,856 | 0.93 GB | 0.87 GB | BF16 | 标准 GGUF,由分支随模型一起加载 |
Ternary-Bonsai-2-27B-F16.gguf未量化的参考文件;官方 llama.cpp 能加载但输出是乱码 | 53,808,408,928 | 53.81 GB | 50.1 GB | 16 | PrismML 的 llama.cpp 分支 |
model.safetensorsApple Silicon 版;MLX 应用和 LM Studio(MLX)暂时无法加载 | 8,595,477,990 | 8.60 GB | 8.01 GB | 2.25 | 仓库自带的 MLX 运行时 |
为什么会看到 5.95 GB、7.2 GB 和 8.60 GB
5.95 GB 是 PTQ1_0 GGUF 文件(5,946,648,928 字节)按十进制 GB 计算的大小,模型卡自己的表格就是这样写的(PQ2_0 写作 7.21 GB)。换成显存通用的 GiB 是 5.54 GB。“不到 6 GB”和“5.54 GB”说的是同一个文件。
7.2 GB 是 PQ2_0 GGUF(7,206,168,928 字节,6.71 GB),即 2.13 位的文件;社区最早的几个接回 MTP 层的版本都基于它。
8.60 GB 是另一个下载:给 Apple Silicon 用的 MLX 2-bit 包,只有一个 8,595,477,990 字节的 model.safetensors(8.01 GB)。它的 README 把它拆成 7.67 GB 语言模型和 0.92 GB 视觉塔,并解释了为什么更大:MLX 每 128 个权重存一个 scale 和一个 bias,同样的三值权重每个要 2.25 位,而 GGUF 的 PTQ1_0 只要 1.75 位。写“Bonsai 2 27B 有 8.60 GB”的文章说的是 Mac 版,不是装 NVIDIA 显卡的电脑要下载的文件。
怎么运行
PTQ1_0 和 PQ2_0 是新的 GGML 张量类型,只有 PrismML 的 llama.cpp 分支实现了(版本 prism-b10743,2026-09-25)。把它们加入主线的 PR #29077 已于 2026-09-22 未合并关闭,所以 Ollama、LM Studio 和官方 llama.cpp 都无法加载这些文件。用这个分支时,命令和平常的 llama-server 一样:
huggingface-cli download prism-ml/Ternary-Bonsai-2-27B-gguf Ternary-Bonsai-2-27B-PTQ1_0.gguf --local-dir . 8 GB 显卡,32K 上下文:
llama-server -m Ternary-Bonsai-2-27B-PTQ1_0.gguf -ngl 99 -c 32768 -fa on -ctk q4_0 -ctv q4_0 12 GB 显卡,跑满 256K 上下文:
llama-server -m Ternary-Bonsai-2-27B-PTQ1_0.gguf -ngl 99 -c 262144 -fa on -ctk q4_0 -ctv q4_0 16 GB 显卡,PQ2_0 跑 256K:
llama-server -m Ternary-Bonsai-2-27B-PQ2_0.gguf -ngl 99 -c 262144 -fa on -ctk q4_0 -ctv q4_0 社区接回 MTP 层的文件(sudoingX/--spec-type draft-mtp。作者在 RTX 3060 12GB、128K 上下文下测得不开时每秒 25.0 个 token,开 1 个草稿 token 时 27.1 个。
在 Mac 上,分支版 llama.cpp 通过 Metal 运行同样的 GGUF 文件。MLX 包的权重为 8.01 GB;按本站方法、f16 缓存计算,32K 约 11.0 GB,128K 约 17.0 GB。它的 PACK-RUNTIME.md 说明普通 MLX 加载器不会做所需的 Hadamard 变换,要用仓库自带的运行时,并且不包含视觉和 MTP 部分,尽管 README 把视觉塔算进了 8.60 GB。Mac 的内存有多少能给 GPU 用,见我的电脑能跑什么。
实测数据
单位保持各来源的原样。“已填充”表示提示词确实用到了这么多 token。
| 显卡 | 上下文 | KV | 显存 | 每秒 token | 来源 |
|---|---|---|---|---|---|
| RTX 4070 12GB | 已填充 0 | q4_0 | 7,561 MiB | 51.93 | github.com 2026-09-20 |
| RTX 4070 12GB | 已填充 16K | q4_0 | 7,721 MiB | 44.54 | github.com 2026-09-20 |
| RTX 4070 12GB | 已填充 64K | q4_0 | 8,586 MiB | 30.69 | github.com 2026-09-20 |
| RTX 4070 12GB | 已填充 131K | q4_0 | 9,918 MiB | 21.77 | github.com 2026-09-20 |
| RTX 3060 12GB | 64K | 未说明 | 7.3 GB | — | github.com 2026-09-19 |
| RTX 3060 12GB | 262K | 未说明 | 11.7 GB | — | github.com 2026-09-19 |
| RTX 3060 12GB | 未说明 | 未说明 | — | 26.32 | github.com 2026-09-19 |
| RTX 2060 Super 8GB | 32K | 未说明 | 6.2–6.5 GB | 16.8 | huggingface.co 2026-09-22 |
短提示时估算很接近,长提示时偏低:在已填充 131K 上下文时,RTX 4070 实测用了 9,918 MiB,这里估算为 8.79 GB,所以跑很长的提示词时请多留约 1 GB 余量。
文件大小于 从 Hugging Face API 读取:prism-ml/
常见问题
Ternary Bonsai 2 27B 能在 8 GB 显卡上跑吗?
能,用 PTQ1_0 文件:5.54 GB 权重,32K 上下文、q4_0 KV 缓存加 1 GB 缓冲区共 7.10 GB。有人用 RTX 2060 Super 8GB 在 32K 下实测 6.2–6.5 GB、每秒 16.8 个 token。PQ2_0 在 8 GB 上只能勉强装下:8K 需要 7.85 GB,剩余不到 0.5 GB。
Bonsai 2 27B 到底是 5.95 GB 还是 8.60 GB?
两个都对,但是不同的文件。5.95 GB 是 PTQ1_0 GGUF 的 5,946,648,928 字节按十进制 GB 算(即 5.54 GiB);8.60 GB 是 Apple Silicon 用的 MLX 2-bit 包(8,595,477,990 字节),MLX 每组权重多存 scale 和 bias,所以每个权重 2.25 位而不是 1.75 位。
12 GB 和 16 GB 显卡能开多长上下文?
12 GB:PTQ1_0 用 q4_0 缓存可以跑满 256K(11.0 GB),PQ2_0 到 128K(9.96 GB)。16 GB:PQ2_0 用 q4_0 可到 256K(12.2 GB),PTQ1_0 用 q8_0 也能到 256K(15.0 GB)。只有 16 个注意力层有 KV 缓存,所以长上下文很便宜。
Ollama 或 LM Studio 能运行 Bonsai 2 吗?
目前不能。PTQ1_0 和 PQ2_0 只有 PrismML 的 llama.cpp 分支实现,加入主线的 PR #29077 已于 2026-09-22 未合并关闭。Ollama 和 LM Studio 使用官方 llama.cpp,无法加载这些文件。
本页的 GB 是 GB 还是 GiB?
GiB(字节 ÷ 1024³),与 nvidia-smi 和显卡标称容量一致,全站相同。文件表同时列出了十进制 GB,方便和其他网站的数字对照。
更多计算器
- 微调显存计算器 Transformers 或 Unsloth 中全参数微调、LoRA、QLoRA 需要的显存,并与公开实测对比。 打开 →
- 图像与视频模型显存计算器 FLUX.2、Wan 2.2、LTX-2 和 Qwen-Image 在 ComfyUI 中的峰值显存与系统内存,按精确文件大小计算,并与公开实测核对。 打开 →
- 可本地运行的 Jev 替代品 只有 API 的 Jev 在本地的开源替代:Laya、零样本分类编码器和小型 LLM,附文件大小与显存。 打开 →
- Laya 显存需求 Laya 决策编码器三个模型的真实文件大小、运行内存,以及 PyTorch、ggmlc、llama.cpp 三种运行方式。 打开 →
- vLLM KV cache 与并发计算器 vLLM 分配的 KV cache 池有多少 token、能同时处理多少请求,并给出 vllm serve 命令。 打开 →
- 我的电脑能跑什么? 在浏览器里识别你的 GPU,列出它能跑的本地大模型,以及最佳量化和速度。 打开 →
更新于