Qwen3.8 27B 新 GGUF 量化:Bonsai 2、GSQ-RCO 与 UD 对比
选择一个 Qwen3.8 27B 文件、上下文长度和 KV cache 类型,就能看到它占用多少显存、哪些显卡装得下、能用主线 llama.cpp 运行还是必须用 PrismML 的分支,以及对应的 llama-server 命令。
– 预计显存占用
- 模型文件
- –
- KV cache
- –
- mmproj
- –
- 缓冲区 + CUDA
- 1.00 GB
| 显存 | 8 GB | 12 GB | 16 GB | 24 GB |
|---|---|---|---|---|
| 结果 | – | – | – | – |
“紧张”:装得下,但剩余不到 0.5 GB。缓冲区固定按 1 GB 计算;下方 RTX 4070 的实测在已填充 131K 上下文时比本估算多用了约 0.9 GB,所以请留出余量。如果这块 GPU 还要驱动显示器,再多留约 0.5–1 GB。
推理引擎: –
llama-server 命令
三种格式分别是什么
Ternary Bonsai 2(PrismML,2026-09-16)是把 Qwen3.8 27B 重新训练成三值权重(−1、0、+1)的版本,每 128 个权重一组共用一个 FP16 缩放系数,并使用 Hadamard 旋转。它的 PTQ1_0(1.75 位)和 PQ2_0(2.13 位)类型只能在 PrismML 的 llama.cpp 分支中运行。GSQ-RCO(ISTA-DASLab,2026-08-28)把权重存成标准 GGUF 类型(IQ2_XS 到 IQ3_S),所以主线 llama.cpp 就能加载;每个尺寸还有一个带多 token 预测(MTP)层的 -mtp 文件。Unsloth UD 是常见的动态量化,放在这里作对比,文件中包含 MTP 层。
Qwen3.8 27B 所有文件对比
大小:Hugging Face 上的字节数。位数:官方标称值,以及文件大小 ÷ 278 亿参数
| 文件 | 大小 | 位数(标称) | 位数(大小 ÷ 参数) | 引擎 | 评分 | PPL | RTX 4090 token/秒 | RTX 5060 Ti token/秒 | 合计(32K q8_0) |
|---|---|---|---|---|---|---|---|---|---|
| Bonsai 2 PTQ1_0 | 5.54 GB5,946,648,928 B | 1.75 | 1.71 | PrismML 分支 | 91.44% | — | 95.34 | 45.81 | 7.60 GB |
| Bonsai 2 PTQ1_0-mtp | 6.53 GB7,012,820,512 B | 1.75 | 2.02 | PrismML 分支 | — | — | — | — | 8.59 GB |
| Bonsai 2 PQ2_0 | 6.71 GB7,206,168,928 B | 2.13 | 2.08 | PrismML 分支 | 91.65% | — | 89.26 | 48.73 | 8.77 GB |
| GSQ-RCO IQ2_XS | 7.84 GB8,422,841,472 B | 2.50 | 2.43 | 主线 | 86.47% | 7.69 | — | — | 9.91 GB |
| GSQ-RCO IQ2_XS-mtp | 8.17 GB8,771,311,680 B | 2.50 | 2.53 | 主线 | — | — | — | — | 10.2 GB |
| GSQ-RCO IQ2_S | 8.62 GB9,259,510,912 B | 2.75 | 2.67 | 主线 | 93.64% | — | — | — | 10.7 GB |
| GSQ-RCO IQ2_S-mtp | 8.95 GB9,607,981,120 B | 2.75 | 2.77 | 主线 | — | — | — | — | 11.0 GB |
| GSQ-RCO IQ3_XXS | 9.40 GB10,094,357,632 B | 3.00 | 2.91 | 主线 | 94.38% | 7.20 | 69.26 | 33.95 | 11.5 GB |
| GSQ-RCO IQ3_XXS-mtp | 9.73 GB10,442,827,840 B | 3.00 | 3.01 | 主线 | — | — | — | — | 11.8 GB |
| GSQ-RCO IQ3_S | 11.0 GB11,771,546,784 B | 3.50 | 3.39 | 主线 | 99.43% | 7.07 | 62.41 | 30.72 | 13.0 GB |
| GSQ-RCO IQ3_S-mtp | 11.3 GB12,120,016,960 B | 3.50 | 3.49 | 主线 | — | — | — | — | 13.4 GB |
| Unsloth UD-IQ3_XXS | 10.2 GB10,934,860,704 B | — | 3.15 | 主线 | 93.59% | — | 67.24 | 32.80 | 12.2 GB |
| Unsloth UD-IQ4_XS | 13.3 GB14,252,845,984 B | — | 4.10 | 主线 | 99.20% | — | 55.62 | — | 15.3 GB |
| Unsloth UD-Q4_K_M | 15.3 GB16,464,440,224 B | — | 4.74 | 主线 | 97.03% | — | 49.77 | — | 17.4 GB |
相对 BF16 的 KL 散度(独立测试)
| 文件 | 平均 KLD | top-1 token 一致率 | PPL |
|---|---|---|---|
| Bonsai 2 PQ2_0 | 0.34 | 77.8% | 8.35 |
| Unsloth UD-Q4_K_XL | 0.0087 | 96.9% | 6.34 |
Bonsai 2 是重新训练的,而不是从 BF16 直接取整量化,所以 KLD 高说明它的输出和原模型差别大,并不代表输出差;上面 ByteShape 的任务评分给 PQ2_0 的是 91.65%。 huggingface.co 2026-09-23
该选哪一个
合计:整个文件放在 GPU 上,不加载 mmproj,不开 MTP,缓冲区 1 GB。评分:ByteShape 相对 BF16 的归一化评分。
- 8 GB
- 只有 Bonsai 2 PTQ1_0 装得下并留有上下文空间:权重 5.54 GB,32K 上下文配 q4_0 KV 时共 7.10 GB(q8_0 为 7.60 GB)。它需要 PrismML 分支。有用户在 RTX 2060 Super 8GB 上以 32K 运行,占用 6.2–6.5 GB,速度 16.8 token/秒。PQ2_0 即使只开 8K 也很紧张(7.85 GB),最小的 GSQ-RCO 文件 IQ2_XS 在 8K 时就要 8.99 GB。
- 12 GB
- 用主线 llama.cpp 的话,GSQ-RCO IQ3_XXS(9.40 GB,评分 94.38%)在 32K、q8_0 KV 下占 11.5 GB,在 64K、q4_0 下占 11.5 GB。Unsloth UD-IQ3_XXS 更大(10.2 GB),评分 93.59%。GSQ-RCO IQ3_S 即使用 q4_0,32K 也要 12.5 GB,超过 12 GB。要长上下文的话,Bonsai 2 PTQ1_0 用 q4_0 KV 开到 256K 为 11.0 GB(有用户在 RTX 3060 12GB 上报告 262K 时占 11.7 GB),PQ2_0 开到 128K 为 9.96 GB。
- 16 GB
- GSQ-RCO IQ3_S(11.0 GB,评分 99.43%,本页最高)在 32K、f16 KV 下占 14.0 GB,64K、q8_0 下占 14.1 GB,128K、q4_0 下占 14.2 GB。Unsloth UD-IQ4_XS(13.3 GB,99.20%)在 32K、q8_0 下占 15.3 GB。要 256K 的话,GSQ-RCO IQ3_XXS 配 q4_0 KV 需要 14.9 GB;有用户在 RTX 5060 Ti 16GB 上以 240K 上下文运行,速度约 30 token/秒。
- 24 GB
- Unsloth UD-Q4_K_M(15.3 GB,97.03%)在 64K、f16 KV 下占 20.3 GB;UD-IQ4_XS 在 128K、f16 下占 22.3 GB。ByteShape 在 RTX 4090 上测得 UD-Q4_K_M 为 49.77 token/秒,UD-IQ4_XS 为 55.62,GSQ-RCO IQ3_S 为 62.41,而且后者评分更高(99.43%)。
Qwen3.8 Flash Next:GSQ-RCO 分片
ISTA-DASLab 发布的 Qwen3.8 Flash Next(180B MoE,2026-09-07)GSQ-RCO 版本,每个尺寸有两个文件:一个权重分片,外加一个所有尺寸共用的 26.8 GB n-gram 分片(IQ4_NL)。llama.cpp 通过内存映射按需读取 n-gram 分片的行
| 量化 | 权重分片 | n-gram 分片 | 下载大小 | Ollama |
|---|---|---|---|---|
| Q2_0 | 35.0 GB | 26.8 GB | 61.9 GB | 不能加载(讨论 #23) |
| IQ2_XS | 36.5 GB | 26.8 GB | 63.4 GB | 未见报告 |
| IQ3_XXS | 43.8 GB | 26.8 GB | 70.6 GB | 未见报告 |
| IQ3_S | 51.1 GB | 26.8 GB | 77.9 GB | 未见报告 |
ISTA-DASLab/
已知问题
Bonsai 2 相关条目来自 PrismML 的 KNOWN_ISSUES.md(该文件最后核对于 2026-09-23),另有链接的除外。
- Bonsai 2 的 PTQ1_0 和 PQ2_0(GGML 类型 143 和 142)需要 PrismML 的分支 PrismML-Eng/
llama.cpp (release prism-b10743,2026-09-25)。原本要把它们加入主线 llama.cpp 的 PR #29077 已于 2026-09-22 关闭且未合并;功能请求 #29058 仍未关闭。 PrismML-Eng/llama.cpp · llama.cpp PR #29077 · issue #29058 - 原版 llama.cpp、Ollama 和 LM Studio(GGUF 模式)都无法加载 PTQ1_0 或 PQ2_0。Bonsai 的 F16 文件能在原版 llama.cpp 中加载,但输出是乱码,因为它依赖只有 PrismML 版本才会应用的元数据。 KNOWN_ISSUES.md
- 用 llama-quantize 把其他模型量化成 PTQ1_0 或 PQ2_0 会得到乱码:没有 Prism 的 Hadamard 旋转元数据,文件能正常加载、没有任何警告,但生成的内容毫无意义。 KNOWN_ISSUES.md
- 在 PrismML 于 2026-09-23 列出的二进制版本中,PQ2_0 在 Vulkan 上会悄悄退回 CPU 运行,速度不到 2 token/秒,而日志仍显示所有层都已卸载到 GPU。源码中已修复(PR #238);PTQ1_0 会在 GPU 上运行。SYCL 版本目前两种类型都不能运行。 KNOWN_ISSUES.md
- 在支持 AVX-512 的 CPU(包括 AMD Zen 4 和 Zen 5)上,PQ2_0 加载时会段错误崩溃,即使所有层都放在 GPU 上也一样。源码中已修复(PR #245)。 KNOWN_ISSUES.md
- 在消费级 RDNA2 显卡(如 gfx1030)上,ROCm/HIP 会中止运行;PrismML 建议改用 Vulkan 版本。从源码构建 CUDA 版本时,可能需要加 -DGGML_
CUDA_ q8_0/q4_0 KV 才能配合 flash attention 使用。 KNOWN_ISSUES.mdFA_ ALL_ QUANTS=ON, - 哪种 Bonsai 类型生成更快取决于 GPU:Ada 和 L4 上 PTQ1_0 更快,Blackwell、Hopper、Ampere、Volta 和 Turing 上 PQ2_0 更快。处理提示词(prefill)时也是 PQ2_0 更快。 KNOWN_ISSUES.md
- Bonsai 2 PQ2_0 与 BF16 的差异远大于 4-bit 量化:平均 KLD 0.340,top-1 token 一致率 77.8%;Unsloth UD-Q4_K_XL 分别为 0.0087 和 96.9%。它是重新训练的,所以这里衡量的是差异,而不是任务能力。 discussion #54
- GSQ-RCO 的 -mtp 文件使用 llama.cpp 内置的 MTP
(--spec-type draft-mtp),由 2026-05-16 合并的 PR #22673 加入;更早的版本用不了这一层。PrismML 分支在 PR #205(2026-09-21 合并)之前会拒绝为 Bonsai 文件开启 MTP;嫁接了 MTP 层的 PTQ1_0-mtp 文件是社区上传的。 llama.cpp PR #22673 - Qwen3.8 Flash Next 的 GSQ-RCO Q2_0 分片无法在 Ollama 中加载。 discussion #23
用户实测
| GPU | 文件 | 上下文 | KV | 引擎 | 显存 | token/秒 | 来源 |
|---|---|---|---|---|---|---|---|
| RTX 4070 12GB | Bonsai 2 PTQ1_0 | 已填充 0 | q4_0 | PrismML 分支 | 7,561 MiB | 51.93 | github.com 2026-09-20 |
| RTX 4070 12GB | Bonsai 2 PTQ1_0 | 已填充 16K | q4_0 | PrismML 分支 | 7,721 MiB | 44.54 | github.com 2026-09-20 |
| RTX 4070 12GB | Bonsai 2 PTQ1_0 | 已填充 64K | q4_0 | PrismML 分支 | 8,586 MiB | 30.69 | github.com 2026-09-20 |
| RTX 4070 12GB | Bonsai 2 PTQ1_0 | 已填充 131K | q4_0 | PrismML 分支 | 9,918 MiB | 21.77 | github.com 2026-09-20 |
| RTX 3060 12GB | Bonsai 2 PTQ1_0 | 64K | 未说明 | 未说明 | 7.3 GB | — | github.com 2026-09-19 |
| RTX 3060 12GB | Bonsai 2 PTQ1_0 | 262K | 未说明 | 未说明 | 11.7 GB | — | github.com 2026-09-19 |
| RTX 3060 12GB | Bonsai 2 PTQ1_0 | 未说明 | 未说明 | 原版构建 | — | 26.32 | github.com 2026-09-19 |
| RTX 2060 Super 8GB | Bonsai 2 PTQ1_0 | 32K | 未说明 | 未说明 | 6.2–6.5 GB | 16.8 | huggingface.co 2026-09-22 |
| RTX 5060 Ti 16GB | GSQ-RCO IQ3_XXS | 240K | 未说明 | 主线 llama.cpp | — | ~30 | huggingface.co 2026-09-01 |
| RTX 5080 16GB | GSQ-RCO IQ3_S-mtp | 262K | 未说明 | llama.cpp 分支 | ~15.36 GiB | 起始约 60 | huggingface.co 2026-09-11 |
文件大小于 读取自 Hugging Face API: prism-ml/
使用方法
- 选择文件。Bonsai 2 文件需要 PrismML 的 llama.cpp 分支;GSQ-RCO 和 Unsloth UD 可以直接用主线 llama.cpp。
- 设置上下文长度和 KV cache 类型。q8_0 能把缓存减半,q4_0 约降到四分之一。
- 选择是否加载视觉投影器(mmproj);对带 MTP 层的文件,再选择是否开启 MTP。
- 查看总显存和 GPU 表格,然后复制 llama-server 命令。
常见问题
Qwen3.8 27B 能在 8 GB 显卡上跑吗?
只有 Ternary Bonsai 2 PTQ1_0 可以:文件 5.54 GB,加上 32K 的 q4_0 KV cache 和 1 GB 缓冲区,共 7.10 GB。有用户在 RTX 2060 Super 8GB 上以 32K 上下文运行,占用 6.2–6.5 GB,速度 16.8 token/秒。它需要 PrismML 的 llama.cpp 分支。
Ternary Bonsai 2 能在 Ollama、LM Studio 或主线 llama.cpp 中使用吗?
不能。PTQ1_0 和 PQ2_0 是新的 GGML 类型,目前只有 PrismML 的分支(PrismML-Eng/
同样大小下,GSQ-RCO 比 Unsloth UD 更好吗?
按 ByteShape 的归一化评分,GSQ-RCO IQ3_XXS(9.40 GB)为 94.38%,Unsloth UD-IQ3_XXS(10.2 GB)为 93.59%。ISTA-DASLab 自测的 wikitext 困惑度:GSQ-RCO IQ2_XS 为 7.69,Unsloth UD-IQ2_S 为 8.02,BF16 为 7.05。GSQ-RCO IQ3_S(11.0 GB)得分 99.43%,高于 UD-IQ4_XS(13.3 GB)的 99.20%。
Bonsai 2 和 4-bit 量化相比质量如何?
ByteShape 给 PTQ1_0 的评分是 BF16 的 91.44%,PQ2_0 为 91.65%,低于 GSQ-RCO IQ2_S(93.64%)。一项独立测试测得 PQ2_0 的平均 KL 散度为 0.340,而 Unsloth UD-Q4_K_XL 为 0.0087。Bonsai 2 是重新训练的,所以 KLD 反映的是它的输出和原模型差别多大,而不是好坏。
-mtp 文件多占多少?这里的 GB 是 GB 还是 GiB?
GSQ-RCO 的 -mtp 文件大 0.32 GB(IQ3_XXS:9.40 GB,-mtp 为 9.73 GB);用 --spec-type draft-mtp 开启 MTP 后,还会多一小块草稿层的 KV cache。GB 指 GiB(字节数 ÷ 1024³),和 nvidia-smi 以及显卡显存标称使用的单位一致,全站都是如此。
更多计算器
- 微调显存计算器 Transformers 或 Unsloth 中全参数微调、LoRA、QLoRA 需要的显存,并与公开实测对比。 打开 →
- vLLM KV cache 与并发计算器 vLLM 分配的 KV cache 池有多少 token、能同时处理多少请求,并给出 vllm serve 命令。 打开 →
- 我的电脑能跑什么? 在浏览器里识别你的 GPU,列出它能跑的本地大模型,以及最佳量化和速度。 打开 →
- MiniMax H3 显存计算器
(ComfyUI) MiniMax H3 视频在 ComfyUI 中的显存与系统内存:剪枝版、INT8、NVFP4 和 GGUF 文件在 8–96 GB 显卡上的表现。 打开 → - MoE 卸载计算器
(--n-cpu-moe) 根据 GGUF 真实张量大小,找出能装进你显卡的最小 llama.cpp --n-cpu-moe。 打开 → - Qwen-Image-2.1 显存计算器 DiT、文本编码器和 VAE 各种组合的峰值显存,附真实显卡实测数据。 打开 →
更新于