Qwen3.8 27B 新 GGUF 量化:Bonsai 2、GSQ-RCO 与 UD 对比

选择一个 Qwen3.8 27B 文件、上下文长度和 KV cache 类型,就能看到它占用多少显存、哪些显卡装得下、能用主线 llama.cpp 运行还是必须用 PrismML 的分支,以及对应的 llama-server 命令。

– 预计显存占用

模型文件
–
KV cache
–
mmproj
–
缓冲区 + CUDA
1.00 GB
显存8 GB12 GB16 GB24 GB
结果––––

“紧张”:装得下,但剩余不到 0.5 GB。缓冲区固定按 1 GB 计算;下方 RTX 4070 的实测在已填充 131K 上下文时比本估算多用了约 0.9 GB,所以请留出余量。如果这块 GPU 还要驱动显示器,再多留约 0.5–1 GB。

推理引擎: –

llama-server 命令

三种格式分别是什么

Ternary Bonsai 2(PrismML,2026-09-16)是把 Qwen3.8 27B 重新训练成三值权重(−1、0、+1)的版本,每 128 个权重一组共用一个 FP16 缩放系数,并使用 Hadamard 旋转。它的 PTQ1_0(1.75 位)和 PQ2_0(2.13 位)类型只能在 PrismML 的 llama.cpp 分支中运行。GSQ-RCO(ISTA-DASLab,2026-08-28)把权重存成标准 GGUF 类型(IQ2_XS 到 IQ3_S),所以主线 llama.cpp 就能加载;每个尺寸还有一个带多 token 预测(MTP)层的 -mtp 文件。Unsloth UD 是常见的动态量化,放在这里作对比,文件中包含 MTP 层。

Qwen3.8 27B 所有文件对比

大小:Hugging Face 上的字节数。位数:官方标称值,以及文件大小 ÷ 278 亿参数(-mtp 文件多一层)。评分:ByteShape 相对 BF16 的归一化评分。PPL:ISTA-DASLab 自测的 wikitext 困惑度(BF16 为 7.05,Unsloth UD-IQ2_S 为 8.02)。速度:ByteShape 实测的生成 token/秒。合计:文件 + 32K q8_0 KV cache + 1 GB。“—”表示未公布。

文件大小位数(标称)位数(大小 ÷ 参数) 引擎评分PPL RTX 4090 token/秒RTX 5060 Ti token/秒合计(32K q8_0)
Bonsai 2 PTQ1_0 5.54 GB5,946,648,928 B 1.75 1.71 PrismML 分支 91.44% — 95.34 45.81 7.60 GB
Bonsai 2 PTQ1_0-mtp 6.53 GB7,012,820,512 B 1.75 2.02 PrismML 分支 — — — — 8.59 GB
Bonsai 2 PQ2_0 6.71 GB7,206,168,928 B 2.13 2.08 PrismML 分支 91.65% — 89.26 48.73 8.77 GB
GSQ-RCO IQ2_XS 7.84 GB8,422,841,472 B 2.50 2.43 主线 86.47% 7.69 — — 9.91 GB
GSQ-RCO IQ2_XS-mtp 8.17 GB8,771,311,680 B 2.50 2.53 主线 — — — — 10.2 GB
GSQ-RCO IQ2_S 8.62 GB9,259,510,912 B 2.75 2.67 主线 93.64% — — — 10.7 GB
GSQ-RCO IQ2_S-mtp 8.95 GB9,607,981,120 B 2.75 2.77 主线 — — — — 11.0 GB
GSQ-RCO IQ3_XXS 9.40 GB10,094,357,632 B 3.00 2.91 主线 94.38% 7.20 69.26 33.95 11.5 GB
GSQ-RCO IQ3_XXS-mtp 9.73 GB10,442,827,840 B 3.00 3.01 主线 — — — — 11.8 GB
GSQ-RCO IQ3_S 11.0 GB11,771,546,784 B 3.50 3.39 主线 99.43% 7.07 62.41 30.72 13.0 GB
GSQ-RCO IQ3_S-mtp 11.3 GB12,120,016,960 B 3.50 3.49 主线 — — — — 13.4 GB
Unsloth UD-IQ3_XXS 10.2 GB10,934,860,704 B — 3.15 主线 93.59% — 67.24 32.80 12.2 GB
Unsloth UD-IQ4_XS 13.3 GB14,252,845,984 B — 4.10 主线 99.20% — 55.62 — 15.3 GB
Unsloth UD-Q4_K_M 15.3 GB16,464,440,224 B — 4.74 主线 97.03% — 49.77 — 17.4 GB

相对 BF16 的 KL 散度(独立测试)

文件平均 KLDtop-1 token 一致率PPL
Bonsai 2 PQ2_00.3477.8%8.35
Unsloth UD-Q4_K_XL0.008796.9%6.34

Bonsai 2 是重新训练的,而不是从 BF16 直接取整量化,所以 KLD 高说明它的输出和原模型差别大,并不代表输出差;上面 ByteShape 的任务评分给 PQ2_0 的是 91.65%。 huggingface.co 2026-09-23

该选哪一个

合计:整个文件放在 GPU 上,不加载 mmproj,不开 MTP,缓冲区 1 GB。评分:ByteShape 相对 BF16 的归一化评分。

8 GB
只有 Bonsai 2 PTQ1_0 装得下并留有上下文空间:权重 5.54 GB,32K 上下文配 q4_0 KV 时共 7.10 GB(q8_0 为 7.60 GB)。它需要 PrismML 分支。有用户在 RTX 2060 Super 8GB 上以 32K 运行,占用 6.2–6.5 GB,速度 16.8 token/秒。PQ2_0 即使只开 8K 也很紧张(7.85 GB),最小的 GSQ-RCO 文件 IQ2_XS 在 8K 时就要 8.99 GB。
12 GB
用主线 llama.cpp 的话,GSQ-RCO IQ3_XXS(9.40 GB,评分 94.38%)在 32K、q8_0 KV 下占 11.5 GB,在 64K、q4_0 下占 11.5 GB。Unsloth UD-IQ3_XXS 更大(10.2 GB),评分 93.59%。GSQ-RCO IQ3_S 即使用 q4_0,32K 也要 12.5 GB,超过 12 GB。要长上下文的话,Bonsai 2 PTQ1_0 用 q4_0 KV 开到 256K 为 11.0 GB(有用户在 RTX 3060 12GB 上报告 262K 时占 11.7 GB),PQ2_0 开到 128K 为 9.96 GB。
16 GB
GSQ-RCO IQ3_S(11.0 GB,评分 99.43%,本页最高)在 32K、f16 KV 下占 14.0 GB,64K、q8_0 下占 14.1 GB,128K、q4_0 下占 14.2 GB。Unsloth UD-IQ4_XS(13.3 GB,99.20%)在 32K、q8_0 下占 15.3 GB。要 256K 的话,GSQ-RCO IQ3_XXS 配 q4_0 KV 需要 14.9 GB;有用户在 RTX 5060 Ti 16GB 上以 240K 上下文运行,速度约 30 token/秒。
24 GB
Unsloth UD-Q4_K_M(15.3 GB,97.03%)在 64K、f16 KV 下占 20.3 GB;UD-IQ4_XS 在 128K、f16 下占 22.3 GB。ByteShape 在 RTX 4090 上测得 UD-Q4_K_M 为 49.77 token/秒,UD-IQ4_XS 为 55.62,GSQ-RCO IQ3_S 为 62.41,而且后者评分更高(99.43%)。

Qwen3.8 Flash Next:GSQ-RCO 分片

ISTA-DASLab 发布的 Qwen3.8 Flash Next(180B MoE,2026-09-07)GSQ-RCO 版本,每个尺寸有两个文件:一个权重分片,外加一个所有尺寸共用的 26.8 GB n-gram 分片(IQ4_NL)。llama.cpp 通过内存映射按需读取 n-gram 分片的行(--lazy-mode),所以它留在磁盘或系统页缓存中,不占显存。最小的权重分片也超过 32 GB 显卡的容量,所以必须把一部分专家放到系统内存。

量化权重分片n-gram 分片下载大小Ollama
Q2_0 35.0 GB 26.8 GB 61.9 GB 不能加载(讨论 #23)
IQ2_XS 36.5 GB 26.8 GB 63.4 GB 未见报告
IQ3_XXS 43.8 GB 26.8 GB 70.6 GB 未见报告
IQ3_S 51.1 GB 26.8 GB 77.9 GB 未见报告

ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF 2026-09-07 要规划拆分方案,请用 MoE 卸载计算器:它会找出适合你显卡的最小 --n-cpu-moe。

已知问题

Bonsai 2 相关条目来自 PrismML 的 KNOWN_ISSUES.md(该文件最后核对于 2026-09-23),另有链接的除外。

  • Bonsai 2 的 PTQ1_0 和 PQ2_0(GGML 类型 143 和 142)需要 PrismML 的分支 PrismML-Eng/llama.cpp(release prism-b10743,2026-09-25)。原本要把它们加入主线 llama.cpp 的 PR #29077 已于 2026-09-22 关闭且未合并;功能请求 #29058 仍未关闭。 PrismML-Eng/llama.cpp · llama.cpp PR #29077 · issue #29058
  • 原版 llama.cpp、Ollama 和 LM Studio(GGUF 模式)都无法加载 PTQ1_0 或 PQ2_0。Bonsai 的 F16 文件能在原版 llama.cpp 中加载,但输出是乱码,因为它依赖只有 PrismML 版本才会应用的元数据。 KNOWN_ISSUES.md
  • 用 llama-quantize 把其他模型量化成 PTQ1_0 或 PQ2_0 会得到乱码:没有 Prism 的 Hadamard 旋转元数据,文件能正常加载、没有任何警告,但生成的内容毫无意义。 KNOWN_ISSUES.md
  • 在 PrismML 于 2026-09-23 列出的二进制版本中,PQ2_0 在 Vulkan 上会悄悄退回 CPU 运行,速度不到 2 token/秒,而日志仍显示所有层都已卸载到 GPU。源码中已修复(PR #238);PTQ1_0 会在 GPU 上运行。SYCL 版本目前两种类型都不能运行。 KNOWN_ISSUES.md
  • 在支持 AVX-512 的 CPU(包括 AMD Zen 4 和 Zen 5)上,PQ2_0 加载时会段错误崩溃,即使所有层都放在 GPU 上也一样。源码中已修复(PR #245)。 KNOWN_ISSUES.md
  • 在消费级 RDNA2 显卡(如 gfx1030)上,ROCm/HIP 会中止运行;PrismML 建议改用 Vulkan 版本。从源码构建 CUDA 版本时,可能需要加 -DGGML_CUDA_FA_ALL_QUANTS=ON,q8_0/q4_0 KV 才能配合 flash attention 使用。 KNOWN_ISSUES.md
  • 哪种 Bonsai 类型生成更快取决于 GPU:Ada 和 L4 上 PTQ1_0 更快,Blackwell、Hopper、Ampere、Volta 和 Turing 上 PQ2_0 更快。处理提示词(prefill)时也是 PQ2_0 更快。 KNOWN_ISSUES.md
  • Bonsai 2 PQ2_0 与 BF16 的差异远大于 4-bit 量化:平均 KLD 0.340,top-1 token 一致率 77.8%;Unsloth UD-Q4_K_XL 分别为 0.0087 和 96.9%。它是重新训练的,所以这里衡量的是差异,而不是任务能力。 discussion #54
  • GSQ-RCO 的 -mtp 文件使用 llama.cpp 内置的 MTP(--spec-type draft-mtp),由 2026-05-16 合并的 PR #22673 加入;更早的版本用不了这一层。PrismML 分支在 PR #205(2026-09-21 合并)之前会拒绝为 Bonsai 文件开启 MTP;嫁接了 MTP 层的 PTQ1_0-mtp 文件是社区上传的。 llama.cpp PR #22673
  • Qwen3.8 Flash Next 的 GSQ-RCO Q2_0 分片无法在 Ollama 中加载。 discussion #23

用户实测

GPU文件上下文KV引擎显存token/秒来源
RTX 4070 12GBBonsai 2 PTQ1_0已填充 0q4_0PrismML 分支 7,561 MiB51.93 github.com 2026-09-20
RTX 4070 12GBBonsai 2 PTQ1_0已填充 16Kq4_0PrismML 分支 7,721 MiB44.54 github.com 2026-09-20
RTX 4070 12GBBonsai 2 PTQ1_0已填充 64Kq4_0PrismML 分支 8,586 MiB30.69 github.com 2026-09-20
RTX 4070 12GBBonsai 2 PTQ1_0已填充 131Kq4_0PrismML 分支 9,918 MiB21.77 github.com 2026-09-20
RTX 3060 12GBBonsai 2 PTQ1_064K未说明未说明 7.3 GB— github.com 2026-09-19
RTX 3060 12GBBonsai 2 PTQ1_0262K未说明未说明 11.7 GB— github.com 2026-09-19
RTX 3060 12GBBonsai 2 PTQ1_0未说明未说明原版构建 —26.32 github.com 2026-09-19
RTX 2060 Super 8GBBonsai 2 PTQ1_032K未说明未说明 6.2–6.5 GB16.8 huggingface.co 2026-09-22
RTX 5060 Ti 16GBGSQ-RCO IQ3_XXS240K未说明主线 llama.cpp —~30 huggingface.co 2026-09-01
RTX 5080 16GBGSQ-RCO IQ3_S-mtp262K未说明llama.cpp 分支 ~15.36 GiB起始约 60 huggingface.co 2026-09-11

文件大小于 读取自 Hugging Face API: prism-ml/Ternary-Bonsai-2-27B-gguf、sudoingX/Ternary-Bonsai-2-27B-PTQ1_0-MTP-GGUF、ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF、unsloth/Qwen3.8-27B-GGUF。 评分和速度来自 ByteShape(2026-09-14)。 其他模型和量化类型请用 LLM 显存计算器。

使用方法

  1. 选择文件。Bonsai 2 文件需要 PrismML 的 llama.cpp 分支;GSQ-RCO 和 Unsloth UD 可以直接用主线 llama.cpp。
  2. 设置上下文长度和 KV cache 类型。q8_0 能把缓存减半,q4_0 约降到四分之一。
  3. 选择是否加载视觉投影器(mmproj);对带 MTP 层的文件,再选择是否开启 MTP。
  4. 查看总显存和 GPU 表格,然后复制 llama-server 命令。

常见问题

Qwen3.8 27B 能在 8 GB 显卡上跑吗?

只有 Ternary Bonsai 2 PTQ1_0 可以:文件 5.54 GB,加上 32K 的 q4_0 KV cache 和 1 GB 缓冲区,共 7.10 GB。有用户在 RTX 2060 Super 8GB 上以 32K 上下文运行,占用 6.2–6.5 GB,速度 16.8 token/秒。它需要 PrismML 的 llama.cpp 分支。

Ternary Bonsai 2 能在 Ollama、LM Studio 或主线 llama.cpp 中使用吗?

不能。PTQ1_0 和 PQ2_0 是新的 GGML 类型,目前只有 PrismML 的分支(PrismML-Eng/llama.cpp)实现了它们。把它们加入主线的 PR #29077 已于 2026-09-22 关闭且未合并;Ollama 和 LM Studio(GGUF 模式)也无法加载这些文件。

同样大小下,GSQ-RCO 比 Unsloth UD 更好吗?

按 ByteShape 的归一化评分,GSQ-RCO IQ3_XXS(9.40 GB)为 94.38%,Unsloth UD-IQ3_XXS(10.2 GB)为 93.59%。ISTA-DASLab 自测的 wikitext 困惑度:GSQ-RCO IQ2_XS 为 7.69,Unsloth UD-IQ2_S 为 8.02,BF16 为 7.05。GSQ-RCO IQ3_S(11.0 GB)得分 99.43%,高于 UD-IQ4_XS(13.3 GB)的 99.20%。

Bonsai 2 和 4-bit 量化相比质量如何?

ByteShape 给 PTQ1_0 的评分是 BF16 的 91.44%,PQ2_0 为 91.65%,低于 GSQ-RCO IQ2_S(93.64%)。一项独立测试测得 PQ2_0 的平均 KL 散度为 0.340,而 Unsloth UD-Q4_K_XL 为 0.0087。Bonsai 2 是重新训练的,所以 KLD 反映的是它的输出和原模型差别多大,而不是好坏。

-mtp 文件多占多少?这里的 GB 是 GB 还是 GiB?

GSQ-RCO 的 -mtp 文件大 0.32 GB(IQ3_XXS:9.40 GB,-mtp 为 9.73 GB);用 --spec-type draft-mtp 开启 MTP 后,还会多一小块草稿层的 KV cache。GB 指 GiB(字节数 ÷ 1024³),和 nvidia-smi 以及显卡显存标称使用的单位一致,全站都是如此。

更多计算器

更新于