MoE 卸载计算器(--n-cpu-moe)

选择 MoE GGUF 文件、你的 GPU、内存和上下文长度。规划器会累加从文件头读取的每层专家张量的真实大小,找出能装进显存的最小 --n-cpu-moe。

Qwen3.6 35B-A3B · UD-Q4_K_M · 20.6 GB

–

显存占用
–
卸载专家占用的内存
–
KV cache
–
单请求生成速度
–

每个 --n-cpu-moe 取值

--n-cpu-moe显存内存token/秒状态

32K 上下文下的最小 --n-cpu-moe

FP16 KV cache、单个请求、缓冲区 1 GB。内存一列是卸载专家的占用,再加上输入嵌入层。Qwen3.8 Flash Next 还会从映射文件中读取 26.8 GB 的 n-gram 表,这里未计入。

文件大小8 GB 显卡12 GB 显卡16 GB 显卡24 GB 显卡
Qwen3.6 35B-A3B UD-Q4_K_M20.6 GB31 · 内存 14.6 GB22 · 内存 10.5 GB13 · 内存 6.39 GB整体装下
Qwen3.6 35B-A3B UD-IQ4_XS16.5 GB28 · 内存 10.2 GB17 · 内存 6.41 GB5 · 内存 2.24 GB整体装下
Qwen3.6 35B-A3B Q8_034.4 GB35 · 内存 28.4 GB30 · 内存 24.4 GB25 · 内存 20.4 GB15 · 内存 12.5 GB
Ornith 1.5 35B-A3B Q4_K_M20.2 GB31 · 内存 14.2 GB22 · 内存 10.2 GB13 · 内存 6.20 GB整体装下
Ornith 1.5 35B-A3B Q8_035.2 GB36 · 内存 29.2 GB31 · 内存 25.2 GB26 · 内存 21.2 GB16 · 内存 13.3 GB
Qwen3 30B-A3B Q4_K_M17.3 GB39 · 内存 13.3 GB27 · 内存 9.33 GB15 · 内存 5.34 GB整体装下
Qwen3 30B-A3B Q8_030.2 GB44 · 内存 26.6 GB37 · 内存 22.4 GB31 · 内存 18.8 GB17 · 内存 10.5 GB
Gemma 4 26B-A4B UD-Q4_K_M15.8 GB21 · 内存 10.0 GB12 · 内存 6.05 GB3 · 内存 2.06 GB整体装下
GLM-4.7 Flash Q4_K_M17.0 GB36 · 内存 11.9 GB24 · 内存 7.93 GB12 · 内存 3.94 GB整体装下
GLM-4.7 Flash UD-Q4_K_XL16.3 GB35 · 内存 11.1 GB23 · 内存 7.24 GB10 · 内存 3.13 GB整体装下
Nemotron 3 Nano 30B-A3B Q4_K_M22.9 GB41 · 内存 16.5 GB30 · 内存 12.2 GB21 · 内存 8.70 GB整体装下
gpt-oss-20b MXFP411.3 GB12 · 内存 5.31 GB2 · 内存 1.36 GB整体装下整体装下
gpt-oss-120b MXFP459.0 GB34 · 内存 54.3 GB31 · 内存 49.6 GB29 · 内存 46.4 GB24 · 内存 38.5 GB
Qwen3-Coder-Next Q4_K_M45.2 GB44 · 内存 39.9 GB39 · 内存 35.3 GB35 · 内存 31.6 GB26 · 内存 23.6 GB
Qwen3-Coder-Next IQ4_XS39.7 GB42 · 内存 33.6 GB37 · 内存 29.6 GB32 · 内存 25.7 GB22 · 内存 17.7 GB
Qwen3-Coder-Next UD-Q4_K_XL46.2 GB44 · 内存 40.2 GB40 · 内存 36.6 GB35 · 内存 32.0 GB27 · 内存 24.8 GB
Qwen3.5 122B-A10B Q4_K_M71.3 GB48 · 内存 66.0 GB45 · 内存 61.9 GB42 · 内存 57.8 GB36 · 内存 49.7 GB
Qwen3.8 Flash Next UD-Q4_K_XL103.7 GB47 · 内存 70.6 GB45 · 内存 67.5 GB42 · 内存 63.1 GB37 · 内存 55.8 GB
Qwen3.8 Flash Next UD-IQ4_XS87.2 GB47 · 内存 54.6 GB44 · 内存 50.8 GB40 · 内存 46.4 GB33 · 内存 38.6 GB
Qwen3.8 Flash Next UD-IQ3_XXS76.3 GB46 · 内存 43.9 GB42 · 内存 40.1 GB37 · 内存 35.4 GB29 · 内存 27.9 GB
Qwen3.8 Flash Next UD-Q2_K_XL73.4 GB45 · 内存 40.7 GB41 · 内存 37.1 GB36 · 内存 32.6 GB27 · 内存 24.6 GB
Qwen3.8 Flash Next UD-Q3_K_XL83.8 GB47 · 内存 51.2 GB44 · 内存 47.7 GB40 · 内存 43.5 GB32 · 内存 35.2 GB
Qwen3.8 Flash Next UD-Q5_K_XL147.4 GB48 · 内存 92.2 GB45 · 内存 86.5 GB43 · 内存 82.7 GB39 · 内存 75.1 GB
Qwen3.8 Flash Next GSQ-RCO IQ3_S77.9 GB46 · 内存 44.8 GB43 · 内存 41.6 GB39 · 内存 37.5 GB31 · 内存 29.6 GB

张量大小于 读取自 Hugging Face 上的 GGUF 文件头: Qwen3.6-35B-A3B-GGUF UD-Q4_K_M、Qwen3.6-35B-A3B-GGUF UD-IQ4_XS、Qwen3.6-35B-A3B-GGUF Q8_0、Ornith-1.5-35B-A3B-GGUF Q4_K_M、Ornith-1.5-35B-A3B-GGUF Q8_0、Qwen3-30B-A3B-GGUF Q4_K_M、Qwen3-30B-A3B-GGUF Q8_0、gemma-4-26B-A4B-it-GGUF UD-Q4_K_M、GLM-4.7-Flash-GGUF Q4_K_M、GLM-4.7-Flash-GGUF UD-Q4_K_XL、Nemotron-3-Nano-30B-A3B-GGUF Q4_K_M、gpt-oss-20b-GGUF MXFP4、gpt-oss-120b-GGUF MXFP4、Qwen3-Coder-Next-GGUF Q4_K_M、Qwen3-Coder-Next-GGUF IQ4_XS、Qwen3-Coder-Next-GGUF UD-Q4_K_XL、Qwen3.5-122B-A10B-GGUF Q4_K_M、Qwen3.8-Flash-Next-GGUF UD-Q4_K_XL、Qwen3.8-Flash-Next-GGUF UD-IQ4_XS、Qwen3.8-Flash-Next-GGUF UD-IQ3_XXS、Qwen3.8-Flash-Next-GGUF UD-Q2_K_XL、Qwen3.8-Flash-Next-GGUF UD-Q3_K_XL、Qwen3.8-Flash-Next-GGUF UD-Q5_K_XL、Qwen3.8-Flash-Next-GSQ-RCO-GGUF GSQ-RCO IQ3_S。 整个模型的显存请用 LLM 显存计算器;纯 GPU 运行的速度请用 LLM 速度计算器。

使用方法

  1. 选择模型文件。每层专家张量的大小都从它的 GGUF 文件头读取,所以 unsloth UD 这类混合量化也是精确的。
  2. 选择 GPU、内存速度、上下文长度和 KV cache 类型(-ctk/-ctv)。
  3. 查看推荐的 --n-cpu-moe、对应的显存与内存占用以及速度区间。下方表格列出了其他所有取值。
  4. 复制命令运行后,检查 llama.cpp 的加载日志;默认开启的 --fit 也能自动帮你找到拆分方案。

常见问题

16 GB 显卡该怎么选 --n-cpu-moe?

选能装下的最小 N:Qwen3.6-35B-A3B UD-Q4_K_M 在 32,768 token、FP16 KV cache、1 GB 缓冲区下是 --n-cpu-moe 13,会把 5.89 GB 专家移到系统内存,占用 15.8 GB 显存。该文件有 18.2 GB 专家张量和 2.38 GB 其他权重,所以 24 GB 显卡可以整个装下。N 越大,腾给上下文的显存越多,但从较慢的系统内存读取的也越多。

--n-cpu-moe N 是做什么的?

它把前 N 层的路由专家权重(ffn_*_exps 张量)留在系统内存中,由 CPU 计算。注意力、路由器、共享专家和输出头仍在 GPU 上。该参数在 llama.cpp PR #15077(2025 年 8 月)中加入;--cpu-moe 则对所有层都这样做。

为什么卸载专家,而不是卸载整层?

每个 token 只用到少数专家,比如 Qwen3.6-35B-A3B 的 256 个专家中只用 8 个,所以 CPU 每个 token 只需读取每个卸载层约 3% 的专家数据。每个 token 都要用到的注意力和共享权重则留在高速显存里。

N 是从第一层开始数吗?

是的:按索引从第 0 层数到第 N−1 层,没有专家的层不会移动任何数据。GLM-4.7 Flash 的第一层是稠密层;Nemotron 3 Nano 的 52 层中有 29 层是没有专家的 Mamba 层或注意力层,所以 N 数到的层比实际移动的多。

--n-cpu-moe 的估算准确吗?

权重字节数是精确的。KV cache 按每个模型的配置计算,包括混合层和滑动窗口层。计算缓冲区和 CUDA 上下文是一个可调设置(默认 1 GB)。速度根据内存带宽估算,按 llama.cpp 运行 MoE 模型时通常能达到的上限 30–50% 计算。

更多计算器

更新于