MoE 卸载计算器(--n-cpu-moe)
选择 MoE GGUF 文件、你的 GPU、内存和上下文长度。规划器会累加从文件头读取的每层专家张量的真实大小,找出能装进显存的最小 --n-cpu-moe。
Qwen3.6 35B-A3B · UD-Q4_K_M · 20.6 GB
–
- 显存占用
- –
- 卸载专家占用的内存
- –
- KV cache
- –
- 单请求生成速度
- –
每个 --n-cpu-moe 取值
| --n-cpu-moe | 显存 | 内存 | token/秒 | 状态 |
|---|
32K 上下文下的最小 --n-cpu-moe
FP16 KV cache、单个请求、缓冲区 1 GB。内存一列是卸载专家的占用,再加上输入嵌入层。Qwen3.8 Flash Next 还会从映射文件中读取 26.8 GB 的 n-gram 表,这里未计入。
| 文件 | 大小 | 8 GB 显卡 | 12 GB 显卡 | 16 GB 显卡 | 24 GB 显卡 |
|---|---|---|---|---|---|
| Qwen3.6 35B-A3B UD-Q4_K_M | 20.6 GB | 31 · 内存 14.6 GB | 22 · 内存 10.5 GB | 13 · 内存 6.39 GB | 整体装下 |
| Qwen3.6 35B-A3B UD-IQ4_XS | 16.5 GB | 28 · 内存 10.2 GB | 17 · 内存 6.41 GB | 5 · 内存 2.24 GB | 整体装下 |
| Qwen3.6 35B-A3B Q8_0 | 34.4 GB | 35 · 内存 28.4 GB | 30 · 内存 24.4 GB | 25 · 内存 20.4 GB | 15 · 内存 12.5 GB |
| Ornith 1.5 35B-A3B Q4_K_M | 20.2 GB | 31 · 内存 14.2 GB | 22 · 内存 10.2 GB | 13 · 内存 6.20 GB | 整体装下 |
| Ornith 1.5 35B-A3B Q8_0 | 35.2 GB | 36 · 内存 29.2 GB | 31 · 内存 25.2 GB | 26 · 内存 21.2 GB | 16 · 内存 13.3 GB |
| Qwen3 30B-A3B Q4_K_M | 17.3 GB | 39 · 内存 13.3 GB | 27 · 内存 9.33 GB | 15 · 内存 5.34 GB | 整体装下 |
| Qwen3 30B-A3B Q8_0 | 30.2 GB | 44 · 内存 26.6 GB | 37 · 内存 22.4 GB | 31 · 内存 18.8 GB | 17 · 内存 10.5 GB |
| Gemma 4 26B-A4B UD-Q4_K_M | 15.8 GB | 21 · 内存 10.0 GB | 12 · 内存 6.05 GB | 3 · 内存 2.06 GB | 整体装下 |
| GLM-4.7 Flash Q4_K_M | 17.0 GB | 36 · 内存 11.9 GB | 24 · 内存 7.93 GB | 12 · 内存 3.94 GB | 整体装下 |
| GLM-4.7 Flash UD-Q4_K_XL | 16.3 GB | 35 · 内存 11.1 GB | 23 · 内存 7.24 GB | 10 · 内存 3.13 GB | 整体装下 |
| Nemotron 3 Nano 30B-A3B Q4_K_M | 22.9 GB | 41 · 内存 16.5 GB | 30 · 内存 12.2 GB | 21 · 内存 8.70 GB | 整体装下 |
| gpt-oss-20b MXFP4 | 11.3 GB | 12 · 内存 5.31 GB | 2 · 内存 1.36 GB | 整体装下 | 整体装下 |
| gpt-oss-120b MXFP4 | 59.0 GB | 34 · 内存 54.3 GB | 31 · 内存 49.6 GB | 29 · 内存 46.4 GB | 24 · 内存 38.5 GB |
| Qwen3-Coder-Next Q4_K_M | 45.2 GB | 44 · 内存 39.9 GB | 39 · 内存 35.3 GB | 35 · 内存 31.6 GB | 26 · 内存 23.6 GB |
| Qwen3-Coder-Next IQ4_XS | 39.7 GB | 42 · 内存 33.6 GB | 37 · 内存 29.6 GB | 32 · 内存 25.7 GB | 22 · 内存 17.7 GB |
| Qwen3-Coder-Next UD-Q4_K_XL | 46.2 GB | 44 · 内存 40.2 GB | 40 · 内存 36.6 GB | 35 · 内存 32.0 GB | 27 · 内存 24.8 GB |
| Qwen3.5 122B-A10B Q4_K_M | 71.3 GB | 48 · 内存 66.0 GB | 45 · 内存 61.9 GB | 42 · 内存 57.8 GB | 36 · 内存 49.7 GB |
| Qwen3.8 Flash Next UD-Q4_K_XL | 103.7 GB | 47 · 内存 70.6 GB | 45 · 内存 67.5 GB | 42 · 内存 63.1 GB | 37 · 内存 55.8 GB |
| Qwen3.8 Flash Next UD-IQ4_XS | 87.2 GB | 47 · 内存 54.6 GB | 44 · 内存 50.8 GB | 40 · 内存 46.4 GB | 33 · 内存 38.6 GB |
| Qwen3.8 Flash Next UD-IQ3_XXS | 76.3 GB | 46 · 内存 43.9 GB | 42 · 内存 40.1 GB | 37 · 内存 35.4 GB | 29 · 内存 27.9 GB |
| Qwen3.8 Flash Next UD-Q2_K_XL | 73.4 GB | 45 · 内存 40.7 GB | 41 · 内存 37.1 GB | 36 · 内存 32.6 GB | 27 · 内存 24.6 GB |
| Qwen3.8 Flash Next UD-Q3_K_XL | 83.8 GB | 47 · 内存 51.2 GB | 44 · 内存 47.7 GB | 40 · 内存 43.5 GB | 32 · 内存 35.2 GB |
| Qwen3.8 Flash Next UD-Q5_K_XL | 147.4 GB | 48 · 内存 92.2 GB | 45 · 内存 86.5 GB | 43 · 内存 82.7 GB | 39 · 内存 75.1 GB |
| Qwen3.8 Flash Next GSQ-RCO IQ3_S | 77.9 GB | 46 · 内存 44.8 GB | 43 · 内存 41.6 GB | 39 · 内存 37.5 GB | 31 · 内存 29.6 GB |
张量大小于 读取自 Hugging Face 上的 GGUF 文件头: Qwen3.6-35B-A3B-GGUF UD-Q4_K_M、Qwen3.6-35B-A3B-GGUF UD-IQ4_XS、Qwen3.6-35B-A3B-GGUF Q8_0、Ornith-1.5-35B-A3B-GGUF Q4_K_M、Ornith-1.5-35B-A3B-GGUF Q8_0、Qwen3-30B-A3B-GGUF Q4_K_M、Qwen3-30B-A3B-GGUF Q8_0、gemma-4-26B-A4B-it-GGUF UD-Q4_K_M、GLM-4.7-Flash-GGUF Q4_K_M、GLM-4.7-Flash-GGUF UD-Q4_K_XL、Nemotron-3-Nano-30B-A3B-GGUF Q4_K_M、gpt-oss-20b-GGUF MXFP4、gpt-oss-120b-GGUF MXFP4、Qwen3-Coder-Next-GGUF Q4_K_M、Qwen3-Coder-Next-GGUF IQ4_XS、Qwen3-Coder-Next-GGUF UD-Q4_K_XL、Qwen3.5-122B-A10B-GGUF Q4_K_M、Qwen3.8-Flash-Next-GGUF UD-Q4_K_XL、Qwen3.8-Flash-Next-GGUF UD-IQ4_XS、Qwen3.8-Flash-Next-GGUF UD-IQ3_XXS、Qwen3.8-Flash-Next-GGUF UD-Q2_K_XL、Qwen3.8-Flash-Next-GGUF UD-Q3_K_XL、Qwen3.8-Flash-Next-GGUF UD-Q5_K_XL、Qwen3.8-Flash-Next-GSQ-RCO-GGUF GSQ-RCO IQ3_S。 整个模型的显存请用 LLM 显存计算器;纯 GPU 运行的速度请用 LLM 速度计算器。
使用方法
- 选择模型文件。每层专家张量的大小都从它的 GGUF 文件头读取,所以 unsloth UD 这类混合量化也是精确的。
- 选择 GPU、内存速度、上下文长度和 KV cache 类型
(-ctk/-ctv)。 - 查看推荐的 --n-cpu-moe、对应的显存与内存占用以及速度区间。下方表格列出了其他所有取值。
- 复制命令运行后,检查 llama.cpp 的加载日志;默认开启的 --fit 也能自动帮你找到拆分方案。
常见问题
16 GB 显卡该怎么选 --n-cpu-moe?
选能装下的最小 N:Qwen3.6-35B-A3B UD-Q4_K_M 在 32,768 token、FP16 KV cache、1 GB 缓冲区下是 --n-cpu-moe 13,会把 5.89 GB 专家移到系统内存,占用 15.8 GB 显存。该文件有 18.2 GB 专家张量和 2.38 GB 其他权重,所以 24 GB 显卡可以整个装下。N 越大,腾给上下文的显存越多,但从较慢的系统内存读取的也越多。
--n-cpu-moe N 是做什么的?
它把前 N 层的路由专家权重(ffn_*_exps 张量)留在系统内存中,由 CPU 计算。注意力、路由器、共享专家和输出头仍在 GPU 上。该参数在 llama.cpp PR #15077(2025 年 8 月)中加入;--cpu-moe 则对所有层都这样做。
为什么卸载专家,而不是卸载整层?
每个 token 只用到少数专家,比如 Qwen3.6-35B-A3B 的 256 个专家中只用 8 个,所以 CPU 每个 token 只需读取每个卸载层约 3% 的专家数据。每个 token 都要用到的注意力和共享权重则留在高速显存里。
N 是从第一层开始数吗?
是的:按索引从第 0 层数到第 N−1 层,没有专家的层不会移动任何数据。GLM-4.7 Flash 的第一层是稠密层;Nemotron 3 Nano 的 52 层中有 29 层是没有专家的 Mamba 层或注意力层,所以 N 数到的层比实际移动的多。
--n-cpu-moe 的估算准确吗?
权重字节数是精确的。KV cache 按每个模型的配置计算,包括混合层和滑动窗口层。计算缓冲区和 CUDA 上下文是一个可调设置(默认 1 GB)。速度根据内存带宽估算,按 llama.cpp 运行 MoE 模型时通常能达到的上限 30–50% 计算。
更多计算器
- 微调显存计算器 Transformers 或 Unsloth 中全参数微调、LoRA、QLoRA 需要的显存,并与公开实测对比。 打开 →
- vLLM KV cache 与并发计算器 vLLM 分配的 KV cache 池有多少 token、能同时处理多少请求,并给出 vllm serve 命令。 打开 →
- 我的电脑能跑什么? 在浏览器里识别你的 GPU,列出它能跑的本地大模型,以及最佳量化和速度。 打开 →
- MiniMax H3 显存计算器
(ComfyUI) MiniMax H3 视频在 ComfyUI 中的显存与系统内存:剪枝版、INT8、NVFP4 和 GGUF 文件在 8–96 GB 显卡上的表现。 打开 → - Qwen3.8 27B 新 GGUF 量化:Bonsai 2、GSQ-RCO 与 UD 对比 Qwen3.8 27B 的 Ternary Bonsai 2、GSQ-RCO 与 Unsloth UD 文件:显存、质量、速度,以及各自需要的推理引擎。 打开 →
- Qwen-Image-2.1 显存计算器 DiT、文本编码器和 VAE 各种组合的峰值显存,附真实显卡实测数据。 打开 →
更新于