LLM 速度计算器
选择模型和 GPU,设置量化精度和上下文长度,就能看到生成速度:包括显存带宽决定的理论上限,以及 llama.cpp、vLLM 等引擎在单个请求下能达到的速度区间。
高级:激活参数与多卡
如果放得下:
– token/秒
- 带宽上限
- –
- 每 token 读取量
- –
- 其中 KV cache
- –
- 生成 500 token 的回答
- –
在其他硬件上
| GPU | 带宽 | token/秒 |
|---|---|---|
| RTX 4060 8GB | 272 GB/s | – |
| RTX 3060 12GB | 360 GB/s | – |
| Arc B580 12GB | 456 GB/s | – |
| RTX 4070 12GB | 504 GB/s | – |
| RTX 5070 12GB | 672 GB/s | – |
| RTX 4060 Ti 16GB | 288 GB/s | – |
| RTX 5060 Ti 16GB | 448 GB/s | – |
| RX 9070 XT 16GB | 644 GB/s | – |
| RTX 4070 Ti Super 16GB | 672 GB/s | – |
| RTX 4080 Super 16GB | 736 GB/s | – |
| RTX 5070 Ti 16GB | 896 GB/s | – |
| RTX 5080 16GB | 960 GB/s | – |
| RTX 3090 | 936 GB/s | – |
| RTX 4090 | 1,008 GB/s | – |
| RX 7900 XTX | 960 GB/s | – |
| RTX 5090 | 1,792 GB/s | – |
| M4 Pro Mac (64 GB) 统一内存约 75% 可供 GPU 使用 | 273 GB/s | – |
| M4 Max Mac (128 GB) 统一内存约 75% 可供 GPU 使用 | 546 GB/s | – |
| M3 Ultra Mac Studio (512 GB) 统一内存约 75% 可供 GPU 使用 | 819 GB/s | – |
| Ryzen AI Max+ 395 (128 GB) 最多可分配 96 GB 给 GPU | 256 GB/s | – |
| DGX Spark (128 GB) | 273 GB/s | – |
| L40S | 864 GB/s | – |
| RTX PRO 6000 Blackwell | 1,792 GB/s | – |
| A100 80GB | 2,039 GB/s | – |
| H100 SXM | 3,350 GB/s | – |
| H200 | 4,800 GB/s | – |
| B200 | 8,000 GB/s | – |
| M1 Mac (8 GB) 统一内存约三分之二可供 GPU 使用 | 68.25 GB/s | – |
| M1 Mac (16 GB) 统一内存约三分之二可供 GPU 使用 | 68.25 GB/s | – |
| M2 or M3 Mac (8 GB) 统一内存约三分之二可供 GPU 使用 | 100 GB/s | – |
| M2 or M3 Mac (16 GB) 统一内存约三分之二可供 GPU 使用 | 100 GB/s | – |
| M2 or M3 Mac (24 GB) 统一内存约三分之二可供 GPU 使用 | 100 GB/s | – |
| M4 Mac (16 GB) 统一内存约三分之二可供 GPU 使用 | 120 GB/s | – |
| M4 Mac (24 GB) 统一内存约三分之二可供 GPU 使用 | 120 GB/s | – |
| M4 Mac (32 GB) 统一内存约三分之二可供 GPU 使用 | 120 GB/s | – |
| M5 Mac (16 GB) 统一内存约三分之二可供 GPU 使用 | 153 GB/s | – |
| M5 Mac (24 GB) 统一内存约三分之二可供 GPU 使用 | 153 GB/s | – |
| M5 Mac (32 GB) 统一内存约三分之二可供 GPU 使用 | 153 GB/s | – |
| M1 Pro or M2 Pro Mac (16 GB) 统一内存约三分之二可供 GPU 使用 | 200 GB/s | – |
| M1 Pro or M2 Pro Mac (32 GB) 统一内存约三分之二可供 GPU 使用 | 200 GB/s | – |
| M3 Pro Mac (18 GB) 统一内存约三分之二可供 GPU 使用 | 150 GB/s | – |
| M3 Pro Mac (36 GB) 统一内存约 75% 可供 GPU 使用 | 150 GB/s | – |
| M4 Pro Mac (24 GB) 统一内存约三分之二可供 GPU 使用 | 273 GB/s | – |
| M4 Pro Mac (48 GB) 统一内存约 75% 可供 GPU 使用 | 273 GB/s | – |
| M5 Pro Mac (24 GB) 统一内存约三分之二可供 GPU 使用 | 307 GB/s | – |
| M5 Pro Mac (48 GB) 统一内存约 75% 可供 GPU 使用 | 307 GB/s | – |
| M5 Pro Mac (64 GB) 统一内存约 75% 可供 GPU 使用 | 307 GB/s | – |
| M1 Max or M2 Max Mac (32 GB) 统一内存约三分之二可供 GPU 使用 | 400 GB/s | – |
| M1–M3 Max Mac (64 GB) 统一内存约 75% 可供 GPU 使用 | 400 GB/s | – |
| M2 Max Mac (96 GB) 统一内存约 75% 可供 GPU 使用 | 400 GB/s | – |
| M3 Max Mac (36 GB) 统一内存约 75% 可供 GPU 使用 | 300 GB/s | – |
| M3 Max Mac (48 GB) 统一内存约 75% 可供 GPU 使用 | 400 GB/s | – |
| M3 Max Mac (96 GB) 统一内存约 75% 可供 GPU 使用 | 300 GB/s | – |
| M3 Max Mac (128 GB) 统一内存约 75% 可供 GPU 使用 | 400 GB/s | – |
| M4 Max Mac (36 GB) 统一内存约 75% 可供 GPU 使用 | 410 GB/s | – |
| M4 Max Mac (48 GB) 统一内存约 75% 可供 GPU 使用 | 546 GB/s | – |
| M4 Max Mac (64 GB) 统一内存约 75% 可供 GPU 使用 | 546 GB/s | – |
| M5 Max Mac (36 GB) 统一内存约 75% 可供 GPU 使用 | 460 GB/s | – |
| M5 Max Mac (48 GB) 统一内存约 75% 可供 GPU 使用 | 614 GB/s | – |
| M5 Max Mac (64 GB) 统一内存约 75% 可供 GPU 使用 | 614 GB/s | – |
| M5 Max Mac (128 GB) 统一内存约 75% 可供 GPU 使用 | 614 GB/s | – |
| CPU only, DDR4-3200 dual channel (16 GB) 系统内存减去约 6 GB 留给系统和其他程序 | 51.2 GB/s | – |
| CPU only, DDR4-3200 dual channel (32 GB) 系统内存减去约 6 GB 留给系统和其他程序 | 51.2 GB/s | – |
| CPU only, DDR4-3200 dual channel (64 GB) 系统内存减去约 6 GB 留给系统和其他程序 | 51.2 GB/s | – |
| CPU only, DDR5-5600 dual channel (32 GB) 系统内存减去约 6 GB 留给系统和其他程序 | 89.6 GB/s | – |
| CPU only, DDR5-5600 dual channel (64 GB) 系统内存减去约 6 GB 留给系统和其他程序 | 89.6 GB/s | – |
| CPU only, DDR5-5600 dual channel (128 GB) 系统内存减去约 6 GB 留给系统和其他程序 | 89.6 GB/s | – |
| CPU only, DDR5-6000 dual channel (32 GB) 系统内存减去约 6 GB 留给系统和其他程序 | 96 GB/s | – |
| CPU only, DDR5-6000 dual channel (64 GB) 系统内存减去约 6 GB 留给系统和其他程序 | 96 GB/s | – |
| CPU only, DDR5-6000 dual channel (96 GB) 系统内存减去约 6 GB 留给系统和其他程序 | 96 GB/s | – |
| CPU only, DDR4-3200 quad channel (64 GB) 系统内存减去约 6 GB 留给系统和其他程序 | 102.4 GB/s | – |
| CPU only, DDR4-3200 quad channel (128 GB) 系统内存减去约 6 GB 留给系统和其他程序 | 102.4 GB/s | – |
| CPU only, DDR4-3200 quad channel (256 GB) 系统内存减去约 6 GB 留给系统和其他程序 | 102.4 GB/s | – |
热门模型的生成速度
单个请求、Q4_K_M、4,096 token 上下文下的每秒 token 数;“—”表示单卡装不下。点击模型名可查看它的显存需求(英文)。
| 模型 | RTX 3060 12GB | RTX 4090 | RTX 5090 | M4 Max Mac (128 GB) | H100 SXM |
|---|---|---|---|---|---|
| Qwen3.6 35B-A3B (MoE) | — | 129–234 | 199–382 | 76–134 | 295–612 |
| Qwen3.6 27B | — | 31–43 | 53–76 | 17–24 | 93–137 |
| Qwen3-Coder-Next (80B MoE) | — | — | — | 76–133 | 294–608 |
| Gemma 4 31B | — | 26–36 | 45–63 | 14–20 | 79–115 |
| Gemma 4 26B-A4B (MoE) | — | 92–164 | 148–274 | 53–92 | 232–458 |
| Gemma 4 E4B | 38–53 | 96–142 | 153–239 | 56–79 | 239–405 |
| GLM-4.7 Flash | — | 121–220 | 189–361 | 72–126 | 284–583 |
| Nemotron 3 Nano 30B-A3B (MoE) | — | 116–210 | 182–346 | 69–120 | 275–562 |
| gpt-oss-20b | — | 110–198 | 173–326 | 64–112 | 264–534 |
| gpt-oss-120b | — | — | — | 47–80 | 211–408 |
| Qwen3.5 9B | 32–44 | 81–119 | 132–202 | 47–66 | 211–347 |
| Llama 3.1 8B | 35–49 | 89–131 | 143–222 | 51–73 | 226–378 |
本地运行还是租用 GPU?
按需租用 RTX 4090 的中位价为每小时 $0.53,H100 为 $3.39(getdeploying.com 统计的各家服务商中位数,核对于 ;H100 的价格涵盖所有 H100 型号)。下表列出每 1,000 美元购卡预算可租用的小时数(未计电费和二手残值),以及 Qwen3.6 35B-A3B 以 Q4_K_M、4,096 token 上下文、单个请求时每百万生成 token 的租用成本。本站不列显卡售价:2026 年各渠道的零售价差别很大,请在决定前比较当前价格。同一张租用的卡并发处理多个请求时,每个 token 的成本会更低。
| GPU | 显存 | 每小时租金(中位数) | 每 1,000 美元可租小时数 | token/秒 | 每百万 token 成本 |
|---|---|---|---|---|---|
| RTX 3090 | 24 GB | $0.27 | 3,704 | 121–219 | $0.34–0.62 |
| RTX 4090 | 24 GB | $0.53 | 1,887 | 129–234 | $0.63–1.1 |
| RTX 5090 | 32 GB | $0.69 | 1,449 | 199–382 | $0.50–0.96 |
| L40S | 48 GB | $1.57 | 637 | 113–204 | $2.1–3.8 |
| RTX PRO 6000 Blackwell | 96 GB | $2.19 | 457 | 199–382 | $1.6–3.1 |
| A100 80GB | 80 GB | $1.76 | 568 | 217–423 | $1.2–2.3 |
| H100 SXM | 80 GB | $3.39 | 295 | 295–612 | $1.5–3.2 |
| H200 | 141 GB | $4.46 | 224 | 355–774 | $1.6–3.5 |
| B200 | 180 GB | $6.64 | 151 | 436–1,026 | $1.8–4.2 |
使用方法
- 选择模型,或输入 Hugging Face 模型 id(如 Qwen/Qwen3.6-35B-A3B)后点击“加载”。
- 选择你的 GPU 或 Mac,以及打算使用的权重精度。
- 设置上下文长度:对话越长,每个 token 要读取的缓存就越多。
- 查看速度区间和其他硬件的对比表。展开“高级”可以修改激活参数量,或改用多卡运行。
常见问题
大模型在我的 GPU 上每秒能生成多少 token?
按本计算器估算,Llama 3.1 8B 以 Q4_K_M 在 RTX 4090 上约为每秒 96–143 个 token。每生成一个 token,都要从显存中把激活权重和整个 KV cache 读一遍,所以速度上限等于显存带宽除以这些字节数:这里每个 token 约读取 49 亿字节,带宽 1,008 GB/s 的 RTX 4090 上限约为每秒 205 个 token。
实际的推理引擎能跑到多快?
单个请求时,llama.cpp 和 vLLM 跑稠密模型通常能达到上限的 55–75%,MoE 模型因为专家路由开销更大,一般为 30–50%;此外每个 token 还有约 0.5–1.5 ms 的 GPU kernel 启动开销,这会限制小模型在高端 GPU 上的速度。Llama 3.1 8B 的 Q4_K_M 在 RTX 4090 上约为每秒 130 个 token。
为什么 MoE 模型比它的体量看起来更快?
每个 token 只读取被路由到的专家。Qwen3-30B-A3B 的 305 亿参数中,每个 token 只读约 33 亿,所以虽然占用显存更多,生成速度却比 8B 稠密模型还快。
为什么对话越长越慢?
每生成一个新 token 都要读一遍完整的 KV cache。在 128K token 时,Llama 3.1 8B 的 FP16 缓存有 16 GB,是其 Q4_K_M 权重的三倍多,所以生成速度比对话刚开始时慢约 4.5 倍。
两张 GPU 会快一倍吗?
不完全是。使用张量并行(如 vLLM、SGLang)时,每张卡只读每层的一半,带宽上限翻倍,但每层算完后卡之间都要交换结果,计算器按每个 token 约 1–2 ms 计入。llama.cpp 默认按整层把模型分到多张卡上,能装下更大的模型,但速度大致和单卡相同。
读取提示词也遵循同样的规律吗?
不是。处理提示词(prefill)受算力而不是带宽限制,在现代 GPU 上每秒可达数百到数千个 token。本计算器算的是生成速度,也就是聊天时你能感受到的速度。
Mac 和其他统一内存设备呢?
规律相同,只是换成它们的内存带宽:M4 Max 为 546 GB/s,M3 Ultra 为 819 GB/s,Ryzen AI Max+ 395 为 256 GB/s。它们能装下比大多数 GPU 更大的模型,但生成得更慢。
我输入的内容会被上传吗?
计算在你的浏览器中进行。唯一的网络请求是加载模型时访问 Hugging Face。
更多计算器
- 微调显存计算器 Transformers 或 Unsloth 中全参数微调、LoRA、QLoRA 需要的显存,并与公开实测对比。 打开 →
- vLLM KV cache 与并发计算器 vLLM 分配的 KV cache 池有多少 token、能同时处理多少请求,并给出 vllm serve 命令。 打开 →
- 我的电脑能跑什么? 在浏览器里识别你的 GPU,列出它能跑的本地大模型,以及最佳量化和速度。 打开 →
- MiniMax H3 显存计算器
(ComfyUI) MiniMax H3 视频在 ComfyUI 中的显存与系统内存:剪枝版、INT8、NVFP4 和 GGUF 文件在 8–96 GB 显卡上的表现。 打开 → - MoE 卸载计算器
(--n-cpu-moe) 根据 GGUF 真实张量大小,找出能装进你显卡的最小 llama.cpp --n-cpu-moe。 打开 → - Qwen3.8 27B 新 GGUF 量化:Bonsai 2、GSQ-RCO 与 UD 对比 Qwen3.8 27B 的 Ternary Bonsai 2、GSQ-RCO 与 Unsloth UD 文件:显存、质量、速度,以及各自需要的推理引擎。 打开 →
更新于