LLM 速度计算器

选择模型和 GPU,设置量化精度和上下文长度,就能看到生成速度:包括显存带宽决定的理论上限,以及 llama.cpp、vLLM 等引擎在单个请求下能达到的速度区间。

高级:激活参数与多卡

– token/秒

带宽上限
–
每 token 读取量
–
其中 KV cache
–
生成 500 token 的回答
–

在其他硬件上

GPU带宽token/秒
RTX 4060 8GB 272 GB/s –
RTX 3060 12GB 360 GB/s –
Arc B580 12GB 456 GB/s –
RTX 4070 12GB 504 GB/s –
RTX 5070 12GB 672 GB/s –
RTX 4060 Ti 16GB 288 GB/s –
RTX 5060 Ti 16GB 448 GB/s –
RX 9070 XT 16GB 644 GB/s –
RTX 4070 Ti Super 16GB 672 GB/s –
RTX 4080 Super 16GB 736 GB/s –
RTX 5070 Ti 16GB 896 GB/s –
RTX 5080 16GB 960 GB/s –
RTX 3090 936 GB/s –
RTX 4090 1,008 GB/s –
RX 7900 XTX 960 GB/s –
RTX 5090 1,792 GB/s –
M4 Pro Mac (64 GB) 统一内存约 75% 可供 GPU 使用 273 GB/s –
M4 Max Mac (128 GB) 统一内存约 75% 可供 GPU 使用 546 GB/s –
M3 Ultra Mac Studio (512 GB) 统一内存约 75% 可供 GPU 使用 819 GB/s –
Ryzen AI Max+ 395 (128 GB) 最多可分配 96 GB 给 GPU 256 GB/s –
DGX Spark (128 GB) 273 GB/s –
L40S 864 GB/s –
RTX PRO 6000 Blackwell 1,792 GB/s –
A100 80GB 2,039 GB/s –
H100 SXM 3,350 GB/s –
H200 4,800 GB/s –
B200 8,000 GB/s –
M1 Mac (8 GB) 统一内存约三分之二可供 GPU 使用 68.25 GB/s –
M1 Mac (16 GB) 统一内存约三分之二可供 GPU 使用 68.25 GB/s –
M2 or M3 Mac (8 GB) 统一内存约三分之二可供 GPU 使用 100 GB/s –
M2 or M3 Mac (16 GB) 统一内存约三分之二可供 GPU 使用 100 GB/s –
M2 or M3 Mac (24 GB) 统一内存约三分之二可供 GPU 使用 100 GB/s –
M4 Mac (16 GB) 统一内存约三分之二可供 GPU 使用 120 GB/s –
M4 Mac (24 GB) 统一内存约三分之二可供 GPU 使用 120 GB/s –
M4 Mac (32 GB) 统一内存约三分之二可供 GPU 使用 120 GB/s –
M5 Mac (16 GB) 统一内存约三分之二可供 GPU 使用 153 GB/s –
M5 Mac (24 GB) 统一内存约三分之二可供 GPU 使用 153 GB/s –
M5 Mac (32 GB) 统一内存约三分之二可供 GPU 使用 153 GB/s –
M1 Pro or M2 Pro Mac (16 GB) 统一内存约三分之二可供 GPU 使用 200 GB/s –
M1 Pro or M2 Pro Mac (32 GB) 统一内存约三分之二可供 GPU 使用 200 GB/s –
M3 Pro Mac (18 GB) 统一内存约三分之二可供 GPU 使用 150 GB/s –
M3 Pro Mac (36 GB) 统一内存约 75% 可供 GPU 使用 150 GB/s –
M4 Pro Mac (24 GB) 统一内存约三分之二可供 GPU 使用 273 GB/s –
M4 Pro Mac (48 GB) 统一内存约 75% 可供 GPU 使用 273 GB/s –
M5 Pro Mac (24 GB) 统一内存约三分之二可供 GPU 使用 307 GB/s –
M5 Pro Mac (48 GB) 统一内存约 75% 可供 GPU 使用 307 GB/s –
M5 Pro Mac (64 GB) 统一内存约 75% 可供 GPU 使用 307 GB/s –
M1 Max or M2 Max Mac (32 GB) 统一内存约三分之二可供 GPU 使用 400 GB/s –
M1–M3 Max Mac (64 GB) 统一内存约 75% 可供 GPU 使用 400 GB/s –
M2 Max Mac (96 GB) 统一内存约 75% 可供 GPU 使用 400 GB/s –
M3 Max Mac (36 GB) 统一内存约 75% 可供 GPU 使用 300 GB/s –
M3 Max Mac (48 GB) 统一内存约 75% 可供 GPU 使用 400 GB/s –
M3 Max Mac (96 GB) 统一内存约 75% 可供 GPU 使用 300 GB/s –
M3 Max Mac (128 GB) 统一内存约 75% 可供 GPU 使用 400 GB/s –
M4 Max Mac (36 GB) 统一内存约 75% 可供 GPU 使用 410 GB/s –
M4 Max Mac (48 GB) 统一内存约 75% 可供 GPU 使用 546 GB/s –
M4 Max Mac (64 GB) 统一内存约 75% 可供 GPU 使用 546 GB/s –
M5 Max Mac (36 GB) 统一内存约 75% 可供 GPU 使用 460 GB/s –
M5 Max Mac (48 GB) 统一内存约 75% 可供 GPU 使用 614 GB/s –
M5 Max Mac (64 GB) 统一内存约 75% 可供 GPU 使用 614 GB/s –
M5 Max Mac (128 GB) 统一内存约 75% 可供 GPU 使用 614 GB/s –
CPU only, DDR4-3200 dual channel (16 GB) 系统内存减去约 6 GB 留给系统和其他程序 51.2 GB/s –
CPU only, DDR4-3200 dual channel (32 GB) 系统内存减去约 6 GB 留给系统和其他程序 51.2 GB/s –
CPU only, DDR4-3200 dual channel (64 GB) 系统内存减去约 6 GB 留给系统和其他程序 51.2 GB/s –
CPU only, DDR5-5600 dual channel (32 GB) 系统内存减去约 6 GB 留给系统和其他程序 89.6 GB/s –
CPU only, DDR5-5600 dual channel (64 GB) 系统内存减去约 6 GB 留给系统和其他程序 89.6 GB/s –
CPU only, DDR5-5600 dual channel (128 GB) 系统内存减去约 6 GB 留给系统和其他程序 89.6 GB/s –
CPU only, DDR5-6000 dual channel (32 GB) 系统内存减去约 6 GB 留给系统和其他程序 96 GB/s –
CPU only, DDR5-6000 dual channel (64 GB) 系统内存减去约 6 GB 留给系统和其他程序 96 GB/s –
CPU only, DDR5-6000 dual channel (96 GB) 系统内存减去约 6 GB 留给系统和其他程序 96 GB/s –
CPU only, DDR4-3200 quad channel (64 GB) 系统内存减去约 6 GB 留给系统和其他程序 102.4 GB/s –
CPU only, DDR4-3200 quad channel (128 GB) 系统内存减去约 6 GB 留给系统和其他程序 102.4 GB/s –
CPU only, DDR4-3200 quad channel (256 GB) 系统内存减去约 6 GB 留给系统和其他程序 102.4 GB/s –

热门模型的生成速度

单个请求、Q4_K_M、4,096 token 上下文下的每秒 token 数;“—”表示单卡装不下。点击模型名可查看它的显存需求(英文)。

本地运行还是租用 GPU?

按需租用 RTX 4090 的中位价为每小时 $0.53,H100 为 $3.39(getdeploying.com 统计的各家服务商中位数,核对于 ;H100 的价格涵盖所有 H100 型号)。下表列出每 1,000 美元购卡预算可租用的小时数(未计电费和二手残值),以及 Qwen3.6 35B-A3B 以 Q4_K_M、4,096 token 上下文、单个请求时每百万生成 token 的租用成本。本站不列显卡售价:2026 年各渠道的零售价差别很大,请在决定前比较当前价格。同一张租用的卡并发处理多个请求时,每个 token 的成本会更低。

使用方法

  1. 选择模型,或输入 Hugging Face 模型 id(如 Qwen/Qwen3.6-35B-A3B)后点击“加载”。
  2. 选择你的 GPU 或 Mac,以及打算使用的权重精度。
  3. 设置上下文长度:对话越长,每个 token 要读取的缓存就越多。
  4. 查看速度区间和其他硬件的对比表。展开“高级”可以修改激活参数量,或改用多卡运行。

常见问题

大模型在我的 GPU 上每秒能生成多少 token?

按本计算器估算,Llama 3.1 8B 以 Q4_K_M 在 RTX 4090 上约为每秒 96–143 个 token。每生成一个 token,都要从显存中把激活权重和整个 KV cache 读一遍,所以速度上限等于显存带宽除以这些字节数:这里每个 token 约读取 49 亿字节,带宽 1,008 GB/s 的 RTX 4090 上限约为每秒 205 个 token。

实际的推理引擎能跑到多快?

单个请求时,llama.cpp 和 vLLM 跑稠密模型通常能达到上限的 55–75%,MoE 模型因为专家路由开销更大,一般为 30–50%;此外每个 token 还有约 0.5–1.5 ms 的 GPU kernel 启动开销,这会限制小模型在高端 GPU 上的速度。Llama 3.1 8B 的 Q4_K_M 在 RTX 4090 上约为每秒 130 个 token。

为什么 MoE 模型比它的体量看起来更快?

每个 token 只读取被路由到的专家。Qwen3-30B-A3B 的 305 亿参数中,每个 token 只读约 33 亿,所以虽然占用显存更多,生成速度却比 8B 稠密模型还快。

为什么对话越长越慢?

每生成一个新 token 都要读一遍完整的 KV cache。在 128K token 时,Llama 3.1 8B 的 FP16 缓存有 16 GB,是其 Q4_K_M 权重的三倍多,所以生成速度比对话刚开始时慢约 4.5 倍。

两张 GPU 会快一倍吗?

不完全是。使用张量并行(如 vLLM、SGLang)时,每张卡只读每层的一半,带宽上限翻倍,但每层算完后卡之间都要交换结果,计算器按每个 token 约 1–2 ms 计入。llama.cpp 默认按整层把模型分到多张卡上,能装下更大的模型,但速度大致和单卡相同。

读取提示词也遵循同样的规律吗?

不是。处理提示词(prefill)受算力而不是带宽限制,在现代 GPU 上每秒可达数百到数千个 token。本计算器算的是生成速度,也就是聊天时你能感受到的速度。

Mac 和其他统一内存设备呢?

规律相同,只是换成它们的内存带宽:M4 Max 为 546 GB/s,M3 Ultra 为 819 GB/s,Ryzen AI Max+ 395 为 256 GB/s。它们能装下比大多数 GPU 更大的模型,但生成得更慢。

我输入的内容会被上传吗?

计算在你的浏览器中进行。唯一的网络请求是加载模型时访问 Hugging Face。

更多计算器

更新于