What can my PC run?
页面通过浏览器(WebGL 和 WebGPU)识别你的 GPU,请你确认型号和显存,然后按与 GPU 页相同的规则(留出 0.5 GB 空闲)列出所有能装下的模型。
你的硬件
正在读取浏览器报告的 GPU 信息…
检测完全在你的浏览器中进行:不会上传任何硬件信息,检测过程也不发出任何网络请求。
浏览器报告的原始信息
- WebGL 渲染器
–- WebGPU 适配器
–
浏览器最多只报告 8 GB,请选择电脑实际的内存。用于下面的 MoE 卸载列表。
Mac 的 GPU 默认最多使用约 75% 的统一内存,可用 sudo sysctl iogpu.wired_limit_mb 调高。
能装下的模型
在 8K 上下文、单个请求下仍能装下的最高精度权重、所需显存、该精度下最长的上下文以及生成速度。大模型在前。点击精度可在显存计算器中打开对应设置。
| 模型 | 最佳精度 | 显存 | 最长上下文 | token/s |
|---|
即使用 2-bit 精度,也没有收录的模型能装下。
把专家放到系统内存后能跑的 MoE 模型
| 模型 | GGUF | --n-cpu-moe | 显存占用 | 内存占用 | token/s |
|---|
差一点能装下
以 Q4_K_M、32K 上下文装不下,但差得不多。先列缺口,再列改用什么设置能装下。
| 模型 | Q4_K_M 还差 | 改用 |
|---|
这台硬件的更多信息
检测是怎么做的,有哪些局限
页面向浏览器读取两样东西:WebGL 的 WEBGL_debug_renderer_info 扩展给出的渲染器名称(例如 “ANGLE (NVIDIA, NVIDIA GeForce RTX 4090 …)”),以及 WebGPU 的 adapter.info(厂商、架构,有时还有型号)。脚本从名称里找出显卡或芯片型号,对应到本站的 GPU 列表,然后请你确认。整个过程都在本地完成,不会发送任何数据。
浏览器能告诉网页的信息有限:没有任何浏览器会报告显存或统一内存的大小;Safari 在所有 Mac 上都只说 “Apple GPU”;Firefox 出于隐私只给出粗略的型号,后面带 “or similar”;双显卡笔记本上,浏览器常常运行在集成显卡上;navigator.deviceMemory 最多只报 8 GB。所以结果只是一个需要你确认的猜测。确认之后,所有数字都和 GPU 页用同一套规则计算:Q4_K_M 等精度、8K 上下文、留出 0.5 GB 空闲,速度是根据显存带宽给出的区间。
怎么查看显卡型号和显存
| 系统 | 命令或位置 | 能看到什么 |
|---|---|---|
| Windows | 任务管理器 > 性能 > GPU | 型号和“专用 GPU 内存” |
| Windows、Linux(NVIDIA) | nvidia-smi --query-gpu=name,memory.total --format=csv | 型号和显存总量 |
| macOS | system_profiler SPDisplaysDataType | 芯片型号和 GPU 核心数 |
| macOS | sysctl hw.memsize | 统一内存(字节) |
| Linux(AMD) | rocm-smi --showmeminfo vram | 显存总量和已用量 |
| Linux | lspci | grep -iE "vga|3d" | 装了哪些显卡(不含显存大小) |
常见显存能跑什么
每档显存以一张有独立页面的常见显卡为例,按 Q4_K_M(gpt-oss 为 MXFP4)、8K 上下文、留出 0.5 GB 计算。
| 显存 | 示例显卡 | Q4_K_M 能装下 | 最大的模型 | token/s |
|---|---|---|---|---|
| 8 GB | RTX 4060 8GB | 13 / 55 | ZDTaichu 5.0 9B | 23–32 |
| 12 GB | RTX 3060 12GB | 14 / 55 | Gemma 4 12B | 24–34 |
| 16 GB | RTX 5060 Ti 16GB | 15 / 55 | gpt-oss-20b | 48–83 |
| 24 GB | RTX 4090 | 28 / 55 | Ornith 1.5 35B-A3B | 124–226 |
| 32 GB | RTX 5090 | 29 / 55 | K2-Horizon MoVA 36B-A4B | 111–200 |
估算与公开实测相差多少,见估算准确度。示例显卡、模型页和 GPU 页目前只有英文版。
使用方法
- 打开页面,它会根据浏览器报告的信息猜测你的 GPU。不会发送任何数据。
- 核对猜测。不对就选择正确的显卡或 Mac;同一型号有多种显存时,再选显存大小。
- 设置系统内存(浏览器最多只报告 8 GB)。它决定哪些 MoE 模型能把专家放在内存里运行。
- 查看能装下的模型、差一点能装下的模型和卸载方案,再到各计算器里打开任意一个。
常见问题
我的电脑能跑哪个大模型?
主要看 GPU 显存,Mac 则看统一内存。以 Q4_K_M、8K 上下文并留出 0.5 GB 空闲计算,收录的 55 个模型中,各档能装下的最大模型是:8 GB 最大到 ZDTaichu 5.0 9B;12 GB 最大到 Gemma 4 12B;16 GB 最大到 gpt-oss-20b;24 GB 最大到 Ornith 1.5 35B-A3B;32 GB 最大到 K2-Horizon MoVA 36B-A4B。MoE 模型把部分专家放到系统内存后还能跑更大的,但速度更慢。本页会检测你的 GPU,并列出它能跑的所有模型。
Windows、Mac 和 Linux 上怎么查看显存?
Windows:任务管理器 > 性能 > GPU 里的“专用 GPU 内存”;NVIDIA 显卡可以运行 nvidia-smi --query-gpu=name,memory.total --format=csv,输出型号和显存。Mac:system_profiler SPDisplaysDataType 显示芯片型号,sysctl hw.memsize 以字节显示统一内存(苹果菜单 > 关于本机也能看到)。Linux:NVIDIA 用 nvidia-smi,AMD 用 rocm-smi --showmeminfo vram,lspci | grep -iE "vga|3d" 可以看装了哪张显卡。
为什么页面猜错了,或者要我自己选?
浏览器会隐藏一部分信息。Safari 在所有 Mac 上都只报告“Apple GPU”,Firefox 只给出粗略名称并加上“or similar”,所有浏览器都不报告显存大小,navigator.deviceMemory 最多只到 8 GB。双显卡笔记本上,浏览器也常运行在集成显卡上。所以结果只是需要你确认的猜测,而不是对硬件的读数。
会上传我的数据吗?
不会。GPU 名称来自浏览器里的 WebGL 和 WebGPU 接口,所有计算都在页面自己的 JavaScript 中完成。你的硬件信息不会被上传、保存或用于追踪。
这些估算有多准?
显存根据每个模型的真实配置和权重大小计算,另加 10% 开销和 0.5 GB 运行时;估算准确度页面把它们与公开实测做了对比。速度是根据显存带宽给出的区间,不是跑分;笔记本 GPU 也比同名桌面卡慢。
更多计算器
- 微调显存计算器 Transformers 或 Unsloth 中全参数微调、LoRA、QLoRA 需要的显存,并与公开实测对比。 打开 →
- vLLM KV cache 与并发计算器 vLLM 分配的 KV cache 池有多少 token、能同时处理多少请求,并给出 vllm serve 命令。 打开 →
- MiniMax H3 显存计算器
(ComfyUI) MiniMax H3 视频在 ComfyUI 中的显存与系统内存:剪枝版、INT8、NVFP4 和 GGUF 文件在 8–96 GB 显卡上的表现。 打开 → - MoE 卸载计算器
(--n-cpu-moe) 根据 GGUF 真实张量大小,找出能装进你显卡的最小 llama.cpp --n-cpu-moe。 打开 → - Qwen3.8 27B 新 GGUF 量化:Bonsai 2、GSQ-RCO 与 UD 对比 Qwen3.8 27B 的 Ternary Bonsai 2、GSQ-RCO 与 Unsloth UD 文件:显存、质量、速度,以及各自需要的推理引擎。 打开 →
- Qwen-Image-2.1 显存计算器 DiT、文本编码器和 VAE 各种组合的峰值显存,附真实显卡实测数据。 打开 →
更新于