本地大模型计算器
适合你的 NVIDIA 显卡的最佳本地大模型
从 RTX 3060 到 RTX 5090:每张显卡的显存能装下的最强模型,以及它的生成速度。
| 你的电脑 | 内存 | 推荐:运行流畅 | 生成速度 |
|---|---|---|---|
GeForce RTX 5090 (32 GB) |
32 GB | gpt-oss-20b | 每秒 100+ 个 token |
GeForce RTX 5080 (16 GB) |
16 GB | gpt-oss-20b | 每秒 100+ 个 token |
GeForce RTX 5070 Ti (16 GB) |
16 GB | gpt-oss-20b | 每秒 100+ 个 token |
GeForce RTX 5070 (12 GB) |
12 GB | Llama 3.1 8B | 每秒 80–116 个 token |
GeForce RTX 5060 Ti (16 GB) |
16 GB | gpt-oss-20b | 每秒 82–142 个 token |
GeForce RTX 5060 Ti (8 GB) |
8 GB | Llama 3.1 8B | 每秒 57–83 个 token |
GeForce RTX 5060 (8 GB) |
8 GB | Llama 3.1 8B | 每秒 50–89 个 token |
GeForce RTX 4090 (24 GB) |
24 GB | GLM-4.7-Flash | 每秒 100+ 个 token |
GeForce RTX 4080 SUPER (16 GB) |
16 GB | gpt-oss-20b | 每秒 100+ 个 token |
GeForce RTX 4080 (16 GB) |
16 GB | gpt-oss-20b | 每秒 100+ 个 token |
GeForce RTX 4070 Ti SUPER (16 GB) |
16 GB | gpt-oss-20b | 每秒 100+ 个 token |
GeForce RTX 4070 Ti (12 GB) |
12 GB | Llama 3.1 8B | 每秒 66–95 个 token |
GeForce RTX 4070 SUPER (12 GB) |
12 GB | Llama 3.1 8B | 每秒 66–95 个 token |
GeForce RTX 4070 (12 GB) |
12 GB | Llama 3.1 8B | 每秒 58–84 个 token |
GeForce RTX 4060 Ti (16 GB) |
16 GB | gpt-oss-20b | 每秒 55–96 个 token |
GeForce RTX 4060 Ti (8 GB) |
8 GB | Llama 3.1 8B | 每秒 38–55 个 token |
GeForce RTX 4060 (8 GB) |
8 GB | Llama 3.1 8B | 每秒 31–56 个 token |
GeForce RTX 3090 (24 GB) |
24 GB | gpt-oss-20b | 每秒 100+ 个 token |
GeForce RTX 3080 (10 GB) |
10 GB | Llama 3.1 8B | 每秒 88–127 个 token |
GeForce RTX 3070 (8 GB) |
8 GB | Llama 3.1 8B | 每秒 50–72 个 token |
GeForce RTX 3060 Ti (8 GB) |
8 GB | Llama 3.1 8B | 每秒 54–78 个 token |
GeForce RTX 3060 (12 GB) |
12 GB | Llama 3.1 8B | 每秒 47–68 个 token |
以上为估算值而非实测值,依据 llama.cpp 公开基准测试计算。数据核对于 2026年9月26日。
在 PC 上,显卡的显存(VRAM)是关键:8 GB 对应 40 亿到 80 亿参数的模型,16 GB 对应 140 亿参数或 gpt-oss-20b,24 到 32 GB 对应 320 亿参数。
显卡读取显存的速度非常快:只要模型装得下,它们的生成速度比任何 Mac 都快。
Windows 和 Linux 版 Twoody 正在内测:在 Windows 10 和 11(x64)上,驱动支持时它会通过 Vulkan 在 NVIDIA 显卡上运行模型,否则在处理器上运行;在 Linux 上则在处理器上运行。本页的速度是 LM Studio 或 Ollama 的速度,并非用 Twoody 实测。
关于在本地运行大模型的问题
RTX 4090 适合哪个大模型?
24 GB 显存下,4 位的 Qwen3 32B 或 Gemma 4 31B 都装得下,gpt-oss-20b 每秒能生成远超 100 个 token。
8 GB 显存的显卡够用吗?
对于 40 亿到 80 亿参数的模型,配合简短的对话,够用。更大的模型会溢出到电脑内存中,速度会大幅下降。
Twoody 能在配备 NVIDIA 显卡的 Windows 上运行吗?
在内测中可以:在 Windows 10 和 11(x64)上,驱动支持时 Twoody 会通过 Vulkan 在 NVIDIA 显卡上运行模型,否则在处理器上运行。在平台页面留下你的邮箱,即可加入候补名单。
按电脑分类的最佳本地大模型
Twoody 正处于内测阶段。
支持 Mac、Windows 和 Linux,免费,无需账户,无需订阅;也支持 iPhone 和 Android,配合你电脑上的 Twoody 使用。留下你的电子邮件地址:Twoody 向你开放时,我们会写信通知你。