Twoody

本地大模型计算器

适合你的 NVIDIA 显卡的最佳本地大模型

从 RTX 3060 到 RTX 5090:每张显卡的显存能装下的最强模型,以及它的生成速度。

你的电脑 内存 推荐:运行流畅 生成速度

GeForce RTX 5090 (32 GB)

32 GB gpt-oss-20b 每秒 100+ 个 token

GeForce RTX 5080 (16 GB)

16 GB gpt-oss-20b 每秒 100+ 个 token

GeForce RTX 5070 Ti (16 GB)

16 GB gpt-oss-20b 每秒 100+ 个 token

GeForce RTX 5070 (12 GB)

12 GB Llama 3.1 8B 每秒 80–116 个 token

GeForce RTX 5060 Ti (16 GB)

16 GB gpt-oss-20b 每秒 82–142 个 token

GeForce RTX 5060 Ti (8 GB)

8 GB Llama 3.1 8B 每秒 57–83 个 token

GeForce RTX 5060 (8 GB)

8 GB Llama 3.1 8B 每秒 50–89 个 token

GeForce RTX 4090 (24 GB)

24 GB GLM-4.7-Flash 每秒 100+ 个 token

GeForce RTX 4080 SUPER (16 GB)

16 GB gpt-oss-20b 每秒 100+ 个 token

GeForce RTX 4080 (16 GB)

16 GB gpt-oss-20b 每秒 100+ 个 token

GeForce RTX 4070 Ti SUPER (16 GB)

16 GB gpt-oss-20b 每秒 100+ 个 token

GeForce RTX 4070 Ti (12 GB)

12 GB Llama 3.1 8B 每秒 66–95 个 token

GeForce RTX 4070 SUPER (12 GB)

12 GB Llama 3.1 8B 每秒 66–95 个 token

GeForce RTX 4070 (12 GB)

12 GB Llama 3.1 8B 每秒 58–84 个 token

GeForce RTX 4060 Ti (16 GB)

16 GB gpt-oss-20b 每秒 55–96 个 token

GeForce RTX 4060 Ti (8 GB)

8 GB Llama 3.1 8B 每秒 38–55 个 token

GeForce RTX 4060 (8 GB)

8 GB Llama 3.1 8B 每秒 31–56 个 token

GeForce RTX 3090 (24 GB)

24 GB gpt-oss-20b 每秒 100+ 个 token

GeForce RTX 3080 (10 GB)

10 GB Llama 3.1 8B 每秒 88–127 个 token

GeForce RTX 3070 (8 GB)

8 GB Llama 3.1 8B 每秒 50–72 个 token

GeForce RTX 3060 Ti (8 GB)

8 GB Llama 3.1 8B 每秒 54–78 个 token

GeForce RTX 3060 (12 GB)

12 GB Llama 3.1 8B 每秒 47–68 个 token

以上为估算值而非实测值,依据 llama.cpp 公开基准测试计算。数据核对于 2026年9月26日。

在 PC 上,显卡的显存(VRAM)是关键:8 GB 对应 40 亿到 80 亿参数的模型,16 GB 对应 140 亿参数或 gpt-oss-20b,24 到 32 GB 对应 320 亿参数。

显卡读取显存的速度非常快:只要模型装得下,它们的生成速度比任何 Mac 都快。

Windows 和 Linux 版 Twoody 正在内测:在 Windows 10 和 11(x64)上,驱动支持时它会通过 Vulkan 在 NVIDIA 显卡上运行模型,否则在处理器上运行;在 Linux 上则在处理器上运行。本页的速度是 LM Studio 或 Ollama 的速度,并非用 Twoody 实测。

关于在本地运行大模型的问题

RTX 4090 适合哪个大模型?

24 GB 显存下,4 位的 Qwen3 32B 或 Gemma 4 31B 都装得下,gpt-oss-20b 每秒能生成远超 100 个 token。

8 GB 显存的显卡够用吗?

对于 40 亿到 80 亿参数的模型,配合简短的对话,够用。更大的模型会溢出到电脑内存中,速度会大幅下降。

Twoody 能在配备 NVIDIA 显卡的 Windows 上运行吗?

在内测中可以:在 Windows 10 和 11(x64)上,驱动支持时 Twoody 会通过 Vulkan 在 NVIDIA 显卡上运行模型,否则在处理器上运行。在平台页面留下你的邮箱,即可加入候补名单。

Twoody 正处于内测阶段。

支持 Mac、Windows 和 Linux,免费,无需账户,无需订阅;也支持 iPhone 和 Android,配合你电脑上的 Twoody 使用。留下你的电子邮件地址:Twoody 向你开放时,我们会写信通知你。