Twoody

本地大模型计算器

适合你的 AMD 显卡的最佳本地大模型

从 RX 7600 到 RX 9070 XT:每张显卡的显存能装下的最强模型,以及它的生成速度。

你的电脑 内存 推荐:运行流畅 生成速度

Radeon RX 9070 XT (16 GB)

16 GB gpt-oss-20b 每秒 100+ 个 token

Radeon RX 9070 (16 GB)

16 GB gpt-oss-20b 每秒 100+ 个 token

Radeon RX 9060 XT (16 GB)

16 GB gpt-oss-20b 每秒 61–107 个 token

Radeon RX 9060 XT (8 GB)

8 GB Llama 3.1 8B 每秒 42–61 个 token

Radeon RX 7900 XTX (24 GB)

24 GB GLM-4.7-Flash 每秒 100+ 个 token

Radeon RX 7900 XT (20 GB)

20 GB gpt-oss-20b 每秒 100+ 个 token

Radeon RX 7900 GRE (16 GB)

16 GB gpt-oss-20b 每秒 100+ 个 token

Radeon RX 7800 XT (16 GB)

16 GB gpt-oss-20b 每秒 100+ 个 token

Radeon RX 7600 XT (16 GB)

16 GB gpt-oss-20b 每秒 46–80 个 token

Radeon RX 7600 (8 GB)

8 GB Llama 3.1 8B 每秒 36–52 个 token

以上为估算值而非实测值,依据 llama.cpp 公开基准测试计算。数据核对于 2026年9月26日。

显卡的显存决定了能装下哪些模型:16 GB 可运行 140 亿参数的模型或 gpt-oss-20b;24 GB 的 RX 7900 XTX 可运行 320 亿参数的模型。

llama.cpp 通过 Vulkan 驱动 Radeon 显卡:生成很快;读长文档则比 NVIDIA 显卡慢。

Windows 和 Linux 版 Twoody 正在内测:在 Windows 10 和 11(x64)上,驱动支持时它会通过 Vulkan 在 Radeon 显卡上运行模型,否则在处理器上运行;在 Linux 上则在处理器上运行。本页的速度是 LM Studio 或 Ollama 的速度,并非用 Twoody 实测。

关于在本地运行大模型的问题

Radeon RX 7900 XTX 适合哪个大模型?

24 GB 显存下,4 位的 Qwen3 32B 或 Gemma 4 31B 都装得下,gpt-oss-20b 等混合专家模型生成非常快。

16 GB 显存能装下什么?

4 位下最多 140 亿参数的模型,或 gpt-oss-20b,还能留出长对话的空间。

Twoody 能在配备 AMD 显卡的 Linux 上运行吗?

在内测中,Twoody 可在 Linux(x86_64)上运行,但在处理器上运行:在那里它不使用显卡。在 Windows 10 和 11(x64)上,驱动支持时它会通过 Vulkan 使用 Radeon 显卡。在平台页面留下你的邮箱,即可加入候补名单。

Twoody 正处于内测阶段。

支持 Mac、Windows 和 Linux,免费,无需账户,无需订阅;也支持 iPhone 和 Android,配合你电脑上的 Twoody 使用。留下你的电子邮件地址:Twoody 向你开放时,我们会写信通知你。