本地大模型计算器
适合你的 AMD 显卡的最佳本地大模型
从 RX 7600 到 RX 9070 XT:每张显卡的显存能装下的最强模型,以及它的生成速度。
| 你的电脑 | 内存 | 推荐:运行流畅 | 生成速度 |
|---|---|---|---|
Radeon RX 9070 XT (16 GB) |
16 GB | gpt-oss-20b | 每秒 100+ 个 token |
Radeon RX 9070 (16 GB) |
16 GB | gpt-oss-20b | 每秒 100+ 个 token |
Radeon RX 9060 XT (16 GB) |
16 GB | gpt-oss-20b | 每秒 61–107 个 token |
Radeon RX 9060 XT (8 GB) |
8 GB | Llama 3.1 8B | 每秒 42–61 个 token |
Radeon RX 7900 XTX (24 GB) |
24 GB | GLM-4.7-Flash | 每秒 100+ 个 token |
Radeon RX 7900 XT (20 GB) |
20 GB | gpt-oss-20b | 每秒 100+ 个 token |
Radeon RX 7900 GRE (16 GB) |
16 GB | gpt-oss-20b | 每秒 100+ 个 token |
Radeon RX 7800 XT (16 GB) |
16 GB | gpt-oss-20b | 每秒 100+ 个 token |
Radeon RX 7600 XT (16 GB) |
16 GB | gpt-oss-20b | 每秒 46–80 个 token |
Radeon RX 7600 (8 GB) |
8 GB | Llama 3.1 8B | 每秒 36–52 个 token |
以上为估算值而非实测值,依据 llama.cpp 公开基准测试计算。数据核对于 2026年9月26日。
显卡的显存决定了能装下哪些模型:16 GB 可运行 140 亿参数的模型或 gpt-oss-20b;24 GB 的 RX 7900 XTX 可运行 320 亿参数的模型。
llama.cpp 通过 Vulkan 驱动 Radeon 显卡:生成很快;读长文档则比 NVIDIA 显卡慢。
Windows 和 Linux 版 Twoody 正在内测:在 Windows 10 和 11(x64)上,驱动支持时它会通过 Vulkan 在 Radeon 显卡上运行模型,否则在处理器上运行;在 Linux 上则在处理器上运行。本页的速度是 LM Studio 或 Ollama 的速度,并非用 Twoody 实测。
关于在本地运行大模型的问题
Radeon RX 7900 XTX 适合哪个大模型?
24 GB 显存下,4 位的 Qwen3 32B 或 Gemma 4 31B 都装得下,gpt-oss-20b 等混合专家模型生成非常快。
16 GB 显存能装下什么?
4 位下最多 140 亿参数的模型,或 gpt-oss-20b,还能留出长对话的空间。
Twoody 能在配备 AMD 显卡的 Linux 上运行吗?
在内测中,Twoody 可在 Linux(x86_64)上运行,但在处理器上运行:在那里它不使用显卡。在 Windows 10 和 11(x64)上,驱动支持时它会通过 Vulkan 使用 Radeon 显卡。在平台页面留下你的邮箱,即可加入候补名单。
按电脑分类的最佳本地大模型
Twoody 正处于内测阶段。
支持 Mac、Windows 和 Linux,免费,无需账户,无需订阅;也支持 iPhone 和 Android,配合你电脑上的 Twoody 使用。留下你的电子邮件地址:Twoody 向你开放时,我们会写信通知你。