Calculadora de LLM local
O melhor LLM local para a sua placa de vídeo NVIDIA
Da RTX 3060 à RTX 5090: o modelo mais forte que cabe na memória de cada placa, e com que velocidade ele escreve.
| Seu computador | Memória | Recomendado — roda com folga | Escreve |
|---|---|---|---|
GeForce RTX 5090 (32 GB) |
32 GB | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 5080 (16 GB) |
16 GB | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 5070 Ti (16 GB) |
16 GB | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 5070 (12 GB) |
12 GB | Llama 3.1 8B | 80–116 tokens/s |
GeForce RTX 5060 Ti (16 GB) |
16 GB | gpt-oss-20b | 82–142 tokens/s |
GeForce RTX 5060 Ti (8 GB) |
8 GB | Llama 3.1 8B | 57–83 tokens/s |
GeForce RTX 5060 (8 GB) |
8 GB | Llama 3.1 8B | 50–89 tokens/s |
GeForce RTX 4090 (24 GB) |
24 GB | GLM-4.7-Flash | 100+ tokens/s |
GeForce RTX 4080 SUPER (16 GB) |
16 GB | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 4080 (16 GB) |
16 GB | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 4070 Ti SUPER (16 GB) |
16 GB | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 4070 Ti (12 GB) |
12 GB | Llama 3.1 8B | 66–95 tokens/s |
GeForce RTX 4070 SUPER (12 GB) |
12 GB | Llama 3.1 8B | 66–95 tokens/s |
GeForce RTX 4070 (12 GB) |
12 GB | Llama 3.1 8B | 58–84 tokens/s |
GeForce RTX 4060 Ti (16 GB) |
16 GB | gpt-oss-20b | 55–96 tokens/s |
GeForce RTX 4060 Ti (8 GB) |
8 GB | Llama 3.1 8B | 38–55 tokens/s |
GeForce RTX 4060 (8 GB) |
8 GB | Llama 3.1 8B | 31–56 tokens/s |
GeForce RTX 3090 (24 GB) |
24 GB | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 3080 (10 GB) |
10 GB | Llama 3.1 8B | 88–127 tokens/s |
GeForce RTX 3070 (8 GB) |
8 GB | Llama 3.1 8B | 50–72 tokens/s |
GeForce RTX 3060 Ti (8 GB) |
8 GB | Llama 3.1 8B | 54–78 tokens/s |
GeForce RTX 3060 (12 GB) |
12 GB | Llama 3.1 8B | 47–68 tokens/s |
Estimativas, não medições, calculadas a partir dos benchmarks públicos do llama.cpp. Números revisados em 26 de setembro de 2026.
Em um PC, quem decide é a memória da placa de vídeo (VRAM): 8 GB para modelos de 4 a 8 bilhões de parâmetros, 16 GB para 14 bilhões ou o gpt-oss-20b, 24 a 32 GB para 32 bilhões.
As placas de vídeo leem a memória muito rápido: com um modelo que caiba, elas escrevem mais rápido que qualquer Mac.
O Twoody para Windows e Linux está em preparação; a versão em testes roda os modelos no processador. Por enquanto, estas velocidades são as do LM Studio ou do Ollama.
Perguntas sobre rodar um LLM localmente
Qual LLM para uma RTX 4090?
Com 24 GB, o Qwen3 32B ou o Gemma 4 31B cabem em 4 bits, e o gpt-oss-20b escreve a bem mais de 100 tokens por segundo.
Uma placa de vídeo de 8 GB é suficiente?
Para modelos de 4 a 8 bilhões de parâmetros, sim, com uma conversa curta. Os maiores transbordam para a memória do computador e ficam muito mais lentos.
O Twoody roda no Windows com uma placa NVIDIA?
Ainda não: a versão para Windows está em preparação. Deixe seu e-mail na página de plataformas para receber um aviso quando ela estiver pronta.
O melhor LLM local, por computador
Experimente a IA local no seu Mac, de graça.
Versão 0.12.1 · macOS 13 ou posterior · sem conta, sem assinatura. Baixe o app, instale um modelo com um clique e faça sua primeira pergunta — até offline.