Twoody

Calculadora de LLM local

O melhor LLM local para a sua placa de vídeo NVIDIA

Da RTX 3060 à RTX 5090: o modelo mais forte que cabe na memória de cada placa, e com que velocidade ele escreve.

Seu computador Memória Recomendado — roda com folga Escreve

GeForce RTX 5090 (32 GB)

32 GB gpt-oss-20b 100+ tokens/s

GeForce RTX 5080 (16 GB)

16 GB gpt-oss-20b 100+ tokens/s

GeForce RTX 5070 Ti (16 GB)

16 GB gpt-oss-20b 100+ tokens/s

GeForce RTX 5070 (12 GB)

12 GB Llama 3.1 8B 80–116 tokens/s

GeForce RTX 5060 Ti (16 GB)

16 GB gpt-oss-20b 82–142 tokens/s

GeForce RTX 5060 Ti (8 GB)

8 GB Llama 3.1 8B 57–83 tokens/s

GeForce RTX 5060 (8 GB)

8 GB Llama 3.1 8B 50–89 tokens/s

GeForce RTX 4090 (24 GB)

24 GB GLM-4.7-Flash 100+ tokens/s

GeForce RTX 4080 SUPER (16 GB)

16 GB gpt-oss-20b 100+ tokens/s

GeForce RTX 4080 (16 GB)

16 GB gpt-oss-20b 100+ tokens/s

GeForce RTX 4070 Ti SUPER (16 GB)

16 GB gpt-oss-20b 100+ tokens/s

GeForce RTX 4070 Ti (12 GB)

12 GB Llama 3.1 8B 66–95 tokens/s

GeForce RTX 4070 SUPER (12 GB)

12 GB Llama 3.1 8B 66–95 tokens/s

GeForce RTX 4070 (12 GB)

12 GB Llama 3.1 8B 58–84 tokens/s

GeForce RTX 4060 Ti (16 GB)

16 GB gpt-oss-20b 55–96 tokens/s

GeForce RTX 4060 Ti (8 GB)

8 GB Llama 3.1 8B 38–55 tokens/s

GeForce RTX 4060 (8 GB)

8 GB Llama 3.1 8B 31–56 tokens/s

GeForce RTX 3090 (24 GB)

24 GB gpt-oss-20b 100+ tokens/s

GeForce RTX 3080 (10 GB)

10 GB Llama 3.1 8B 88–127 tokens/s

GeForce RTX 3070 (8 GB)

8 GB Llama 3.1 8B 50–72 tokens/s

GeForce RTX 3060 Ti (8 GB)

8 GB Llama 3.1 8B 54–78 tokens/s

GeForce RTX 3060 (12 GB)

12 GB Llama 3.1 8B 47–68 tokens/s

Estimativas, não medições, calculadas a partir dos benchmarks públicos do llama.cpp. Números revisados em 26 de setembro de 2026.

Em um PC, quem decide é a memória da placa de vídeo (VRAM): 8 GB para modelos de 4 a 8 bilhões de parâmetros, 16 GB para 14 bilhões ou o gpt-oss-20b, 24 a 32 GB para 32 bilhões.

As placas de vídeo leem a memória muito rápido: com um modelo que caiba, elas escrevem mais rápido que qualquer Mac.

O Twoody para Windows e Linux está em preparação; a versão em testes roda os modelos no processador. Por enquanto, estas velocidades são as do LM Studio ou do Ollama.

Perguntas sobre rodar um LLM localmente

Qual LLM para uma RTX 4090?

Com 24 GB, o Qwen3 32B ou o Gemma 4 31B cabem em 4 bits, e o gpt-oss-20b escreve a bem mais de 100 tokens por segundo.

Uma placa de vídeo de 8 GB é suficiente?

Para modelos de 4 a 8 bilhões de parâmetros, sim, com uma conversa curta. Os maiores transbordam para a memória do computador e ficam muito mais lentos.

O Twoody roda no Windows com uma placa NVIDIA?

Ainda não: a versão para Windows está em preparação. Deixe seu e-mail na página de plataformas para receber um aviso quando ela estiver pronta.

Experimente a IA local no seu Mac, de graça.

Versão 0.12.1 · macOS 13 ou posterior · sem conta, sem assinatura. Baixe o app, instale um modelo com um clique e faça sua primeira pergunta — até offline.