Calculadora de LLM local
Qual LLM local o seu computador consegue rodar — e com que velocidade?
Escolha seu Mac ou PC. Veja quais modelos abertos cabem na memória dele, com que velocidade escrevem, quanto tempo levam para ler um documento e para que servem.
Os modelos para este computador
Em um PC com Radeon RX 7900 GRE (16 GB) e 32 GB de RAM: 20 de 36 modelos rodam bem.
Twoody no PC
O Twoody para Windows e Linux está em preparação; a versão em testes roda o modelo no processador. As velocidades abaixo são as do LM Studio ou do Ollama, que usam a placa de vídeo.
Rodam bem neste computador
12,5 de 14,6 GB
Roda com folga
100+ tokens/s
parece instantâneo
12 páginas em 5 s
- Conversa e escrita
- Seus documentos
- Código
- Raciocínio
- Agentes
6,3 de 14,6 GB
Roda com folga
72–103 tokens/s
parece instantâneo
12 páginas em 5 s
- Conversa e escrita
- Seus documentos
- Tradução
6,5 de 14,6 GB
Roda com folga
70–100 tokens/s
parece instantâneo
12 páginas em 5 s
- Conversa e escrita
- Seus documentos
- Tradução
- Raciocínio
6,5 de 14,6 GB
Roda com folga
70–100 tokens/s
parece instantâneo
12 páginas em 5 s
- Conversa e escrita
- Seus documentos
- Tradução
- Raciocínio
6,6 de 14,6 GB
Roda com folga
68–98 tokens/s
parece instantâneo
12 páginas em 5 s
- Conversa e escrita
- Seus documentos
- Tradução
6,3 de 14,6 GB
Roda com folga
50–99 tokens/s
parece instantâneo
12 páginas em 6 s
- Conversa e escrita
- Seus documentos
- Tradução
- Raciocínio
8 de 14,6 GB
Roda com folga
51–73 tokens/s
parece instantâneo
12 páginas em 7 s
- Conversa e escrita
- Seus documentos
- Tradução
9,8 de 14,6 GB
Roda com folga
44–63 tokens/s
parece instantâneo
12 páginas em 8 s
- Conversa e escrita
- Seus documentos
- Tradução
10,8 de 14,6 GB
Roda com folga
41–59 tokens/s
parece instantâneo
12 páginas em 8 s
- Conversa e escrita
- Seus documentos
- Raciocínio
10,6 de 14,6 GB
Roda com folga
41–58 tokens/s
parece instantâneo
12 páginas em 8 s
- Conversa e escrita
- Seus documentos
- Tradução
- Raciocínio
3,4 de 14,6 GB
Roda com folga
100+ tokens/s
parece instantâneo
12 páginas em 2 s
- Conversa e escrita
- Tradução
3,9 de 14,6 GB
Roda com folga
100+ tokens/s
parece instantâneo
12 páginas em 2 s
- Conversa e escrita
4,1 de 14,6 GB
Roda com folga
100+ tokens/s
parece instantâneo
12 páginas em 2 s
- Conversa e escrita
- Tradução
3,4 de 14,6 GB
Roda com folga
95–191 tokens/s
parece instantâneo
12 páginas em 3 s
- Conversa e escrita
- Tradução
5,8 de 14,6 GB
Roda com folga
100+ tokens/s
parece instantâneo
12 páginas em 3 s
- Conversa e escrita
- Tradução
1,8 de 14,6 GB
Roda com folga
100+ tokens/s
parece instantâneo
12 páginas em 1 s
2,5 de 14,6 GB
Roda com folga
100+ tokens/s
parece instantâneo
12 páginas em 1 s
1,8 de 14,6 GB
Roda com folga
100+ tokens/s
parece instantâneo
12 páginas em 1 s
3,8 de 14,6 GB
Roda com folga
100+ tokens/s
parece instantâneo
12 páginas em 1 s
2,4 de 14,6 GB
Roda com folga
100+ tokens/s
parece instantâneo
12 páginas em 1 s
Rodam, mas bem mais devagar (10)
18,8 de 14,6 GB
Em parte no processador: bem mais lento
36–63 tokens/s
quase instantâneo
12 páginas em 10 s
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Raciocínio
- Agentes
17,7 de 14,6 GB
Em parte no processador: bem mais lento
31–54 tokens/s
quase instantâneo
12 páginas em 13 s
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Agentes
19,4 de 14,6 GB
Em parte no processador: bem mais lento
30–51 tokens/s
quase instantâneo
12 páginas em 11 s
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Raciocínio
- Agentes
19,4 de 14,6 GB
Em parte no processador: bem mais lento
30–51 tokens/s
quase instantâneo
12 páginas em 11 s
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Agentes
22,3 de 14,6 GB
Em parte no processador: bem mais lento
21–42 tokens/s
quase instantâneo
12 páginas em 9 s
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Raciocínio
- Agentes
15,8 de 14,6 GB
Em parte no processador: bem mais lento
13–19 tokens/s
mais rápido que a sua leitura
12 páginas em 34 s
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Agentes
15,8 de 14,6 GB
Em parte no processador: bem mais lento
13–19 tokens/s
mais rápido que a sua leitura
12 páginas em 34 s
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Agentes
17,1 de 14,6 GB
Em parte no processador: bem mais lento
5,9–12 tokens/s
no ritmo da sua leitura
12 páginas em 41 s
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Raciocínio
- Agentes
19,5 de 14,6 GB
Em parte no processador: bem mais lento
4,7–6,7 tokens/s
no ritmo da sua leitura
12 páginas em 44 s
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Agentes
21,8 de 14,6 GB
Em parte no processador: bem mais lento
3,5–5 tokens/s
mais lento que a sua leitura
12 páginas em 46 s
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Raciocínio
- Agentes
Grandes demais para este computador (6)
- Llama 3.3 70B · 44,6 de 14,6 GB
- Qwen3-Next 80B-A3B · 48,1 de 14,6 GB
- gpt-oss-120b · 62,8 de 14,6 GB
- Mistral Small 4 119B · 70,9 de 14,6 GB
- Qwen3.5 122B-A10B · 75,5 de 14,6 GB
- Qwen3 235B-A22B · 141 de 14,6 GB
Estimativas, não medições, calculadas a partir dos benchmarks públicos do llama.cpp. Números revisados em 26 de setembro de 2026.
De quanta memória você precisa para um LLM local?
A memória decide quais modelos cabem: o arquivo do modelo, mais a conversa que ele mantém em mente. O Mac deixa a GPU usar cerca de dois terços da memória até 32 GB, e três quartos acima disso. Com arquivos de 4 bits, o que roda com folga:
| Memória | Recomendado — roda com folga |
|---|---|
| 8 GB | Llama 3.2 3B, Phi-4-mini, Qwen3.5 4B |
| 16 GB | Llama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B |
| 24 GB | gpt-oss-20b, Llama 3.1 8B, Qwen3 8B |
| 32 GB | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 48 GB | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 64 GB | Llama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B |
| 128 GB | Qwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B |
| 256 GB | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
| 512 GB | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
Por que a largura de banda da memória define a velocidade
Para escrever cada palavra, o computador lê da memória os pesos ativos do modelo. Por isso, a velocidade acompanha mais a largura de banda da memória do que a potência do processador. Qwen3 8B, em 4 bits, em algumas máquinas:
| Computador | Largura de banda da memória | Escreve |
|---|---|---|
| M1 | 68 GB/s | 8,7–12 tokens/s |
| M2 | 100 GB/s | 13–19 tokens/s |
| M4 | 120 GB/s | 15–21 tokens/s |
| M5 | 153 GB/s | 19–27 tokens/s |
| M4 Pro | 273 GB/s | 31–45 tokens/s |
| M4 Max | 546 GB/s | 53–76 tokens/s |
| M5 Max | 614 GB/s | 72–104 tokens/s |
| GeForce RTX 4090 (24 GB) | 1 008 GB/s | 100+ tokens/s |
4 bits ou 8 bits?
Os modelos são distribuídos compactados. Arquivos de 4 bits (Q4_K_M, ou MXFP4 no gpt-oss) têm metade do tamanho dos de 8 bits, com uma pequena perda de qualidade: é o que o Twoody instala, e a escolha certa na maioria dos computadores. O de 8 bits é um pouco mais refinado e precisa do dobro de memória.
Tokens por segundo: como é na prática
Um token é um pedaço de palavra: cerca de três quartos de uma palavra em inglês, um pouco menos em português. Você lê em silêncio a cerca de 5 tokens por segundo.
| menos de 5 | mais lento que a sua leitura |
| 5 a 10 | no ritmo da sua leitura |
| 10 a 20 | mais rápido que a sua leitura |
| 20 a 50 | quase instantâneo |
| mais de 50 | parece instantâneo |
Um modelo que pensa primeiro escreve de 300 a 3.000 tokens de raciocínio antes da resposta: a 10 tokens por segundo, de meio minuto a cinco minutos. No Twoody, os modos “Fast”, “Thinking” e “Deep” definem quanto tempo ele pensa.
A leitura de um documento
Antes de responder sobre um documento, o modelo precisa lê-lo — e é aí que os chips recentes mais ganham. Qwen3 8B lendo um documento de 20 páginas, com 16 GB:
| M1 | 3 min |
| M4 | 76 s |
| M5 | 27 s |
Mac ou PC?
O Mac compartilha a memória entre o processador e a GPU: um Mac de 64 GB roda modelos que nenhuma placa de vídeo de 24 GB comporta. A placa de vídeo de um PC tem menos memória, mas a lê muito rápido: com um modelo que caiba nela, uma RTX 4090 escreve mais rápido que qualquer Mac. Hoje, o Twoody roda em Macs; as versões para Windows e Linux estão em preparação.
O melhor LLM local, por computador
Método e fontes
A velocidade de cada máquina é calculada a partir da velocidade medida no modelo de referência do llama.cpp (LLaMA 2 7B, 4 bits), ajustada pelo que cada modelo lê por palavra, com as larguras de banda de memória das especificações da Apple e da NVIDIA. O cálculo foi conferido com 20 medições publicadas que não foram usadas para construí-lo: erro mediano de 4,5%, o maior de 23%, todas dentro das faixas exibidas.
Números revisados em 26 de setembro de 2026.
Fontes
- www.apple.com/newsroom/
- support.apple.com/specs
- github.com/ggml-org/llama.cpp/discussions/4167
- github.com/ggml-org/llama.cpp/discussions/15013
- github.com/ggml-org/llama.cpp/discussions/10879
- github.com/ggml-org/llama.cpp/discussions/15396
- www.nvidia.com/en-us/geforce/graphics-cards/compare/
- huggingface.co/models
- www.sciencedirect.com/science/article/abs/pii/S0749596X19300786
Perguntas sobre rodar um LLM localmente
Posso rodar um LLM local com 8 GB de memória?
Sim, um pequeno: o Qwen3 4B ou o Qwen3.5 4B rodam em um Mac de 8 GB e bastam para e-mails, resumos e perguntas simples. Feche apps pesados enquanto usa. O Twoody instala o Qwen3 4B nesses Macs.
Qual LLM para um Mac com 16 GB?
Um modelo de 7 a 9 bilhões de parâmetros: o Qwen3 8B, o Qwen3.5 9B ou o Llama 3.1 8B escrevem cerca de 15 a 25 tokens por segundo nos Macs recentes e respondem bem sobre seus documentos. O Twoody instala o Qwen3 8B.
De quanta memória um modelo de 70B precisa?
Cerca de 48 GB para o arquivo de 4 bits e uma conversa curta: um Mac com 64 GB roda o Llama 3.3 70B, entre 7 e 13 tokens por segundo, dependendo do chip. Misturas de especialistas como o gpt-oss-120b precisam de mais memória, mas escrevem muito mais rápido.
Um modelo de 4 bits é muito pior que um de 8 bits?
Um pouco. Para escrever, resumir e fazer perguntas sobre documentos, a diferença é difícil de notar, e o de 4 bits usa metade da memória e dobra a velocidade. Escolha 8 bits só quando sobrar memória.
Mac ou placa de vídeo NVIDIA para um LLM local?
Uma placa de vídeo escreve mais rápido com um modelo que caiba na memória dela (8 a 32 GB); um Mac comporta modelos muito maiores na memória unificada (até 512 GB). Para uma pessoa que trabalha com documentos, um Mac com 16 a 64 GB é a escolha mais simples.
Um LLM local esquenta demais o MacBook Air?
O MacBook Air não tem ventoinha: depois de alguns minutos escrevendo sem parar, ele desacelera para não esquentar. Em respostas de tamanho normal, isso não se nota; em sessões longas, um MacBook Pro ou um Mac mini mantém a velocidade.
Preciso do LM Studio, do Ollama ou do MLX?
Não com o Twoody: ele instala um modelo e o roda com o próprio motor, o llama.cpp, com um clique. Se você já usa o LM Studio, o Ollama ou o mlx-lm, o Twoody também usa os modelos deles.
Qual é a precisão dessas estimativas?
Em 20 medições publicadas que não foram usadas para construir a fórmula, o erro mediano é de 4,5% e o maior, de 23%; todas ficaram dentro da faixa exibida. A sua velocidade também depende do app, da versão dele e do que mais o computador está fazendo.
Experimente a IA local no seu Mac, de graça.
Versão 0.12.1 · macOS 13 ou posterior · sem conta, sem assinatura. Baixe o app, instale um modelo com um clique e faça sua primeira pergunta — até offline.