Calculadora de LLM local
Qual LLM local o seu computador consegue rodar — e com que velocidade?
Escolha seu Mac ou PC. Veja quais modelos abertos cabem na memória dele, com que velocidade escrevem, quanto tempo levam para ler um documento e para que servem.
Os modelos para este computador
MacBook Pro 15″, 16″ Intel (2018–2019) com 32 GB: 30 de 36 modelos rodam bem.
O que o Twoody instala neste Mac
Qwen3 14B, instalado com um clique, para conversas de 16k tokens.
Roda com folga · 1,7–3 tokens/s (mais lento que a sua leitura) · 20 páginas em 16 min
Em um Mac com Intel, o modelo roda no processador: funciona, mas devagar.
Rodam bem neste computador
19,2 de 28 GB
Roda com folga
7,1–13 tokens/s
mais rápido que a sua leitura
20 páginas em 4 min
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Raciocínio
- Agentes
20,1 de 28 GB
Roda com folga
6,1–11 tokens/s
no ritmo da sua leitura
20 páginas em 5 min
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Raciocínio
- Agentes
20,1 de 28 GB
Roda com folga
6,1–11 tokens/s
no ritmo da sua leitura
20 páginas em 5 min
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Agentes
22,5 de 28 GB
Roda com folga
6–11 tokens/s
no ritmo da sua leitura
20 páginas em 4 min
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Raciocínio
- Agentes
12,7 de 28 GB
Roda com folga
5,1–9,1 tokens/s
no ritmo da sua leitura
20 páginas em 5 min
- Conversa e escrita
- Seus documentos
- Código
- Raciocínio
- Agentes
17,7 de 28 GB
Roda com folga
5–8,9 tokens/s
no ritmo da sua leitura
20 páginas em 6 min
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Agentes
17 de 28 GB
Roda com folga
1,1–1,9 tokens/s
mais lento que a sua leitura
20 páginas em 26 min
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Agentes
17 de 28 GB
Roda com folga
1,1–1,9 tokens/s
mais lento que a sua leitura
20 páginas em 26 min
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Agentes
19,8 de 28 GB
Roda com folga
0,8–1,5 tokens/s
mais lento que a sua leitura
20 páginas em 34 min
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Agentes
17,6 de 28 GB
Roda com folga
0,8–1,4 tokens/s
mais lento que a sua leitura
20 páginas em 31 min
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Raciocínio
- Agentes
23,8 de 28 GB
Roda com folga
0,8–1,4 tokens/s
mais lento que a sua leitura
20 páginas em 36 min
- Conversa e escrita
- Seus documentos
- Tradução
- Código
- Raciocínio
- Agentes
7,3 de 28 GB
Roda com folga
3–5,4 tokens/s
mais lento que a sua leitura
20 páginas em 9 min
- Conversa e escrita
- Seus documentos
- Tradução
7,7 de 28 GB
Roda com folga
2,9–5,3 tokens/s
mais lento que a sua leitura
20 páginas em 9 min
- Conversa e escrita
- Seus documentos
- Tradução
- Raciocínio
7,7 de 28 GB
Roda com folga
2,9–5,2 tokens/s
mais lento que a sua leitura
20 páginas em 9 min
- Conversa e escrita
- Seus documentos
- Tradução
- Raciocínio
7,7 de 28 GB
Roda com folga
2,9–5,1 tokens/s
mais lento que a sua leitura
20 páginas em 10 min
- Conversa e escrita
- Seus documentos
- Tradução
6,6 de 28 GB
Roda com folga
2,3–4,1 tokens/s
mais lento que a sua leitura
20 páginas em 11 min
- Conversa e escrita
- Seus documentos
- Tradução
- Raciocínio
8,1 de 28 GB
Roda com folga
2,1–3,8 tokens/s
mais lento que a sua leitura
20 páginas em 13 min
- Conversa e escrita
- Seus documentos
- Tradução
11,1 de 28 GB
Roda com folga
1,8–3,2 tokens/s
mais lento que a sua leitura
20 páginas em 15 min
- Conversa e escrita
- Seus documentos
- Tradução
12,3 de 28 GB
Roda com folga
1,7–3 tokens/s
mais lento que a sua leitura
20 páginas em 16 min
- Conversa e escrita
- Seus documentos
- Raciocínio
11,8 de 28 GB
Roda com folga
1,7–3 tokens/s
mais lento que a sua leitura
20 páginas em 16 min
- Conversa e escrita
- Seus documentos
- Tradução
- Raciocínio
4,2 de 28 GB
Roda com folga
7,1–13 tokens/s
mais rápido que a sua leitura
20 páginas em 4 min
- Conversa e escrita
- Tradução
4,9 de 28 GB
Roda com folga
5,8–10 tokens/s
no ritmo da sua leitura
20 páginas em 4 min
- Conversa e escrita
5,2 de 28 GB
Roda com folga
5,7–10 tokens/s
no ritmo da sua leitura
20 páginas em 4 min
- Conversa e escrita
- Tradução
5,9 de 28 GB
Roda com folga
5,3–9,5 tokens/s
no ritmo da sua leitura
20 páginas em 5 min
- Conversa e escrita
- Tradução
3,7 de 28 GB
Roda com folga
4,6–8,3 tokens/s
no ritmo da sua leitura
20 páginas em 5 min
- Conversa e escrita
- Tradução
2,6 de 28 GB
Roda com folga
20–59 tokens/s
quase instantâneo
20 páginas em 39 s
3,3 de 28 GB
Roda com folga
8,6–26 tokens/s
mais rápido que a sua leitura
20 páginas em 2 min
3,8 de 28 GB
Roda com folga
11–19 tokens/s
mais rápido que a sua leitura
20 páginas em 3 min
1,9 de 28 GB
Roda com folga
9,8–18 tokens/s
mais rápido que a sua leitura
20 páginas em 2 min
2,7 de 28 GB
Roda com folga
9,2–16 tokens/s
mais rápido que a sua leitura
20 páginas em 3 min
Grandes demais para este computador (6)
- Llama 3.3 70B · 47,1 de 28 GB
- Qwen3-Next 80B-A3B · 48,3 de 28 GB
- gpt-oss-120b · 63,1 de 28 GB
- Mistral Small 4 119B · 71,1 de 28 GB
- Qwen3.5 122B-A10B · 75,7 de 28 GB
- Qwen3 235B-A22B · 142,4 de 28 GB
Estimativas, não medições, calculadas a partir dos benchmarks públicos do llama.cpp. Números revisados em 26 de setembro de 2026.
De quanta memória você precisa para um LLM local?
A memória decide quais modelos cabem: o arquivo do modelo, mais a conversa que ele mantém em mente. O Mac deixa a GPU usar cerca de dois terços da memória até 32 GB, e três quartos acima disso. Com arquivos de 4 bits, o que roda com folga:
| Memória | Recomendado — roda com folga |
|---|---|
| 8 GB | Llama 3.2 3B, Phi-4-mini, Qwen3.5 4B |
| 16 GB | Llama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B |
| 24 GB | gpt-oss-20b, Llama 3.1 8B, Qwen3 8B |
| 32 GB | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 48 GB | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 64 GB | Llama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B |
| 128 GB | Qwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B |
| 256 GB | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
| 512 GB | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
Por que a largura de banda da memória define a velocidade
Para escrever cada palavra, o computador lê da memória os pesos ativos do modelo. Por isso, a velocidade acompanha mais a largura de banda da memória do que a potência do processador. Qwen3 8B, em 4 bits, em algumas máquinas:
| Computador | Largura de banda da memória | Escreve |
|---|---|---|
| M1 | 68 GB/s | 8,7–12 tokens/s |
| M2 | 100 GB/s | 13–19 tokens/s |
| M4 | 120 GB/s | 15–21 tokens/s |
| M5 | 153 GB/s | 19–27 tokens/s |
| M4 Pro | 273 GB/s | 31–45 tokens/s |
| M4 Max | 546 GB/s | 53–76 tokens/s |
| M5 Max | 614 GB/s | 72–104 tokens/s |
| GeForce RTX 4090 (24 GB) | 1 008 GB/s | 100+ tokens/s |
4 bits ou 8 bits?
Os modelos são distribuídos compactados. Arquivos de 4 bits (Q4_K_M, ou MXFP4 no gpt-oss) têm metade do tamanho dos de 8 bits, com uma pequena perda de qualidade: é o que o Twoody instala, e a escolha certa na maioria dos computadores. O de 8 bits é um pouco mais refinado e precisa do dobro de memória.
Tokens por segundo: como é na prática
Um token é um pedaço de palavra: cerca de três quartos de uma palavra em inglês, um pouco menos em português. Você lê em silêncio a cerca de 5 tokens por segundo.
| menos de 5 | mais lento que a sua leitura |
| 5 a 10 | no ritmo da sua leitura |
| 10 a 20 | mais rápido que a sua leitura |
| 20 a 50 | quase instantâneo |
| mais de 50 | parece instantâneo |
Um modelo que pensa primeiro escreve de 300 a 3.000 tokens de raciocínio antes da resposta: a 10 tokens por segundo, de meio minuto a cinco minutos. No Twoody, os modos “Fast”, “Thinking” e “Deep” definem quanto tempo ele pensa.
A leitura de um documento
Antes de responder sobre um documento, o modelo precisa lê-lo — e é aí que os chips recentes mais ganham. Qwen3 8B lendo um documento de 20 páginas, com 16 GB:
| M1 | 3 min |
| M4 | 76 s |
| M5 | 27 s |
Mac ou PC?
O Mac compartilha a memória entre o processador e a GPU: um Mac de 64 GB roda modelos que nenhuma placa de vídeo de 24 GB comporta. A placa de vídeo de um PC tem menos memória, mas a lê muito rápido: com um modelo que caiba nela, uma RTX 4090 escreve mais rápido que qualquer Mac. Hoje, o Twoody roda em Macs; as versões para Windows e Linux estão em preparação.
O melhor LLM local, por computador
Método e fontes
A velocidade de cada máquina é calculada a partir da velocidade medida no modelo de referência do llama.cpp (LLaMA 2 7B, 4 bits), ajustada pelo que cada modelo lê por palavra, com as larguras de banda de memória das especificações da Apple e da NVIDIA. O cálculo foi conferido com 20 medições publicadas que não foram usadas para construí-lo: erro mediano de 4,5%, o maior de 23%, todas dentro das faixas exibidas.
Números revisados em 26 de setembro de 2026.
Fontes
- www.apple.com/newsroom/
- support.apple.com/specs
- github.com/ggml-org/llama.cpp/discussions/4167
- github.com/ggml-org/llama.cpp/discussions/15013
- github.com/ggml-org/llama.cpp/discussions/10879
- github.com/ggml-org/llama.cpp/discussions/15396
- www.nvidia.com/en-us/geforce/graphics-cards/compare/
- huggingface.co/models
- www.sciencedirect.com/science/article/abs/pii/S0749596X19300786
Perguntas sobre rodar um LLM localmente
Posso rodar um LLM local com 8 GB de memória?
Sim, um pequeno: o Qwen3 4B ou o Qwen3.5 4B rodam em um Mac de 8 GB e bastam para e-mails, resumos e perguntas simples. Feche apps pesados enquanto usa. O Twoody instala o Qwen3 4B nesses Macs.
Qual LLM para um Mac com 16 GB?
Um modelo de 7 a 9 bilhões de parâmetros: o Qwen3 8B, o Qwen3.5 9B ou o Llama 3.1 8B escrevem cerca de 15 a 25 tokens por segundo nos Macs recentes e respondem bem sobre seus documentos. O Twoody instala o Qwen3 8B.
De quanta memória um modelo de 70B precisa?
Cerca de 48 GB para o arquivo de 4 bits e uma conversa curta: um Mac com 64 GB roda o Llama 3.3 70B, entre 7 e 13 tokens por segundo, dependendo do chip. Misturas de especialistas como o gpt-oss-120b precisam de mais memória, mas escrevem muito mais rápido.
Um modelo de 4 bits é muito pior que um de 8 bits?
Um pouco. Para escrever, resumir e fazer perguntas sobre documentos, a diferença é difícil de notar, e o de 4 bits usa metade da memória e dobra a velocidade. Escolha 8 bits só quando sobrar memória.
Mac ou placa de vídeo NVIDIA para um LLM local?
Uma placa de vídeo escreve mais rápido com um modelo que caiba na memória dela (8 a 32 GB); um Mac comporta modelos muito maiores na memória unificada (até 512 GB). Para uma pessoa que trabalha com documentos, um Mac com 16 a 64 GB é a escolha mais simples.
Um LLM local esquenta demais o MacBook Air?
O MacBook Air não tem ventoinha: depois de alguns minutos escrevendo sem parar, ele desacelera para não esquentar. Em respostas de tamanho normal, isso não se nota; em sessões longas, um MacBook Pro ou um Mac mini mantém a velocidade.
Preciso do LM Studio, do Ollama ou do MLX?
Não com o Twoody: ele instala um modelo e o roda com o próprio motor, o llama.cpp, com um clique. Se você já usa o LM Studio, o Ollama ou o mlx-lm, o Twoody também usa os modelos deles.
Qual é a precisão dessas estimativas?
Em 20 medições publicadas que não foram usadas para construir a fórmula, o erro mediano é de 4,5% e o maior, de 23%; todas ficaram dentro da faixa exibida. A sua velocidade também depende do app, da versão dele e do que mais o computador está fazendo.
Experimente a IA local no seu Mac, de graça.
Versão 0.12.1 · macOS 13 ou posterior · sem conta, sem assinatura. Baixe o app, instale um modelo com um clique e faça sua primeira pergunta — até offline.