Twoody

Calculadora de LLM local

Qual LLM local o seu computador consegue rodar — e com que velocidade?

Escolha seu Mac ou PC. Veja quais modelos abertos cabem na memória dele, com que velocidade escrevem, quanto tempo levam para ler um documento e para que servem.

Qual Mac eu tenho? O chip e a memória aparecem em Menu Apple › Sobre Este Mac. Em um PC: Gerenciador de Tarefas › Desempenho › GPU.

Os modelos para este computador

M2 Max com 64 GB: 31 de 36 modelos rodam bem.

O que o Twoody instala neste Mac

Qwen3 14B, instalado com um clique, para conversas de 16k tokens.

Roda com folga · 24–35 tokens/s (quase instantâneo) · 20 páginas em 57 s

Baixar para Mac com Apple Silicon

Rodam bem neste computador

Llama 3.3 70B

Meta · Llama 3.3 Community

Pelo LM Studio, Ollama ou mlx-lm

47,1 de 47 GB

Roda — feche outros apps

5,8–8,4 tokens/s

no ritmo da sua leitura

20 páginas em 5 min

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Raciocínio
  • Agentes
gpt-oss-20b

OpenAI · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

12,7 de 47 GB

Roda com folga

62–90 tokens/s

parece instantâneo

20 páginas em 18 s

  • Conversa e escrita
  • Seus documentos
  • Código
  • Raciocínio
  • Agentes
Gemma 4 26B-A4B

Google · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

17,7 de 47 GB

Roda com folga

57–82 tokens/s

parece instantâneo

20 páginas em 19 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Agentes
GLM-4.7-Flash

Z.ai · MIT

Pelo LM Studio, Ollama ou mlx-lm

19,2 de 47 GB

Roda com folga

57–82 tokens/s

parece instantâneo

20 páginas em 15 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Raciocínio
  • Agentes
Qwen3.6 35B-A3B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

22,5 de 47 GB

Roda com folga

43–86 tokens/s

parece instantâneo

20 páginas em 13 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Raciocínio
  • Agentes
Qwen3 30B-A3B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

20,1 de 47 GB

Roda com folga

53–76 tokens/s

parece instantâneo

20 páginas em 16 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Raciocínio
  • Agentes
Qwen3-Coder 30B-A3B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

20,1 de 47 GB

Roda com folga

53–76 tokens/s

parece instantâneo

20 páginas em 16 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Agentes
Mistral Small 3.2 24B

Mistral AI · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

17 de 47 GB

Roda com folga

17–24 tokens/s

quase instantâneo

20 páginas em 2 min

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Agentes
Devstral Small 2 24B

Mistral AI · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

17 de 47 GB

Roda com folga

17–24 tokens/s

quase instantâneo

20 páginas em 2 min

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Agentes
Gemma 4 31B

Google · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

19,8 de 47 GB

Roda com folga

13–18 tokens/s

mais rápido que a sua leitura

20 páginas em 2 min

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Agentes
Qwen3.8 27B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

17,6 de 47 GB

Roda com folga

9,5–19 tokens/s

mais rápido que a sua leitura

20 páginas em 2 min

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Raciocínio
  • Agentes
Qwen3 32B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

23,8 de 47 GB

Roda com folga

12–17 tokens/s

mais rápido que a sua leitura

20 páginas em 2 min

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Raciocínio
  • Agentes
Llama 3.1 8B

Meta · Llama 3.1 Community

Pelo LM Studio, Ollama ou mlx-lm

7,3 de 47 GB

Roda com folga

41–59 tokens/s

parece instantâneo

20 páginas em 31 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
Qwen3 8B

Qwen (Alibaba) · Apache 2.0

Um clique no Twoody

7,7 de 47 GB

Roda com folga

39–56 tokens/s

quase instantâneo

20 páginas em 31 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Raciocínio
DeepSeek-R1-0528-Qwen3-8B

DeepSeek · MIT

Pelo LM Studio, Ollama ou mlx-lm

7,7 de 47 GB

Roda com folga

39–56 tokens/s

quase instantâneo

20 páginas em 31 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Raciocínio
Ministral 3 8B

Mistral AI · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

7,7 de 47 GB

Roda com folga

39–56 tokens/s

quase instantâneo

20 páginas em 34 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
Qwen3.5 9B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

6,6 de 47 GB

Roda com folga

26–51 tokens/s

quase instantâneo

20 páginas em 38 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Raciocínio
Gemma 4 12B

Google · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

8,1 de 47 GB

Roda com folga

29–41 tokens/s

quase instantâneo

20 páginas em 46 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
Ministral 3 14B

Mistral AI · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

11,1 de 47 GB

Roda com folga

26–38 tokens/s

quase instantâneo

20 páginas em 53 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
Phi-4 14B

Microsoft · MIT

Pelo LM Studio, Ollama ou mlx-lm

12,3 de 47 GB

Roda com folga

25–35 tokens/s

quase instantâneo

20 páginas em 56 s

  • Conversa e escrita
  • Seus documentos
  • Raciocínio
Qwen3 14B

Qwen (Alibaba) · Apache 2.0

Um clique no Twoody

11,8 de 47 GB

Roda com folga

24–35 tokens/s

quase instantâneo

20 páginas em 57 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Raciocínio
Llama 3.2 3B

Meta · Llama 3.2 Community

Pelo LM Studio, Ollama ou mlx-lm

4,2 de 47 GB

Roda com folga

77–111 tokens/s

parece instantâneo

20 páginas em 12 s

  • Conversa e escrita
  • Tradução
Phi-4-mini

Microsoft · MIT

Pelo LM Studio, Ollama ou mlx-lm

4,9 de 47 GB

Roda com folga

65–93 tokens/s

parece instantâneo

20 páginas em 15 s

  • Conversa e escrita
Qwen3 4B

Qwen (Alibaba) · Apache 2.0

Um clique no Twoody

5,2 de 47 GB

Roda com folga

61–88 tokens/s

parece instantâneo

20 páginas em 15 s

  • Conversa e escrita
  • Tradução
Gemma 4 E4B

Google · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

5,9 de 47 GB

Roda com folga

55–80 tokens/s

parece instantâneo

20 páginas em 17 s

  • Conversa e escrita
  • Tradução
Qwen3.5 4B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

3,7 de 47 GB

Roda com folga

43–86 tokens/s

parece instantâneo

20 páginas em 18 s

  • Conversa e escrita
  • Tradução
Qwen3 0.6B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

2,6 de 47 GB

Roda com folga

89–268 tokens/s

parece instantâneo

20 páginas em 2 s

Qwen3 1.7B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

3,3 de 47 GB

Roda com folga

65–195 tokens/s

parece instantâneo

20 páginas em 7 s

Qwen3.5 2B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

1,9 de 47 GB

Roda com folga

76–151 tokens/s

parece instantâneo

20 páginas em 8 s

Gemma 4 E2B

Google · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

3,8 de 47 GB

Roda com folga

86–124 tokens/s

parece instantâneo

20 páginas em 9 s

MiniCPM5 2B

OpenBMB · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

2,7 de 47 GB

Roda com folga

74–106 tokens/s

parece instantâneo

20 páginas em 10 s

Rodam, mas bem mais devagar (1)
Qwen3-Next 80B-A3B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

48,3 de 47 GB

Em parte no processador: bem mais lento

16–31 tokens/s

quase instantâneo

20 páginas em 33 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Raciocínio
  • Agentes
Grandes demais para este computador (4)
  • gpt-oss-120b · 63,1 de 47 GB
  • Mistral Small 4 119B · 71,1 de 47 GB
  • Qwen3.5 122B-A10B · 75,7 de 47 GB
  • Qwen3 235B-A22B · 142,4 de 47 GB

Estimativas, não medições, calculadas a partir dos benchmarks públicos do llama.cpp. Números revisados em 26 de setembro de 2026.

De quanta memória você precisa para um LLM local?

A memória decide quais modelos cabem: o arquivo do modelo, mais a conversa que ele mantém em mente. O Mac deixa a GPU usar cerca de dois terços da memória até 32 GB, e três quartos acima disso. Com arquivos de 4 bits, o que roda com folga:

MemóriaRecomendado — roda com folga
8 GBLlama 3.2 3B, Phi-4-mini, Qwen3.5 4B
16 GBLlama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B
24 GBgpt-oss-20b, Llama 3.1 8B, Qwen3 8B
32 GBGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
48 GBGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
64 GBLlama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B
128 GBQwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B
256 GBQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B
512 GBQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B

Por que a largura de banda da memória define a velocidade

Para escrever cada palavra, o computador lê da memória os pesos ativos do modelo. Por isso, a velocidade acompanha mais a largura de banda da memória do que a potência do processador. Qwen3 8B, em 4 bits, em algumas máquinas:

Computador Largura de banda da memória Escreve
M1 68 GB/s 8,7–12 tokens/s
M2 100 GB/s 13–19 tokens/s
M4 120 GB/s 15–21 tokens/s
M5 153 GB/s 19–27 tokens/s
M4 Pro 273 GB/s 31–45 tokens/s
M4 Max 546 GB/s 53–76 tokens/s
M5 Max 614 GB/s 72–104 tokens/s
GeForce RTX 4090 (24 GB) 1 008 GB/s 100+ tokens/s

4 bits ou 8 bits?

Os modelos são distribuídos compactados. Arquivos de 4 bits (Q4_K_M, ou MXFP4 no gpt-oss) têm metade do tamanho dos de 8 bits, com uma pequena perda de qualidade: é o que o Twoody instala, e a escolha certa na maioria dos computadores. O de 8 bits é um pouco mais refinado e precisa do dobro de memória.

Tokens por segundo: como é na prática

Um token é um pedaço de palavra: cerca de três quartos de uma palavra em inglês, um pouco menos em português. Você lê em silêncio a cerca de 5 tokens por segundo.

menos de 5mais lento que a sua leitura
5 a 10no ritmo da sua leitura
10 a 20mais rápido que a sua leitura
20 a 50quase instantâneo
mais de 50parece instantâneo

Um modelo que pensa primeiro escreve de 300 a 3.000 tokens de raciocínio antes da resposta: a 10 tokens por segundo, de meio minuto a cinco minutos. No Twoody, os modos “Fast”, “Thinking” e “Deep” definem quanto tempo ele pensa.

A leitura de um documento

Antes de responder sobre um documento, o modelo precisa lê-lo — e é aí que os chips recentes mais ganham. Qwen3 8B lendo um documento de 20 páginas, com 16 GB:

M13 min
M476 s
M527 s

Mac ou PC?

O Mac compartilha a memória entre o processador e a GPU: um Mac de 64 GB roda modelos que nenhuma placa de vídeo de 24 GB comporta. A placa de vídeo de um PC tem menos memória, mas a lê muito rápido: com um modelo que caiba nela, uma RTX 4090 escreve mais rápido que qualquer Mac. Hoje, o Twoody roda em Macs; as versões para Windows e Linux estão em preparação.

O melhor LLM local, por computador

Método e fontes

A velocidade de cada máquina é calculada a partir da velocidade medida no modelo de referência do llama.cpp (LLaMA 2 7B, 4 bits), ajustada pelo que cada modelo lê por palavra, com as larguras de banda de memória das especificações da Apple e da NVIDIA. O cálculo foi conferido com 20 medições publicadas que não foram usadas para construí-lo: erro mediano de 4,5%, o maior de 23%, todas dentro das faixas exibidas.

Números revisados em 26 de setembro de 2026.

Fontes

Baixar os dados (JSON, CC BY 4.0)

Perguntas sobre rodar um LLM localmente

Posso rodar um LLM local com 8 GB de memória?

Sim, um pequeno: o Qwen3 4B ou o Qwen3.5 4B rodam em um Mac de 8 GB e bastam para e-mails, resumos e perguntas simples. Feche apps pesados enquanto usa. O Twoody instala o Qwen3 4B nesses Macs.

Qual LLM para um Mac com 16 GB?

Um modelo de 7 a 9 bilhões de parâmetros: o Qwen3 8B, o Qwen3.5 9B ou o Llama 3.1 8B escrevem cerca de 15 a 25 tokens por segundo nos Macs recentes e respondem bem sobre seus documentos. O Twoody instala o Qwen3 8B.

De quanta memória um modelo de 70B precisa?

Cerca de 48 GB para o arquivo de 4 bits e uma conversa curta: um Mac com 64 GB roda o Llama 3.3 70B, entre 7 e 13 tokens por segundo, dependendo do chip. Misturas de especialistas como o gpt-oss-120b precisam de mais memória, mas escrevem muito mais rápido.

Um modelo de 4 bits é muito pior que um de 8 bits?

Um pouco. Para escrever, resumir e fazer perguntas sobre documentos, a diferença é difícil de notar, e o de 4 bits usa metade da memória e dobra a velocidade. Escolha 8 bits só quando sobrar memória.

Mac ou placa de vídeo NVIDIA para um LLM local?

Uma placa de vídeo escreve mais rápido com um modelo que caiba na memória dela (8 a 32 GB); um Mac comporta modelos muito maiores na memória unificada (até 512 GB). Para uma pessoa que trabalha com documentos, um Mac com 16 a 64 GB é a escolha mais simples.

Um LLM local esquenta demais o MacBook Air?

O MacBook Air não tem ventoinha: depois de alguns minutos escrevendo sem parar, ele desacelera para não esquentar. Em respostas de tamanho normal, isso não se nota; em sessões longas, um MacBook Pro ou um Mac mini mantém a velocidade.

Preciso do LM Studio, do Ollama ou do MLX?

Não com o Twoody: ele instala um modelo e o roda com o próprio motor, o llama.cpp, com um clique. Se você já usa o LM Studio, o Ollama ou o mlx-lm, o Twoody também usa os modelos deles.

Qual é a precisão dessas estimativas?

Em 20 medições publicadas que não foram usadas para construir a fórmula, o erro mediano é de 4,5% e o maior, de 23%; todas ficaram dentro da faixa exibida. A sua velocidade também depende do app, da versão dele e do que mais o computador está fazendo.

Experimente a IA local no seu Mac, de graça.

Versão 0.12.1 · macOS 13 ou posterior · sem conta, sem assinatura. Baixe o app, instale um modelo com um clique e faça sua primeira pergunta — até offline.