Twoody

Calculadora de LLM local

Qual LLM local o seu computador consegue rodar — e com que velocidade?

Escolha seu Mac ou PC. Veja quais modelos abertos cabem na memória dele, com que velocidade escrevem, quanto tempo levam para ler um documento e para que servem.

Qual Mac eu tenho? O chip e a memória aparecem em Menu Apple › Sobre Este Mac. Em um PC: Gerenciador de Tarefas › Desempenho › GPU.

Os modelos para este computador

M5 Max com 36 GB: 30 de 36 modelos rodam bem.

O que o Twoody instala neste Mac

Qwen3 14B, instalado com um clique, para conversas de 16k tokens.

Roda com folga · 28–51 tokens/s (quase instantâneo) · 20 páginas em 14 s

Baixar para Mac com Apple Silicon

Rodam bem neste computador

GLM-4.7-Flash

Z.ai · MIT

Pelo LM Studio, Ollama ou mlx-lm

19,2 de 26 GB

Roda com folga

100+ tokens/s

parece instantâneo

20 páginas em 4 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Raciocínio
  • Agentes
Qwen3 30B-A3B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

20,1 de 26 GB

Roda com folga

89–159 tokens/s

parece instantâneo

20 páginas em 4 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Raciocínio
  • Agentes
Qwen3-Coder 30B-A3B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

20,1 de 26 GB

Roda com folga

89–159 tokens/s

parece instantâneo

20 páginas em 4 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Agentes
Qwen3.6 35B-A3B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

22,5 de 26 GB

Roda com folga

88–157 tokens/s

parece instantâneo

20 páginas em 3 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Raciocínio
  • Agentes
gpt-oss-20b

OpenAI · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

12,7 de 26 GB

Roda com folga

83–148 tokens/s

parece instantâneo

20 páginas em 4 s

  • Conversa e escrita
  • Seus documentos
  • Código
  • Raciocínio
  • Agentes
Gemma 4 26B-A4B

Google · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

17,7 de 26 GB

Roda com folga

79–142 tokens/s

parece instantâneo

20 páginas em 5 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Agentes
Mistral Small 3.2 24B

Mistral AI · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

17 de 26 GB

Roda com folga

18–33 tokens/s

quase instantâneo

20 páginas em 22 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Agentes
Devstral Small 2 24B

Mistral AI · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

17 de 26 GB

Roda com folga

18–33 tokens/s

quase instantâneo

20 páginas em 22 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Agentes
Gemma 4 31B

Google · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

19,8 de 26 GB

Roda com folga

14–26 tokens/s

quase instantâneo

20 páginas em 29 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Agentes
Qwen3.8 27B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

17,6 de 26 GB

Roda com folga

13–24 tokens/s

mais rápido que a sua leitura

20 páginas em 26 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Raciocínio
  • Agentes
Qwen3 32B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

23,8 de 26 GB

Roda com folga

13–24 tokens/s

mais rápido que a sua leitura

20 páginas em 30 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Código
  • Raciocínio
  • Agentes
Llama 3.1 8B

Meta · Llama 3.1 Community

Pelo LM Studio, Ollama ou mlx-lm

7,3 de 26 GB

Roda com folga

50–90 tokens/s

parece instantâneo

20 páginas em 7 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
Qwen3 8B

Qwen (Alibaba) · Apache 2.0

Um clique no Twoody

7,7 de 26 GB

Roda com folga

49–87 tokens/s

parece instantâneo

20 páginas em 8 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Raciocínio
DeepSeek-R1-0528-Qwen3-8B

DeepSeek · MIT

Pelo LM Studio, Ollama ou mlx-lm

7,7 de 26 GB

Roda com folga

49–87 tokens/s

parece instantâneo

20 páginas em 8 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Raciocínio
Ministral 3 8B

Mistral AI · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

7,7 de 26 GB

Roda com folga

48–85 tokens/s

parece instantâneo

20 páginas em 8 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
Qwen3.5 9B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

6,6 de 26 GB

Roda com folga

38–68 tokens/s

parece instantâneo

20 páginas em 9 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Raciocínio
Gemma 4 12B

Google · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

8,1 de 26 GB

Roda com folga

36–63 tokens/s

parece instantâneo

20 páginas em 11 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
Ministral 3 14B

Mistral AI · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

11,1 de 26 GB

Roda com folga

31–55 tokens/s

quase instantâneo

20 páginas em 13 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
Phi-4 14B

Microsoft · MIT

Pelo LM Studio, Ollama ou mlx-lm

12,3 de 26 GB

Roda com folga

29–51 tokens/s

quase instantâneo

20 páginas em 13 s

  • Conversa e escrita
  • Seus documentos
  • Raciocínio
Qwen3 14B

Qwen (Alibaba) · Apache 2.0

Um clique no Twoody

11,8 de 26 GB

Roda com folga

28–51 tokens/s

quase instantâneo

20 páginas em 14 s

  • Conversa e escrita
  • Seus documentos
  • Tradução
  • Raciocínio
Llama 3.2 3B

Meta · Llama 3.2 Community

Pelo LM Studio, Ollama ou mlx-lm

4,2 de 26 GB

Roda com folga

100+ tokens/s

parece instantâneo

20 páginas em 3 s

  • Conversa e escrita
  • Tradução
Phi-4-mini

Microsoft · MIT

Pelo LM Studio, Ollama ou mlx-lm

4,9 de 26 GB

Roda com folga

91–163 tokens/s

parece instantâneo

20 páginas em 3 s

  • Conversa e escrita
Qwen3 4B

Qwen (Alibaba) · Apache 2.0

Um clique no Twoody

5,2 de 26 GB

Roda com folga

89–159 tokens/s

parece instantâneo

20 páginas em 4 s

  • Conversa e escrita
  • Tradução
Gemma 4 E4B

Google · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

5,9 de 26 GB

Roda com folga

83–147 tokens/s

parece instantâneo

20 páginas em 4 s

  • Conversa e escrita
  • Tradução
Qwen3.5 4B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

3,7 de 26 GB

Roda com folga

74–132 tokens/s

parece instantâneo

20 páginas em 4 s

  • Conversa e escrita
  • Tradução
Qwen3 0.6B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

2,6 de 26 GB

Roda com folga

100+ tokens/s

parece instantâneo

20 páginas em 1 s

Qwen3 1.7B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

3,3 de 26 GB

Roda com folga

100+ tokens/s

parece instantâneo

20 páginas em 2 s

Gemma 4 E2B

Google · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

3,8 de 26 GB

Roda com folga

100+ tokens/s

parece instantâneo

20 páginas em 2 s

Qwen3.5 2B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

1,9 de 26 GB

Roda com folga

100+ tokens/s

parece instantâneo

20 páginas em 2 s

MiniCPM5 2B

OpenBMB · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

2,7 de 26 GB

Roda com folga

100+ tokens/s

parece instantâneo

20 páginas em 2 s

Grandes demais para este computador (6)
  • Llama 3.3 70B · 47,1 de 26 GB
  • Qwen3-Next 80B-A3B · 48,3 de 26 GB
  • gpt-oss-120b · 63,1 de 26 GB
  • Mistral Small 4 119B · 71,1 de 26 GB
  • Qwen3.5 122B-A10B · 75,7 de 26 GB
  • Qwen3 235B-A22B · 142,4 de 26 GB

Estimativas, não medições, calculadas a partir dos benchmarks públicos do llama.cpp. Números revisados em 26 de setembro de 2026.

De quanta memória você precisa para um LLM local?

A memória decide quais modelos cabem: o arquivo do modelo, mais a conversa que ele mantém em mente. O Mac deixa a GPU usar cerca de dois terços da memória até 32 GB, e três quartos acima disso. Com arquivos de 4 bits, o que roda com folga:

MemóriaRecomendado — roda com folga
8 GBLlama 3.2 3B, Phi-4-mini, Qwen3.5 4B
16 GBLlama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B
24 GBgpt-oss-20b, Llama 3.1 8B, Qwen3 8B
32 GBGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
48 GBGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
64 GBLlama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B
128 GBQwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B
256 GBQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B
512 GBQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B

Por que a largura de banda da memória define a velocidade

Para escrever cada palavra, o computador lê da memória os pesos ativos do modelo. Por isso, a velocidade acompanha mais a largura de banda da memória do que a potência do processador. Qwen3 8B, em 4 bits, em algumas máquinas:

Computador Largura de banda da memória Escreve
M1 68 GB/s 8,7–12 tokens/s
M2 100 GB/s 13–19 tokens/s
M4 120 GB/s 15–21 tokens/s
M5 153 GB/s 19–27 tokens/s
M4 Pro 273 GB/s 31–45 tokens/s
M4 Max 546 GB/s 53–76 tokens/s
M5 Max 614 GB/s 72–104 tokens/s
GeForce RTX 4090 (24 GB) 1 008 GB/s 100+ tokens/s

4 bits ou 8 bits?

Os modelos são distribuídos compactados. Arquivos de 4 bits (Q4_K_M, ou MXFP4 no gpt-oss) têm metade do tamanho dos de 8 bits, com uma pequena perda de qualidade: é o que o Twoody instala, e a escolha certa na maioria dos computadores. O de 8 bits é um pouco mais refinado e precisa do dobro de memória.

Tokens por segundo: como é na prática

Um token é um pedaço de palavra: cerca de três quartos de uma palavra em inglês, um pouco menos em português. Você lê em silêncio a cerca de 5 tokens por segundo.

menos de 5mais lento que a sua leitura
5 a 10no ritmo da sua leitura
10 a 20mais rápido que a sua leitura
20 a 50quase instantâneo
mais de 50parece instantâneo

Um modelo que pensa primeiro escreve de 300 a 3.000 tokens de raciocínio antes da resposta: a 10 tokens por segundo, de meio minuto a cinco minutos. No Twoody, os modos “Fast”, “Thinking” e “Deep” definem quanto tempo ele pensa.

A leitura de um documento

Antes de responder sobre um documento, o modelo precisa lê-lo — e é aí que os chips recentes mais ganham. Qwen3 8B lendo um documento de 20 páginas, com 16 GB:

M13 min
M476 s
M527 s

Mac ou PC?

O Mac compartilha a memória entre o processador e a GPU: um Mac de 64 GB roda modelos que nenhuma placa de vídeo de 24 GB comporta. A placa de vídeo de um PC tem menos memória, mas a lê muito rápido: com um modelo que caiba nela, uma RTX 4090 escreve mais rápido que qualquer Mac. Hoje, o Twoody roda em Macs; as versões para Windows e Linux estão em preparação.

O melhor LLM local, por computador

Método e fontes

A velocidade de cada máquina é calculada a partir da velocidade medida no modelo de referência do llama.cpp (LLaMA 2 7B, 4 bits), ajustada pelo que cada modelo lê por palavra, com as larguras de banda de memória das especificações da Apple e da NVIDIA. O cálculo foi conferido com 20 medições publicadas que não foram usadas para construí-lo: erro mediano de 4,5%, o maior de 23%, todas dentro das faixas exibidas.

Números revisados em 26 de setembro de 2026.

Fontes

Baixar os dados (JSON, CC BY 4.0)

Perguntas sobre rodar um LLM localmente

Posso rodar um LLM local com 8 GB de memória?

Sim, um pequeno: o Qwen3 4B ou o Qwen3.5 4B rodam em um Mac de 8 GB e bastam para e-mails, resumos e perguntas simples. Feche apps pesados enquanto usa. O Twoody instala o Qwen3 4B nesses Macs.

Qual LLM para um Mac com 16 GB?

Um modelo de 7 a 9 bilhões de parâmetros: o Qwen3 8B, o Qwen3.5 9B ou o Llama 3.1 8B escrevem cerca de 15 a 25 tokens por segundo nos Macs recentes e respondem bem sobre seus documentos. O Twoody instala o Qwen3 8B.

De quanta memória um modelo de 70B precisa?

Cerca de 48 GB para o arquivo de 4 bits e uma conversa curta: um Mac com 64 GB roda o Llama 3.3 70B, entre 7 e 13 tokens por segundo, dependendo do chip. Misturas de especialistas como o gpt-oss-120b precisam de mais memória, mas escrevem muito mais rápido.

Um modelo de 4 bits é muito pior que um de 8 bits?

Um pouco. Para escrever, resumir e fazer perguntas sobre documentos, a diferença é difícil de notar, e o de 4 bits usa metade da memória e dobra a velocidade. Escolha 8 bits só quando sobrar memória.

Mac ou placa de vídeo NVIDIA para um LLM local?

Uma placa de vídeo escreve mais rápido com um modelo que caiba na memória dela (8 a 32 GB); um Mac comporta modelos muito maiores na memória unificada (até 512 GB). Para uma pessoa que trabalha com documentos, um Mac com 16 a 64 GB é a escolha mais simples.

Um LLM local esquenta demais o MacBook Air?

O MacBook Air não tem ventoinha: depois de alguns minutos escrevendo sem parar, ele desacelera para não esquentar. Em respostas de tamanho normal, isso não se nota; em sessões longas, um MacBook Pro ou um Mac mini mantém a velocidade.

Preciso do LM Studio, do Ollama ou do MLX?

Não com o Twoody: ele instala um modelo e o roda com o próprio motor, o llama.cpp, com um clique. Se você já usa o LM Studio, o Ollama ou o mlx-lm, o Twoody também usa os modelos deles.

Qual é a precisão dessas estimativas?

Em 20 medições publicadas que não foram usadas para construir a fórmula, o erro mediano é de 4,5% e o maior, de 23%; todas ficaram dentro da faixa exibida. A sua velocidade também depende do app, da versão dele e do que mais o computador está fazendo.

Experimente a IA local no seu Mac, de graça.

Versão 0.12.1 · macOS 13 ou posterior · sem conta, sem assinatura. Baixe o app, instale um modelo com um clique e faça sua primeira pergunta — até offline.