Twoody

Calculadora de LLM local

Qual LLM local o seu computador consegue rodar — e com que velocidade?

Escolha seu Mac ou PC. Veja quais modelos abertos cabem na memória dele, com que velocidade escrevem, quanto tempo levam para ler um documento e para que servem.

Qual Mac eu tenho? O chip e a memória aparecem em Menu Apple › Sobre Este Mac. Em um PC: Gerenciador de Tarefas › Desempenho › GPU.

Os modelos para este computador

M2 com 8 GB: 9 de 36 modelos rodam bem.

O que o Twoody instala neste Mac

Qwen3 4B, instalado com um clique, para conversas de 8k tokens.

Roda — feche outros apps · 25–37 tokens/s (quase instantâneo) · 12 páginas em 31 s

Baixar para Mac com Apple Silicon

Rodam bem neste computador

Llama 3.2 3B

Meta · Llama 3.2 Community

Pelo LM Studio, Ollama ou mlx-lm

3,4 de 4,3 GB

Roda com folga

32–45 tokens/s

quase instantâneo

12 páginas em 25 s

  • Conversa e escrita
  • Tradução
Phi-4-mini

Microsoft · MIT

Pelo LM Studio, Ollama ou mlx-lm

3,9 de 4,3 GB

Roda com folga

26–37 tokens/s

quase instantâneo

12 páginas em 30 s

  • Conversa e escrita
Qwen3 4B

Qwen (Alibaba) · Apache 2.0

Um clique no Twoody

4,1 de 4,3 GB

Roda — feche outros apps

25–37 tokens/s

quase instantâneo

12 páginas em 31 s

  • Conversa e escrita
  • Tradução
Qwen3.5 4B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

3,4 de 4,3 GB

Roda com folga

17–34 tokens/s

quase instantâneo

12 páginas em 39 s

  • Conversa e escrita
  • Tradução
Qwen3 0.6B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

1,8 de 4,3 GB

Roda com folga

79–237 tokens/s

parece instantâneo

12 páginas em 5 s

Qwen3 1.7B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

2,5 de 4,3 GB

Roda com folga

34–102 tokens/s

parece instantâneo

12 páginas em 13 s

Gemma 4 E2B

Google · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

3,8 de 4,3 GB

Roda com folga

47–68 tokens/s

parece instantâneo

12 páginas em 18 s

Qwen3.5 2B

Qwen (Alibaba) · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

1,8 de 4,3 GB

Roda com folga

36–72 tokens/s

parece instantâneo

12 páginas em 17 s

MiniCPM5 2B

OpenBMB · Apache 2.0

Pelo LM Studio, Ollama ou mlx-lm

2,4 de 4,3 GB

Roda com folga

42–60 tokens/s

parece instantâneo

12 páginas em 20 s

Grandes demais para este computador (27)
  • Gemma 4 E4B · 5,8 de 4,3 GB
  • Qwen3.5 9B · 6,3 de 4,3 GB
  • Llama 3.1 8B · 6,3 de 4,3 GB
  • Qwen3 8B · 6,5 de 4,3 GB
  • DeepSeek-R1-0528-Qwen3-8B · 6,5 de 4,3 GB
  • Ministral 3 8B · 6,6 de 4,3 GB
  • Gemma 4 12B · 8 de 4,3 GB
  • Ministral 3 14B · 9,8 de 4,3 GB
  • Qwen3 14B · 10,6 de 4,3 GB
  • Phi-4 14B · 10,8 de 4,3 GB
  • gpt-oss-20b · 12,5 de 4,3 GB
  • Devstral Small 2 24B · 15,8 de 4,3 GB
  • Mistral Small 3.2 24B · 15,8 de 4,3 GB
  • Qwen3.8 27B · 17,1 de 4,3 GB
  • Gemma 4 26B-A4B · 17,7 de 4,3 GB
  • GLM-4.7-Flash · 18,8 de 4,3 GB
  • Qwen3-Coder 30B-A3B · 19,4 de 4,3 GB
  • Qwen3 30B-A3B · 19,4 de 4,3 GB
  • Gemma 4 31B · 19,5 de 4,3 GB
  • Qwen3 32B · 21,8 de 4,3 GB
  • Qwen3.6 35B-A3B · 22,3 de 4,3 GB
  • Llama 3.3 70B · 44,6 de 4,3 GB
  • Qwen3-Next 80B-A3B · 48,1 de 4,3 GB
  • gpt-oss-120b · 62,8 de 4,3 GB
  • Mistral Small 4 119B · 70,9 de 4,3 GB
  • Qwen3.5 122B-A10B · 75,5 de 4,3 GB
  • Qwen3 235B-A22B · 141 de 4,3 GB

Estimativas, não medições, calculadas a partir dos benchmarks públicos do llama.cpp. Números revisados em 26 de setembro de 2026.

De quanta memória você precisa para um LLM local?

A memória decide quais modelos cabem: o arquivo do modelo, mais a conversa que ele mantém em mente. O Mac deixa a GPU usar cerca de dois terços da memória até 32 GB, e três quartos acima disso. Com arquivos de 4 bits, o que roda com folga:

MemóriaRecomendado — roda com folga
8 GBLlama 3.2 3B, Phi-4-mini, Qwen3.5 4B
16 GBLlama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B
24 GBgpt-oss-20b, Llama 3.1 8B, Qwen3 8B
32 GBGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
48 GBGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
64 GBLlama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B
128 GBQwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B
256 GBQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B
512 GBQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B

Por que a largura de banda da memória define a velocidade

Para escrever cada palavra, o computador lê da memória os pesos ativos do modelo. Por isso, a velocidade acompanha mais a largura de banda da memória do que a potência do processador. Qwen3 8B, em 4 bits, em algumas máquinas:

Computador Largura de banda da memória Escreve
M1 68 GB/s 8,7–12 tokens/s
M2 100 GB/s 13–19 tokens/s
M4 120 GB/s 15–21 tokens/s
M5 153 GB/s 19–27 tokens/s
M4 Pro 273 GB/s 31–45 tokens/s
M4 Max 546 GB/s 53–76 tokens/s
M5 Max 614 GB/s 72–104 tokens/s
GeForce RTX 4090 (24 GB) 1 008 GB/s 100+ tokens/s

4 bits ou 8 bits?

Os modelos são distribuídos compactados. Arquivos de 4 bits (Q4_K_M, ou MXFP4 no gpt-oss) têm metade do tamanho dos de 8 bits, com uma pequena perda de qualidade: é o que o Twoody instala, e a escolha certa na maioria dos computadores. O de 8 bits é um pouco mais refinado e precisa do dobro de memória.

Tokens por segundo: como é na prática

Um token é um pedaço de palavra: cerca de três quartos de uma palavra em inglês, um pouco menos em português. Você lê em silêncio a cerca de 5 tokens por segundo.

menos de 5mais lento que a sua leitura
5 a 10no ritmo da sua leitura
10 a 20mais rápido que a sua leitura
20 a 50quase instantâneo
mais de 50parece instantâneo

Um modelo que pensa primeiro escreve de 300 a 3.000 tokens de raciocínio antes da resposta: a 10 tokens por segundo, de meio minuto a cinco minutos. No Twoody, os modos “Fast”, “Thinking” e “Deep” definem quanto tempo ele pensa.

A leitura de um documento

Antes de responder sobre um documento, o modelo precisa lê-lo — e é aí que os chips recentes mais ganham. Qwen3 8B lendo um documento de 20 páginas, com 16 GB:

M13 min
M476 s
M527 s

Mac ou PC?

O Mac compartilha a memória entre o processador e a GPU: um Mac de 64 GB roda modelos que nenhuma placa de vídeo de 24 GB comporta. A placa de vídeo de um PC tem menos memória, mas a lê muito rápido: com um modelo que caiba nela, uma RTX 4090 escreve mais rápido que qualquer Mac. Hoje, o Twoody roda em Macs; as versões para Windows e Linux estão em preparação.

O melhor LLM local, por computador

Método e fontes

A velocidade de cada máquina é calculada a partir da velocidade medida no modelo de referência do llama.cpp (LLaMA 2 7B, 4 bits), ajustada pelo que cada modelo lê por palavra, com as larguras de banda de memória das especificações da Apple e da NVIDIA. O cálculo foi conferido com 20 medições publicadas que não foram usadas para construí-lo: erro mediano de 4,5%, o maior de 23%, todas dentro das faixas exibidas.

Números revisados em 26 de setembro de 2026.

Fontes

Baixar os dados (JSON, CC BY 4.0)

Perguntas sobre rodar um LLM localmente

Posso rodar um LLM local com 8 GB de memória?

Sim, um pequeno: o Qwen3 4B ou o Qwen3.5 4B rodam em um Mac de 8 GB e bastam para e-mails, resumos e perguntas simples. Feche apps pesados enquanto usa. O Twoody instala o Qwen3 4B nesses Macs.

Qual LLM para um Mac com 16 GB?

Um modelo de 7 a 9 bilhões de parâmetros: o Qwen3 8B, o Qwen3.5 9B ou o Llama 3.1 8B escrevem cerca de 15 a 25 tokens por segundo nos Macs recentes e respondem bem sobre seus documentos. O Twoody instala o Qwen3 8B.

De quanta memória um modelo de 70B precisa?

Cerca de 48 GB para o arquivo de 4 bits e uma conversa curta: um Mac com 64 GB roda o Llama 3.3 70B, entre 7 e 13 tokens por segundo, dependendo do chip. Misturas de especialistas como o gpt-oss-120b precisam de mais memória, mas escrevem muito mais rápido.

Um modelo de 4 bits é muito pior que um de 8 bits?

Um pouco. Para escrever, resumir e fazer perguntas sobre documentos, a diferença é difícil de notar, e o de 4 bits usa metade da memória e dobra a velocidade. Escolha 8 bits só quando sobrar memória.

Mac ou placa de vídeo NVIDIA para um LLM local?

Uma placa de vídeo escreve mais rápido com um modelo que caiba na memória dela (8 a 32 GB); um Mac comporta modelos muito maiores na memória unificada (até 512 GB). Para uma pessoa que trabalha com documentos, um Mac com 16 a 64 GB é a escolha mais simples.

Um LLM local esquenta demais o MacBook Air?

O MacBook Air não tem ventoinha: depois de alguns minutos escrevendo sem parar, ele desacelera para não esquentar. Em respostas de tamanho normal, isso não se nota; em sessões longas, um MacBook Pro ou um Mac mini mantém a velocidade.

Preciso do LM Studio, do Ollama ou do MLX?

Não com o Twoody: ele instala um modelo e o roda com o próprio motor, o llama.cpp, com um clique. Se você já usa o LM Studio, o Ollama ou o mlx-lm, o Twoody também usa os modelos deles.

Qual é a precisão dessas estimativas?

Em 20 medições publicadas que não foram usadas para construir a fórmula, o erro mediano é de 4,5% e o maior, de 23%; todas ficaram dentro da faixa exibida. A sua velocidade também depende do app, da versão dele e do que mais o computador está fazendo.

Experimente a IA local no seu Mac, de graça.

Versão 0.12.1 · macOS 13 ou posterior · sem conta, sem assinatura. Baixe o app, instale um modelo com um clique e faça sua primeira pergunta — até offline.