Calculadora de LLM local
O melhor LLM local para o seu MacBook Pro
De um M1 com 8 GB a um M5 Max com 128 GB: o modelo mais forte que roda com folga em cada MacBook Pro, e com que velocidade ele escreve.
| Seu computador | Memória | Recomendado — roda com folga | Escreve | Um clique no Twoody |
|---|---|---|---|---|
M5 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 96–193 tokens/s | Qwen3 14B | |
M5 Pro — MacBook Pro, Mac mini |
24 GB | gpt-oss-20b | 68–97 tokens/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 92–132 tokens/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 92–132 tokens/s | Qwen3 14B | |
M5 — MacBook Air, MacBook Pro |
16 GB | Llama 3.1 8B | 20–28 tokens/s | Qwen3 8B |
| 24 GB | gpt-oss-20b | 32–47 tokens/s | Qwen3 14B | |
| 32 GB | GLM-4.7-Flash | 41–59 tokens/s | Qwen3 14B | |
M4 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 73–106 tokens/s | Qwen3 14B |
| 48 GB | gpt-oss-20b | 85–122 tokens/s | Qwen3 14B | |
| 64 GB | gpt-oss-20b | 85–122 tokens/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 53–107 tokens/s | Qwen3 14B | |
M4 Pro — MacBook Pro, Mac mini |
24 GB | gpt-oss-20b | 52–74 tokens/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 56–81 tokens/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 56–81 tokens/s | Qwen3 14B | |
M4 — MacBook Air, MacBook Pro, Mac mini, iMac |
16 GB | Llama 3.1 8B | 15–22 tokens/s | Qwen3 8B |
| 24 GB | gpt-oss-20b | 25–36 tokens/s | Qwen3 14B | |
| 32 GB | GLM-4.7-Flash | 32–46 tokens/s | Qwen3 14B | |
M3 Max — MacBook Pro |
36 GB | GLM-4.7-Flash | 68–97 tokens/s | Qwen3 14B |
| 48 GB | gpt-oss-20b | 68–98 tokens/s | Qwen3 14B | |
| 64 GB | gpt-oss-20b | 68–98 tokens/s | Qwen3 14B | |
| 96 GB | Qwen3-Next 80B-A3B | 47–93 tokens/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 46–93 tokens/s | Qwen3 14B | |
M3 Pro — MacBook Pro |
18 GB | Llama 3.1 8B | 19–28 tokens/s | Qwen3 8B |
| 36 GB | GLM-4.7-Flash | 42–60 tokens/s | Qwen3 14B | |
M3 — MacBook Air, MacBook Pro, iMac |
8 GB | Llama 3.2 3B | 31–45 tokens/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 13–19 tokens/s | Qwen3 8B | |
| 24 GB | gpt-oss-20b | 23–32 tokens/s | Qwen3 14B | |
M2 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 62–90 tokens/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 62–90 tokens/s | Qwen3 14B | |
| 96 GB | Qwen3-Next 80B-A3B | 39–78 tokens/s | Qwen3 14B | |
M2 Pro — MacBook Pro, Mac mini |
16 GB | Llama 3.1 8B | 24–35 tokens/s | Qwen3 8B |
| 32 GB | GLM-4.7-Flash | 45–65 tokens/s | Qwen3 14B | |
M2 — MacBook Air, MacBook Pro, Mac mini |
8 GB | Llama 3.2 3B | 32–45 tokens/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 13–19 tokens/s | Qwen3 8B | |
| 24 GB | gpt-oss-20b | 23–33 tokens/s | Qwen3 14B | |
M1 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 56–80 tokens/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 56–80 tokens/s | Qwen3 14B | |
M1 Pro — MacBook Pro |
16 GB | Llama 3.1 8B | 23–33 tokens/s | Qwen3 8B |
| 32 GB | GLM-4.7-Flash | 39–56 tokens/s | Qwen3 14B | |
M1 — MacBook Air, MacBook Pro, Mac mini, iMac |
8 GB | Llama 3.2 3B | 20–29 tokens/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 8,9–13 tokens/s | Qwen3 8B |
Estimativas, não medições, calculadas a partir dos benchmarks públicos do llama.cpp. Números revisados em 26 de setembro de 2026.
A memória decide o tamanho do modelo: 16 GB para 8 bilhões de parâmetros, 32 a 48 GB para misturas de especialistas como o Qwen3 30B-A3B, 64 GB ou mais para modelos de 70 bilhões.
Os chips Pro e Max leem a memória de duas a cinco vezes mais rápido que os chips básicos: é isso que os faz escrever rápido com modelos grandes.
Com as ventoinhas, o MacBook Pro mantém a velocidade em sessões longas, tanto na bateria quanto na tomada.
Perguntas sobre rodar um LLM localmente
Qual LLM para um MacBook Pro com M4 Max?
Com 64 GB ou mais, o gpt-oss-120b (com 128 GB), o Llama 3.3 70B ou o Qwen3 30B-A3B; as misturas de especialistas escrevem várias vezes mais rápido que o 70B denso.
O que 48 GB mudam em um MacBook Pro?
Com eles, o MacBook Pro roda com folga misturas de especialistas como o Qwen3 30B-A3B ou o gpt-oss-20b, a várias dezenas de tokens por segundo, com espaço para os seus outros apps.
Um LLM local descarrega a bateria do MacBook Pro?
Escrever uma resposta usa a GPU a toda potência por alguns segundos; entre uma resposta e outra, o modelo espera sem gastar nada. Um longo trabalho com documentos na bateria não é problema; horas de escrita contínua, sim.
O melhor LLM local, por computador
Experimente a IA local no seu Mac, de graça.
Versão 0.12.1 · macOS 13 ou posterior · sem conta, sem assinatura. Baixe o app, instale um modelo com um clique e faça sua primeira pergunta — até offline.