Calculadora de LLM local
O melhor LLM local para o seu Mac Studio
Do M1 Max ao M5 Ultra com 512 GB: os maiores modelos que um Mac comporta, e com que velocidade eles escrevem.
| Seu computador | Memória | Recomendado — roda com folga | Escreve | Um clique no Twoody |
|---|---|---|---|---|
M5 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 96–193 tokens/s | Qwen3 14B | |
M5 Ultra — Mac Studio |
96 GB | gpt-oss-120b | 92–163 tokens/s | Qwen3 14B |
| 256 GB | Qwen3 235B-A22B | 28–50 tokens/s | Qwen3 14B | |
| 512 GB | Qwen3 235B-A22B | 28–50 tokens/s | Qwen3 14B | |
M3 Ultra — Mac Studio |
96 GB | gpt-oss-120b | 63–90 tokens/s | Qwen3 14B |
| 256 GB | Qwen3 235B-A22B | 20–28 tokens/s | Qwen3 14B | |
| 512 GB | Qwen3 235B-A22B | 20–28 tokens/s | Qwen3 14B | |
M4 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 73–106 tokens/s | Qwen3 14B |
| 48 GB | gpt-oss-20b | 85–122 tokens/s | Qwen3 14B | |
| 64 GB | gpt-oss-20b | 85–122 tokens/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 53–107 tokens/s | Qwen3 14B | |
M2 Ultra — Mac Studio |
64 GB | gpt-oss-20b | 89–128 tokens/s | Qwen3 14B |
| 128 GB | gpt-oss-120b | 63–91 tokens/s | Qwen3 14B | |
| 192 GB | Qwen3 235B-A22B | 20–28 tokens/s | Qwen3 14B | |
M2 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 62–90 tokens/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 62–90 tokens/s | Qwen3 14B | |
| 96 GB | Qwen3-Next 80B-A3B | 39–78 tokens/s | Qwen3 14B | |
M1 Ultra — Mac Studio |
64 GB | gpt-oss-20b | 75–107 tokens/s | Qwen3 14B |
| 128 GB | gpt-oss-120b | 52–75 tokens/s | Qwen3 14B | |
M1 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 56–80 tokens/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 56–80 tokens/s | Qwen3 14B |
Estimativas, não medições, calculadas a partir dos benchmarks públicos do llama.cpp. Números revisados em 26 de setembro de 2026.
Com 128 a 512 GB de memória unificada, o Mac Studio comporta modelos que nenhuma placa de vídeo comporta: gpt-oss-120b, Qwen3.5 122B-A10B e até o Qwen3 235B-A22B.
Os chips Max e Ultra leem a memória a velocidades de 400 GB/s a 1,2 TB/s: as misturas de especialistas respondem a dezenas de tokens por segundo.
Silencioso mesmo sob carga, ele mantém a velocidade em sessões longas.
Perguntas sobre rodar um LLM localmente
Qual LLM para um Mac Studio com chip Ultra?
Com 256 ou 512 GB, o Qwen3 235B-A22B, o maior modelo desta lista, roda com folga; o gpt-oss-120b e o Qwen3.5 122B-A10B escrevem mais rápido.
128 GB bastam para um modelo de 70B?
Sim, com folga: o Llama 3.3 70B precisa de cerca de 48 GB em 4 bits. Com 128 GB, misturas de especialistas como o gpt-oss-120b também cabem.
Max ou Ultra para um LLM local?
O Ultra dobra a largura de banda e a memória: respostas mais rápidas com modelos grandes, e os maiores modelos. Para modelos de até 70B, um Max basta.
O melhor LLM local, por computador
Experimente a IA local no seu Mac, de graça.
Versão 0.12.1 · macOS 13 ou posterior · sem conta, sem assinatura. Baixe o app, instale um modelo com um clique e faça sua primeira pergunta — até offline.