Calculadora de LLM local
El mejor LLM local para tu MacBook Pro
De un M1 de 8 GB a un M5 Max de 128 GB: el modelo más potente que funciona con holgura en cada MacBook Pro y a qué velocidad escribe.
| Tu equipo | Memoria | Recomendados: funcionan con holgura | Escribe | Con un clic en Twoody |
|---|---|---|---|---|
M5 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 96–193 tokens/s | Qwen3 14B | |
M5 Pro — MacBook Pro, Mac mini |
24 GB | gpt-oss-20b | 68–97 tokens/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 92–132 tokens/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 92–132 tokens/s | Qwen3 14B | |
M5 — MacBook Air, MacBook Pro |
16 GB | Llama 3.1 8B | 20–28 tokens/s | Qwen3 8B |
| 24 GB | gpt-oss-20b | 32–47 tokens/s | Qwen3 14B | |
| 32 GB | GLM-4.7-Flash | 41–59 tokens/s | Qwen3 14B | |
M4 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 73–106 tokens/s | Qwen3 14B |
| 48 GB | gpt-oss-20b | 85–122 tokens/s | Qwen3 14B | |
| 64 GB | gpt-oss-20b | 85–122 tokens/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 53–107 tokens/s | Qwen3 14B | |
M4 Pro — MacBook Pro, Mac mini |
24 GB | gpt-oss-20b | 52–74 tokens/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 56–81 tokens/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 56–81 tokens/s | Qwen3 14B | |
M4 — MacBook Air, MacBook Pro, Mac mini, iMac |
16 GB | Llama 3.1 8B | 15–22 tokens/s | Qwen3 8B |
| 24 GB | gpt-oss-20b | 25–36 tokens/s | Qwen3 14B | |
| 32 GB | GLM-4.7-Flash | 32–46 tokens/s | Qwen3 14B | |
M3 Max — MacBook Pro |
36 GB | GLM-4.7-Flash | 68–97 tokens/s | Qwen3 14B |
| 48 GB | gpt-oss-20b | 68–98 tokens/s | Qwen3 14B | |
| 64 GB | gpt-oss-20b | 68–98 tokens/s | Qwen3 14B | |
| 96 GB | Qwen3-Next 80B-A3B | 47–93 tokens/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 46–93 tokens/s | Qwen3 14B | |
M3 Pro — MacBook Pro |
18 GB | Llama 3.1 8B | 19–28 tokens/s | Qwen3 8B |
| 36 GB | GLM-4.7-Flash | 42–60 tokens/s | Qwen3 14B | |
M3 — MacBook Air, MacBook Pro, iMac |
8 GB | Llama 3.2 3B | 31–45 tokens/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 13–19 tokens/s | Qwen3 8B | |
| 24 GB | gpt-oss-20b | 23–32 tokens/s | Qwen3 14B | |
M2 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 62–90 tokens/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 62–90 tokens/s | Qwen3 14B | |
| 96 GB | Qwen3-Next 80B-A3B | 39–78 tokens/s | Qwen3 14B | |
M2 Pro — MacBook Pro, Mac mini |
16 GB | Llama 3.1 8B | 24–35 tokens/s | Qwen3 8B |
| 32 GB | GLM-4.7-Flash | 45–65 tokens/s | Qwen3 14B | |
M2 — MacBook Air, MacBook Pro, Mac mini |
8 GB | Llama 3.2 3B | 32–45 tokens/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 13–19 tokens/s | Qwen3 8B | |
| 24 GB | gpt-oss-20b | 23–33 tokens/s | Qwen3 14B | |
M1 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 56–80 tokens/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 56–80 tokens/s | Qwen3 14B | |
M1 Pro — MacBook Pro |
16 GB | Llama 3.1 8B | 23–33 tokens/s | Qwen3 8B |
| 32 GB | GLM-4.7-Flash | 39–56 tokens/s | Qwen3 14B | |
M1 — MacBook Air, MacBook Pro, Mac mini, iMac |
8 GB | Llama 3.2 3B | 20–29 tokens/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 8,9–13 tokens/s | Qwen3 8B |
Estimaciones, no mediciones, calculadas a partir de los benchmarks públicos de llama.cpp. Cifras revisadas el 26 de septiembre de 2026.
La memoria decide el tamaño del modelo: 16 GB para 8000 millones de parámetros, de 32 a 48 GB para mezclas de expertos como Qwen3 30B-A3B, y 64 GB o más para modelos de 70 000 millones.
Los chips Pro y Max leen su memoria de dos a cinco veces más rápido que los chips básicos: por eso escriben rápido con modelos grandes.
Con sus ventiladores, un MacBook Pro mantiene su velocidad en sesiones largas, tanto con batería como enchufado.
Preguntas sobre los LLM locales
¿Qué LLM elegir para un MacBook Pro con M4 Max?
Con 64 GB o más, gpt-oss-120b (con 128 GB), Llama 3.3 70B o Qwen3 30B-A3B; las mezclas de expertos escriben varias veces más rápido que el 70B denso.
¿Qué cambia con 48 GB en un MacBook Pro?
Ejecuta con holgura mezclas de expertos como Qwen3 30B-A3B o gpt-oss-20b, a varias decenas de tokens por segundo, y deja espacio para tus otras apps.
¿Un LLM local agota la batería de un MacBook Pro?
Escribir una respuesta pone la GPU a plena potencia durante unos segundos; entre respuestas, el modelo espera sin consumir. Trabajar con documentos usando la batería no es un problema; pasar horas escribiendo sin parar, sí.
El mejor LLM local, por equipo
Prueba la IA local en tu Mac, gratis.
Versión 0.12.1 · macOS 13 o posterior · sin cuenta, sin suscripción. Descárgalo, instala un modelo con un clic y haz tu primera pregunta, incluso sin conexión.