Calculadora de LLM local
El mejor LLM local para tu Mac Studio
Del M1 Max al M5 Ultra con 512 GB: los modelos más grandes que puede contener un Mac y a qué velocidad escriben.
| Tu equipo | Memoria | Recomendados: funcionan con holgura | Escribe | Con un clic en Twoody |
|---|---|---|---|---|
M5 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 96–193 tokens/s | Qwen3 14B | |
M5 Ultra — Mac Studio |
96 GB | gpt-oss-120b | 92–163 tokens/s | Qwen3 14B |
| 256 GB | Qwen3 235B-A22B | 28–50 tokens/s | Qwen3 14B | |
| 512 GB | Qwen3 235B-A22B | 28–50 tokens/s | Qwen3 14B | |
M3 Ultra — Mac Studio |
96 GB | gpt-oss-120b | 63–90 tokens/s | Qwen3 14B |
| 256 GB | Qwen3 235B-A22B | 20–28 tokens/s | Qwen3 14B | |
| 512 GB | Qwen3 235B-A22B | 20–28 tokens/s | Qwen3 14B | |
M4 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 73–106 tokens/s | Qwen3 14B |
| 48 GB | gpt-oss-20b | 85–122 tokens/s | Qwen3 14B | |
| 64 GB | gpt-oss-20b | 85–122 tokens/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 53–107 tokens/s | Qwen3 14B | |
M2 Ultra — Mac Studio |
64 GB | gpt-oss-20b | 89–128 tokens/s | Qwen3 14B |
| 128 GB | gpt-oss-120b | 63–91 tokens/s | Qwen3 14B | |
| 192 GB | Qwen3 235B-A22B | 20–28 tokens/s | Qwen3 14B | |
M2 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 62–90 tokens/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 62–90 tokens/s | Qwen3 14B | |
| 96 GB | Qwen3-Next 80B-A3B | 39–78 tokens/s | Qwen3 14B | |
M1 Ultra — Mac Studio |
64 GB | gpt-oss-20b | 75–107 tokens/s | Qwen3 14B |
| 128 GB | gpt-oss-120b | 52–75 tokens/s | Qwen3 14B | |
M1 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 56–80 tokens/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 56–80 tokens/s | Qwen3 14B |
Estimaciones, no mediciones, calculadas a partir de los benchmarks públicos de llama.cpp. Cifras revisadas el 26 de septiembre de 2026.
Con 128 a 512 GB de memoria unificada, un Mac Studio admite modelos que no caben en ninguna tarjeta gráfica: gpt-oss-120b, Qwen3.5 122B-A10B e incluso Qwen3 235B-A22B.
Sus chips Max y Ultra leen su memoria a entre 400 GB/s y 1,2 TB/s: las mezclas de expertos responden a decenas de tokens por segundo.
Silencioso incluso a plena carga, mantiene su velocidad en sesiones largas.
Preguntas sobre los LLM locales
¿Qué LLM elegir para un Mac Studio con chip Ultra?
Con 256 o 512 GB, Qwen3 235B-A22B, el modelo más grande de esta lista, funciona con holgura; gpt-oss-120b y Qwen3.5 122B-A10B escriben más rápido.
¿Bastan 128 GB para un modelo de 70B?
Sí, con holgura: Llama 3.3 70B necesita unos 48 GB en 4 bits. Con 128 GB también caben mezclas de expertos como gpt-oss-120b.
¿Max o Ultra para un LLM local?
El Ultra duplica el ancho de banda de memoria y la memoria: respuestas más rápidas con modelos grandes, y los modelos más grandes. Para modelos de hasta 70B, basta con un Max.
El mejor LLM local, por equipo
Prueba la IA local en tu Mac, gratis.
Versión 0.12.1 · macOS 13 o posterior · sin cuenta, sin suscripción. Descárgalo, instala un modelo con un clic y haz tu primera pregunta, incluso sin conexión.