Twoody

Calculadora de LLM local

¿Qué LLM local puede ejecutar tu equipo, y a qué velocidad?

Elige tu Mac o tu PC. Descubre qué modelos abiertos caben en su memoria, a qué velocidad escriben, cuánto tardan en leer un documento y para qué sirven.

¿Qué Mac tengo? En el menú Apple › Acerca de este Mac aparecen el chip y la memoria. En un PC: Administrador de tareas › Rendimiento › GPU.

Los modelos para este equipo

En un iMac Pro, Mac Pro (2017–2019) con 128 GB: 35 de 36 modelos funcionan bien.

Lo que Twoody instala en tu Mac

Qwen3 14B, con un clic, para conversaciones de 16k tokens.

Funciona con holgura · 4,1–7,4 tokens/s (más o menos a tu ritmo de lectura) · 20 páginas en 6 min

En un Mac con Intel, el modelo se ejecuta en el procesador: funciona, pero despacio.

Mac con Intel

Funcionan bien en este equipo

Qwen3-Next 80B-A3B

Qwen (Alibaba) · Apache 2.0

Con LM Studio, Ollama o mlx-lm

48,3 de 124 GB

Funciona con holgura

14–25 tokens/s

casi instantáneo

20 páginas en 2 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Programación
  • Razonamiento
  • Agentes
gpt-oss-120b

OpenAI · Apache 2.0

Con LM Studio, Ollama o mlx-lm

63,1 de 124 GB

Funciona con holgura

9,3–17 tokens/s

más rápido de lo que lees

20 páginas en 3 min

  • Chat y redacción
  • Tus documentos
  • Programación
  • Razonamiento
  • Agentes
Mistral Small 4 119B

Mistral AI · Apache 2.0

Con LM Studio, Ollama o mlx-lm

71,1 de 124 GB

Funciona con holgura

8,2–15 tokens/s

más rápido de lo que lees

20 páginas en 4 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Programación
  • Razonamiento
  • Agentes
Qwen3.5 122B-A10B

Qwen (Alibaba) · Apache 2.0

Con LM Studio, Ollama o mlx-lm

75,7 de 124 GB

Funciona con holgura

4,4–7,9 tokens/s

más o menos a tu ritmo de lectura

20 páginas en 5 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Programación
  • Razonamiento
  • Agentes
Llama 3.3 70B

Meta · Llama 3.3 Community

Con LM Studio, Ollama o mlx-lm

47,1 de 124 GB

Funciona con holgura

0,9–1,6 tokens/s

más lento de lo que lees

20 páginas en 31 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Programación
  • Razonamiento
  • Agentes
GLM-4.7-Flash

Z.ai · MIT

Con LM Studio, Ollama o mlx-lm

19,2 de 124 GB

Funciona con holgura

17–30 tokens/s

casi instantáneo

20 páginas en 2 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Programación
  • Razonamiento
  • Agentes
Qwen3 30B-A3B

Qwen (Alibaba) · Apache 2.0

Con LM Studio, Ollama o mlx-lm

20,1 de 124 GB

Funciona con holgura

14–26 tokens/s

casi instantáneo

20 páginas en 2 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Programación
  • Razonamiento
  • Agentes
Qwen3-Coder 30B-A3B

Qwen (Alibaba) · Apache 2.0

Con LM Studio, Ollama o mlx-lm

20,1 de 124 GB

Funciona con holgura

14–26 tokens/s

casi instantáneo

20 páginas en 2 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Programación
  • Agentes
Qwen3.6 35B-A3B

Qwen (Alibaba) · Apache 2.0

Con LM Studio, Ollama o mlx-lm

22,5 de 124 GB

Funciona con holgura

14–25 tokens/s

casi instantáneo

20 páginas en 2 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Programación
  • Razonamiento
  • Agentes
gpt-oss-20b

OpenAI · Apache 2.0

Con LM Studio, Ollama o mlx-lm

12,7 de 124 GB

Funciona con holgura

12–22 tokens/s

más rápido de lo que lees

20 páginas en 2 min

  • Chat y redacción
  • Tus documentos
  • Programación
  • Razonamiento
  • Agentes
Gemma 4 26B-A4B

Google · Apache 2.0

Con LM Studio, Ollama o mlx-lm

17,7 de 124 GB

Funciona con holgura

12–22 tokens/s

más rápido de lo que lees

20 páginas en 2 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Programación
  • Agentes
Mistral Small 3.2 24B

Mistral AI · Apache 2.0

Con LM Studio, Ollama o mlx-lm

17 de 124 GB

Funciona con holgura

2,6–4,7 tokens/s

más lento de lo que lees

20 páginas en 11 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Programación
  • Agentes
Devstral Small 2 24B

Mistral AI · Apache 2.0

Con LM Studio, Ollama o mlx-lm

17 de 124 GB

Funciona con holgura

2,6–4,7 tokens/s

más lento de lo que lees

20 páginas en 11 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Programación
  • Agentes
Gemma 4 31B

Google · Apache 2.0

Con LM Studio, Ollama o mlx-lm

19,8 de 124 GB

Funciona con holgura

2,1–3,7 tokens/s

más lento de lo que lees

20 páginas en 14 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Programación
  • Agentes
Qwen3.8 27B

Qwen (Alibaba) · Apache 2.0

Con LM Studio, Ollama o mlx-lm

17,6 de 124 GB

Funciona con holgura

1,9–3,5 tokens/s

más lento de lo que lees

20 páginas en 12 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Programación
  • Razonamiento
  • Agentes
Qwen3 32B

Qwen (Alibaba) · Apache 2.0

Con LM Studio, Ollama o mlx-lm

23,8 de 124 GB

Funciona con holgura

1,9–3,4 tokens/s

más lento de lo que lees

20 páginas en 14 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Programación
  • Razonamiento
  • Agentes
Llama 3.1 8B

Meta · Llama 3.1 Community

Con LM Studio, Ollama o mlx-lm

7,3 de 124 GB

Funciona con holgura

7,4–13 tokens/s

más rápido de lo que lees

20 páginas en 4 min

  • Chat y redacción
  • Tus documentos
  • Traducción
Qwen3 8B

Qwen (Alibaba) · Apache 2.0

Con un clic en Twoody

7,7 de 124 GB

Funciona con holgura

7,2–13 tokens/s

más rápido de lo que lees

20 páginas en 4 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Razonamiento
DeepSeek-R1-0528-Qwen3-8B

DeepSeek · MIT

Con LM Studio, Ollama o mlx-lm

7,7 de 124 GB

Funciona con holgura

7,2–13 tokens/s

más rápido de lo que lees

20 páginas en 4 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Razonamiento
Ministral 3 8B

Mistral AI · Apache 2.0

Con LM Studio, Ollama o mlx-lm

7,7 de 124 GB

Funciona con holgura

7–13 tokens/s

más rápido de lo que lees

20 páginas en 4 min

  • Chat y redacción
  • Tus documentos
  • Traducción
Qwen3.5 9B

Qwen (Alibaba) · Apache 2.0

Con LM Studio, Ollama o mlx-lm

6,6 de 124 GB

Funciona con holgura

5,6–10 tokens/s

más o menos a tu ritmo de lectura

20 páginas en 4 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Razonamiento
Gemma 4 12B

Google · Apache 2.0

Con LM Studio, Ollama o mlx-lm

8,1 de 124 GB

Funciona con holgura

5,2–9,4 tokens/s

más o menos a tu ritmo de lectura

20 páginas en 5 min

  • Chat y redacción
  • Tus documentos
  • Traducción
Ministral 3 14B

Mistral AI · Apache 2.0

Con LM Studio, Ollama o mlx-lm

11,1 de 124 GB

Funciona con holgura

4,5–8 tokens/s

más o menos a tu ritmo de lectura

20 páginas en 6 min

  • Chat y redacción
  • Tus documentos
  • Traducción
Phi-4 14B

Microsoft · MIT

Con LM Studio, Ollama o mlx-lm

12,3 de 124 GB

Funciona con holgura

4,2–7,4 tokens/s

más o menos a tu ritmo de lectura

20 páginas en 6 min

  • Chat y redacción
  • Tus documentos
  • Razonamiento
Qwen3 14B

Qwen (Alibaba) · Apache 2.0

Con un clic en Twoody

11,8 de 124 GB

Funciona con holgura

4,1–7,4 tokens/s

más o menos a tu ritmo de lectura

20 páginas en 6 min

  • Chat y redacción
  • Tus documentos
  • Traducción
  • Razonamiento
Llama 3.2 3B

Meta · Llama 3.2 Community

Con LM Studio, Ollama o mlx-lm

4,2 de 124 GB

Funciona con holgura

17–30 tokens/s

casi instantáneo

20 páginas en 84 s

  • Chat y redacción
  • Traducción
Phi-4-mini

Microsoft · MIT

Con LM Studio, Ollama o mlx-lm

4,9 de 124 GB

Funciona con holgura

14–25 tokens/s

más rápido de lo que lees

20 páginas en 2 min

  • Chat y redacción
Qwen3 4B

Qwen (Alibaba) · Apache 2.0

Con un clic en Twoody

5,2 de 124 GB

Funciona con holgura

14–25 tokens/s

más rápido de lo que lees

20 páginas en 2 min

  • Chat y redacción
  • Traducción
Gemma 4 E4B

Google · Apache 2.0

Con LM Studio, Ollama o mlx-lm

5,9 de 124 GB

Funciona con holgura

13–23 tokens/s

más rápido de lo que lees

20 páginas en 2 min

  • Chat y redacción
  • Traducción
Qwen3.5 4B

Qwen (Alibaba) · Apache 2.0

Con LM Studio, Ollama o mlx-lm

3,7 de 124 GB

Funciona con holgura

11–20 tokens/s

más rápido de lo que lees

20 páginas en 2 min

  • Chat y redacción
  • Traducción
Qwen3 0.6B

Qwen (Alibaba) · Apache 2.0

Con LM Studio, Ollama o mlx-lm

2,6 de 124 GB

Funciona con holgura

43–130 tokens/s

parece instantáneo

20 páginas en 16 s

Qwen3 1.7B

Qwen (Alibaba) · Apache 2.0

Con LM Studio, Ollama o mlx-lm

3,3 de 124 GB

Funciona con holgura

20–61 tokens/s

casi instantáneo

20 páginas en 45 s

Gemma 4 E2B

Google · Apache 2.0

Con LM Studio, Ollama o mlx-lm

3,8 de 124 GB

Funciona con holgura

25–44 tokens/s

casi instantáneo

20 páginas en 61 s

Qwen3.5 2B

Qwen (Alibaba) · Apache 2.0

Con LM Studio, Ollama o mlx-lm

1,9 de 124 GB

Funciona con holgura

23–42 tokens/s

casi instantáneo

20 páginas en 54 s

MiniCPM5 2B

OpenBMB · Apache 2.0

Con LM Studio, Ollama o mlx-lm

2,7 de 124 GB

Funciona con holgura

22–39 tokens/s

casi instantáneo

20 páginas en 66 s

Demasiado grandes para este equipo (1)
  • Qwen3 235B-A22B · 142,4 de 124 GB

Estimaciones, no mediciones, calculadas a partir de los benchmarks públicos de llama.cpp. Cifras revisadas el 26 de septiembre de 2026.

¿Cuánta memoria necesitas para un LLM local?

La memoria decide qué modelos caben: el archivo del modelo, más la conversación que tiene presente. Un Mac deja que su GPU use unas dos terceras partes de la memoria hasta 32 GB, y tres cuartas partes por encima. Con archivos de 4 bits, esto es lo que funciona con holgura:

MemoriaRecomendados: funcionan con holgura
8 GBLlama 3.2 3B, Phi-4-mini, Qwen3.5 4B
16 GBLlama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B
24 GBgpt-oss-20b, Llama 3.1 8B, Qwen3 8B
32 GBGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
48 GBGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
64 GBLlama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B
128 GBQwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B
256 GBQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B
512 GBQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B

Por qué el ancho de banda de la memoria marca la velocidad

Para escribir cada palabra, el equipo lee de la memoria los pesos activos del modelo. Por eso la velocidad depende más del ancho de banda de la memoria que de la potencia del procesador. Qwen3 8B, en 4 bits, en algunas máquinas:

Equipo Ancho de banda de memoria Escribe
M1 68 GB/s 8,7–12 tokens/s
M2 100 GB/s 13–19 tokens/s
M4 120 GB/s 15–21 tokens/s
M5 153 GB/s 19–27 tokens/s
M4 Pro 273 GB/s 31–45 tokens/s
M4 Max 546 GB/s 53–76 tokens/s
M5 Max 614 GB/s 72–104 tokens/s
GeForce RTX 4090 (24 GB) 1 008 GB/s 100+ tokens/s

¿4 bits u 8 bits?

Los modelos se distribuyen comprimidos. Los archivos de 4 bits (Q4_K_M, o MXFP4 para gpt-oss) ocupan la mitad que los de 8 bits, con una pequeña pérdida de calidad: es lo que instala Twoody, y la opción adecuada en la mayoría de los equipos. Los de 8 bits son algo más precisos y necesitan el doble de memoria.

Tokens por segundo, en la práctica

Un token es un trozo de palabra: unas tres cuartas partes de una palabra en inglés, algo menos en español. Leyendo en silencio, avanzas a unos 5 tokens por segundo.

menos de 5más lento de lo que lees
de 5 a 10más o menos a tu ritmo de lectura
de 10 a 20más rápido de lo que lees
de 20 a 50casi instantáneo
más de 50parece instantáneo

Un modelo que razona antes de responder escribe primero de 300 a 3000 tokens de razonamiento: a 10 tokens por segundo, de medio minuto a cinco minutos. En Twoody, los ajustes «Fast», «Thinking» y «Deep» deciden cuánto tiempo razona.

Leer un documento

Antes de responder sobre un documento, el modelo lo lee, y ahí es donde más ganan los chips recientes. Qwen3 8B leyendo un documento de 20 páginas, con 16 GB:

M13 min
M476 s
M527 s

¿Mac o PC?

Un Mac comparte su memoria entre el procesador y la GPU: un Mac de 64 GB ejecuta modelos que no caben en ninguna tarjeta gráfica de 24 GB. La tarjeta gráfica de un PC tiene menos memoria, pero la lee muy rápido: con un modelo que quepa, una RTX 4090 escribe más rápido que cualquier Mac. Hoy Twoody funciona en Mac; las versiones para Windows y Linux están en preparación.

El mejor LLM local, por equipo

Método y fuentes

La velocidad de cada máquina se calcula a partir de su velocidad medida con el modelo de referencia de llama.cpp (LLaMA 2 7B, 4 bits), escalada según lo que cada modelo lee por palabra, con los anchos de banda de memoria de las especificaciones de Apple y NVIDIA. El cálculo se ha contrastado con 20 mediciones publicadas que no se usaron para elaborarlo: error mediano del 4,5 %, máximo del 23 %, y todas dentro de los rangos indicados.

Cifras revisadas el 26 de septiembre de 2026.

Fuentes

Descargar los datos (JSON, CC BY 4.0)

Preguntas sobre los LLM locales

¿Puedo ejecutar un LLM local con 8 GB de memoria?

Sí, uno pequeño: Qwen3 4B o Qwen3.5 4B funcionan en un Mac de 8 GB y bastan para correos, resúmenes y preguntas sencillas. Cierra las apps pesadas mientras lo usas. Twoody instala Qwen3 4B en estos Mac.

¿Qué LLM elegir para un Mac de 16 GB?

Un modelo de 7000 a 9000 millones de parámetros: Qwen3 8B, Qwen3.5 9B o Llama 3.1 8B escriben unos 15 a 25 tokens por segundo en los Mac recientes y responden bien sobre tus documentos. Twoody instala Qwen3 8B.

¿Cuánta memoria necesita un modelo de 70B?

Unos 48 GB para su archivo de 4 bits y una conversación corta: un Mac de 64 GB ejecuta Llama 3.3 70B a entre 7 y 13 tokens por segundo, según el chip. Las mezclas de expertos como gpt-oss-120b necesitan más memoria, pero escriben mucho más rápido.

¿Un modelo de 4 bits es mucho peor que uno de 8 bits?

Un poco. Para redactar, resumir y preguntar sobre documentos, la diferencia apenas se nota, y los 4 bits reducen la memoria a la mitad y duplican la velocidad. Elige 8 bits solo si te sobra memoria.

¿Mac o tarjeta gráfica NVIDIA para un LLM local?

Una tarjeta gráfica escribe más rápido con un modelo que quepa en su memoria (de 8 a 32 GB); un Mac admite modelos mucho más grandes en su memoria unificada (hasta 512 GB). Para una persona que trabaja con documentos, un Mac de 16 a 64 GB es la opción más sencilla.

¿Un LLM local calienta demasiado un MacBook Air?

Un MacBook Air no tiene ventilador: tras unos minutos escribiendo sin parar, baja el ritmo para no calentarse. En respuestas de longitud normal no se nota; para sesiones largas, un MacBook Pro o un Mac mini mantienen su velocidad.

¿Necesito LM Studio, Ollama o MLX?

No con Twoody: instala un modelo y lo ejecuta con su propio motor, llama.cpp, con un clic. Si ya usas LM Studio, Ollama o mlx-lm, Twoody también usa sus modelos.

¿Qué precisión tienen estas estimaciones?

En 20 mediciones publicadas que no se usaron para construir la fórmula, el error mediano es del 4,5 % y el máximo, del 23 %; todas cayeron dentro del rango indicado. Tu velocidad también depende de la app, de su versión y de lo que esté haciendo el equipo al mismo tiempo.

Prueba la IA local en tu Mac, gratis.

Versión 0.12.1 · macOS 13 o posterior · sin cuenta, sin suscripción. Descárgalo, instala un modelo con un clic y haz tu primera pregunta, incluso sin conexión.