Twoody

Calculadora de LLM local

El mejor LLM local para tu tarjeta gráfica NVIDIA

De la RTX 3060 a la RTX 5090: el modelo más potente que cabe en la memoria de cada tarjeta y a qué velocidad escribe.

Tu equipo Memoria Recomendados: funcionan con holgura Escribe

GeForce RTX 5090 (32 GB)

32 GB gpt-oss-20b 100+ tokens/s

GeForce RTX 5080 (16 GB)

16 GB gpt-oss-20b 100+ tokens/s

GeForce RTX 5070 Ti (16 GB)

16 GB gpt-oss-20b 100+ tokens/s

GeForce RTX 5070 (12 GB)

12 GB Llama 3.1 8B 80–116 tokens/s

GeForce RTX 5060 Ti (16 GB)

16 GB gpt-oss-20b 82–142 tokens/s

GeForce RTX 5060 Ti (8 GB)

8 GB Llama 3.1 8B 57–83 tokens/s

GeForce RTX 5060 (8 GB)

8 GB Llama 3.1 8B 50–89 tokens/s

GeForce RTX 4090 (24 GB)

24 GB GLM-4.7-Flash 100+ tokens/s

GeForce RTX 4080 SUPER (16 GB)

16 GB gpt-oss-20b 100+ tokens/s

GeForce RTX 4080 (16 GB)

16 GB gpt-oss-20b 100+ tokens/s

GeForce RTX 4070 Ti SUPER (16 GB)

16 GB gpt-oss-20b 100+ tokens/s

GeForce RTX 4070 Ti (12 GB)

12 GB Llama 3.1 8B 66–95 tokens/s

GeForce RTX 4070 SUPER (12 GB)

12 GB Llama 3.1 8B 66–95 tokens/s

GeForce RTX 4070 (12 GB)

12 GB Llama 3.1 8B 58–84 tokens/s

GeForce RTX 4060 Ti (16 GB)

16 GB gpt-oss-20b 55–96 tokens/s

GeForce RTX 4060 Ti (8 GB)

8 GB Llama 3.1 8B 38–55 tokens/s

GeForce RTX 4060 (8 GB)

8 GB Llama 3.1 8B 31–56 tokens/s

GeForce RTX 3090 (24 GB)

24 GB gpt-oss-20b 100+ tokens/s

GeForce RTX 3080 (10 GB)

10 GB Llama 3.1 8B 88–127 tokens/s

GeForce RTX 3070 (8 GB)

8 GB Llama 3.1 8B 50–72 tokens/s

GeForce RTX 3060 Ti (8 GB)

8 GB Llama 3.1 8B 54–78 tokens/s

GeForce RTX 3060 (12 GB)

12 GB Llama 3.1 8B 47–68 tokens/s

Estimaciones, no mediciones, calculadas a partir de los benchmarks públicos de llama.cpp. Cifras revisadas el 26 de septiembre de 2026.

En un PC, lo que decide es la memoria de la tarjeta gráfica (VRAM): 8 GB para modelos de 4000 a 8000 millones de parámetros, 16 GB para 14 000 millones o gpt-oss-20b, y de 24 a 32 GB para 32 000 millones.

Las tarjetas gráficas leen su memoria muy rápido: con un modelo que quepa, escriben más rápido que cualquier Mac.

Twoody para Windows y Linux está en preparación; la versión en pruebas ejecuta los modelos en el procesador. Mientras tanto, estas velocidades son las de LM Studio u Ollama.

Preguntas sobre los LLM locales

¿Qué LLM elegir para una RTX 4090?

Con 24 GB, Qwen3 32B o Gemma 4 31B caben en 4 bits, y gpt-oss-20b escribe a bastante más de 100 tokens por segundo.

¿Basta con una tarjeta gráfica de 8 GB?

Para modelos de 4000 a 8000 millones de parámetros, sí, con una conversación corta. Los más grandes no caben y pasan a usar la memoria del equipo, lo que los ralentiza mucho.

¿Twoody funciona en Windows con una tarjeta NVIDIA?

Todavía no: la versión para Windows está en preparación. Deja tu correo en la página de plataformas y te avisaremos cuando esté lista.

Prueba la IA local en tu Mac, gratis.

Versión 0.12.1 · macOS 13 o posterior · sin cuenta, sin suscripción. Descárgalo, instala un modelo con un clic y haz tu primera pregunta, incluso sin conexión.