Calculadora de LLM local
El mejor LLM local para tu tarjeta gráfica NVIDIA
De la RTX 3060 a la RTX 5090: el modelo más potente que cabe en la memoria de cada tarjeta y a qué velocidad escribe.
| Tu equipo | Memoria | Recomendados: funcionan con holgura | Escribe |
|---|---|---|---|
GeForce RTX 5090 (32 GB) |
32 GB | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 5080 (16 GB) |
16 GB | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 5070 Ti (16 GB) |
16 GB | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 5070 (12 GB) |
12 GB | Llama 3.1 8B | 80–116 tokens/s |
GeForce RTX 5060 Ti (16 GB) |
16 GB | gpt-oss-20b | 82–142 tokens/s |
GeForce RTX 5060 Ti (8 GB) |
8 GB | Llama 3.1 8B | 57–83 tokens/s |
GeForce RTX 5060 (8 GB) |
8 GB | Llama 3.1 8B | 50–89 tokens/s |
GeForce RTX 4090 (24 GB) |
24 GB | GLM-4.7-Flash | 100+ tokens/s |
GeForce RTX 4080 SUPER (16 GB) |
16 GB | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 4080 (16 GB) |
16 GB | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 4070 Ti SUPER (16 GB) |
16 GB | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 4070 Ti (12 GB) |
12 GB | Llama 3.1 8B | 66–95 tokens/s |
GeForce RTX 4070 SUPER (12 GB) |
12 GB | Llama 3.1 8B | 66–95 tokens/s |
GeForce RTX 4070 (12 GB) |
12 GB | Llama 3.1 8B | 58–84 tokens/s |
GeForce RTX 4060 Ti (16 GB) |
16 GB | gpt-oss-20b | 55–96 tokens/s |
GeForce RTX 4060 Ti (8 GB) |
8 GB | Llama 3.1 8B | 38–55 tokens/s |
GeForce RTX 4060 (8 GB) |
8 GB | Llama 3.1 8B | 31–56 tokens/s |
GeForce RTX 3090 (24 GB) |
24 GB | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 3080 (10 GB) |
10 GB | Llama 3.1 8B | 88–127 tokens/s |
GeForce RTX 3070 (8 GB) |
8 GB | Llama 3.1 8B | 50–72 tokens/s |
GeForce RTX 3060 Ti (8 GB) |
8 GB | Llama 3.1 8B | 54–78 tokens/s |
GeForce RTX 3060 (12 GB) |
12 GB | Llama 3.1 8B | 47–68 tokens/s |
Estimaciones, no mediciones, calculadas a partir de los benchmarks públicos de llama.cpp. Cifras revisadas el 26 de septiembre de 2026.
En un PC, lo que decide es la memoria de la tarjeta gráfica (VRAM): 8 GB para modelos de 4000 a 8000 millones de parámetros, 16 GB para 14 000 millones o gpt-oss-20b, y de 24 a 32 GB para 32 000 millones.
Las tarjetas gráficas leen su memoria muy rápido: con un modelo que quepa, escriben más rápido que cualquier Mac.
Twoody para Windows y Linux está en preparación; la versión en pruebas ejecuta los modelos en el procesador. Mientras tanto, estas velocidades son las de LM Studio u Ollama.
Preguntas sobre los LLM locales
¿Qué LLM elegir para una RTX 4090?
Con 24 GB, Qwen3 32B o Gemma 4 31B caben en 4 bits, y gpt-oss-20b escribe a bastante más de 100 tokens por segundo.
¿Basta con una tarjeta gráfica de 8 GB?
Para modelos de 4000 a 8000 millones de parámetros, sí, con una conversación corta. Los más grandes no caben y pasan a usar la memoria del equipo, lo que los ralentiza mucho.
¿Twoody funciona en Windows con una tarjeta NVIDIA?
Todavía no: la versión para Windows está en preparación. Deja tu correo en la página de plataformas y te avisaremos cuando esté lista.
El mejor LLM local, por equipo
Prueba la IA local en tu Mac, gratis.
Versión 0.12.1 · macOS 13 o posterior · sin cuenta, sin suscripción. Descárgalo, instala un modelo con un clic y haz tu primera pregunta, incluso sin conexión.