Twoody

Calcolatore di LLM locali

Il miglior LLM locale per la tua scheda grafica NVIDIA

Dalla RTX 3060 alla RTX 5090: il modello più potente che entra nella memoria di ogni scheda, e a che velocità scrive.

Il tuo computer Memoria Consigliato — gira senza problemi Scrive

GeForce RTX 5090 (32 GB)

32 GB gpt-oss-20b 100+ token/s

GeForce RTX 5080 (16 GB)

16 GB gpt-oss-20b 100+ token/s

GeForce RTX 5070 Ti (16 GB)

16 GB gpt-oss-20b 100+ token/s

GeForce RTX 5070 (12 GB)

12 GB Llama 3.1 8B 80–116 token/s

GeForce RTX 5060 Ti (16 GB)

16 GB gpt-oss-20b 82–142 token/s

GeForce RTX 5060 Ti (8 GB)

8 GB Llama 3.1 8B 57–83 token/s

GeForce RTX 5060 (8 GB)

8 GB Llama 3.1 8B 50–89 token/s

GeForce RTX 4090 (24 GB)

24 GB GLM-4.7-Flash 100+ token/s

GeForce RTX 4080 SUPER (16 GB)

16 GB gpt-oss-20b 100+ token/s

GeForce RTX 4080 (16 GB)

16 GB gpt-oss-20b 100+ token/s

GeForce RTX 4070 Ti SUPER (16 GB)

16 GB gpt-oss-20b 100+ token/s

GeForce RTX 4070 Ti (12 GB)

12 GB Llama 3.1 8B 66–95 token/s

GeForce RTX 4070 SUPER (12 GB)

12 GB Llama 3.1 8B 66–95 token/s

GeForce RTX 4070 (12 GB)

12 GB Llama 3.1 8B 58–84 token/s

GeForce RTX 4060 Ti (16 GB)

16 GB gpt-oss-20b 55–96 token/s

GeForce RTX 4060 Ti (8 GB)

8 GB Llama 3.1 8B 38–55 token/s

GeForce RTX 4060 (8 GB)

8 GB Llama 3.1 8B 31–56 token/s

GeForce RTX 3090 (24 GB)

24 GB gpt-oss-20b 100+ token/s

GeForce RTX 3080 (10 GB)

10 GB Llama 3.1 8B 88–127 token/s

GeForce RTX 3070 (8 GB)

8 GB Llama 3.1 8B 50–72 token/s

GeForce RTX 3060 Ti (8 GB)

8 GB Llama 3.1 8B 54–78 token/s

GeForce RTX 3060 (12 GB)

12 GB Llama 3.1 8B 47–68 token/s

Stime, non misurazioni, calcolate a partire dai benchmark pubblici di llama.cpp. Dati rivisti il 26 settembre 2026.

Su un PC decide la memoria della scheda grafica (VRAM): 8 GB per modelli da 4 a 8 miliardi di parametri, 16 GB per 14 miliardi o gpt-oss-20b, da 24 a 32 GB per 32 miliardi.

Le schede grafiche leggono la loro memoria molto velocemente: con un modello che ci sta, scrivono più velocemente di qualsiasi Mac.

Twoody per Windows e Linux è in preparazione; la versione in fase di test esegue i modelli sul processore. Nel frattempo, queste velocità sono quelle di LM Studio o Ollama.

Domande sull'uso di un LLM in locale

Quale LLM per una RTX 4090?

Con 24 GB, Qwen3 32B o Gemma 4 31B entrano a 4 bit, e gpt-oss-20b scrive a ben più di 100 token al secondo.

Basta una scheda grafica da 8 GB?

Per modelli da 4 a 8 miliardi di parametri sì, con una conversazione breve. Quelli più grandi sconfinano nella memoria del computer e rallentano molto.

Twoody funziona su Windows con una scheda NVIDIA?

Non ancora: la versione per Windows è in preparazione. Lascia la tua email nella pagina delle piattaforme: ti avviseremo quando sarà pronta.

Il miglior LLM locale, computer per computer

Prova l'IA locale sul tuo Mac, gratis.

Versione 0.12.1 · macOS 13 o successivo · senza account, senza abbonamento. Scarica l'app, installa un modello con un clic e fai la tua prima domanda — anche offline.