Calcolatore di LLM locali
Il miglior LLM locale per la tua scheda grafica NVIDIA
Dalla RTX 3060 alla RTX 5090: il modello più potente che entra nella memoria di ogni scheda, e a che velocità scrive.
| Il tuo computer | Memoria | Consigliato — gira senza problemi | Scrive |
|---|---|---|---|
GeForce RTX 5090 (32 GB) |
32 GB | gpt-oss-20b | 100+ token/s |
GeForce RTX 5080 (16 GB) |
16 GB | gpt-oss-20b | 100+ token/s |
GeForce RTX 5070 Ti (16 GB) |
16 GB | gpt-oss-20b | 100+ token/s |
GeForce RTX 5070 (12 GB) |
12 GB | Llama 3.1 8B | 80–116 token/s |
GeForce RTX 5060 Ti (16 GB) |
16 GB | gpt-oss-20b | 82–142 token/s |
GeForce RTX 5060 Ti (8 GB) |
8 GB | Llama 3.1 8B | 57–83 token/s |
GeForce RTX 5060 (8 GB) |
8 GB | Llama 3.1 8B | 50–89 token/s |
GeForce RTX 4090 (24 GB) |
24 GB | GLM-4.7-Flash | 100+ token/s |
GeForce RTX 4080 SUPER (16 GB) |
16 GB | gpt-oss-20b | 100+ token/s |
GeForce RTX 4080 (16 GB) |
16 GB | gpt-oss-20b | 100+ token/s |
GeForce RTX 4070 Ti SUPER (16 GB) |
16 GB | gpt-oss-20b | 100+ token/s |
GeForce RTX 4070 Ti (12 GB) |
12 GB | Llama 3.1 8B | 66–95 token/s |
GeForce RTX 4070 SUPER (12 GB) |
12 GB | Llama 3.1 8B | 66–95 token/s |
GeForce RTX 4070 (12 GB) |
12 GB | Llama 3.1 8B | 58–84 token/s |
GeForce RTX 4060 Ti (16 GB) |
16 GB | gpt-oss-20b | 55–96 token/s |
GeForce RTX 4060 Ti (8 GB) |
8 GB | Llama 3.1 8B | 38–55 token/s |
GeForce RTX 4060 (8 GB) |
8 GB | Llama 3.1 8B | 31–56 token/s |
GeForce RTX 3090 (24 GB) |
24 GB | gpt-oss-20b | 100+ token/s |
GeForce RTX 3080 (10 GB) |
10 GB | Llama 3.1 8B | 88–127 token/s |
GeForce RTX 3070 (8 GB) |
8 GB | Llama 3.1 8B | 50–72 token/s |
GeForce RTX 3060 Ti (8 GB) |
8 GB | Llama 3.1 8B | 54–78 token/s |
GeForce RTX 3060 (12 GB) |
12 GB | Llama 3.1 8B | 47–68 token/s |
Stime, non misurazioni, calcolate a partire dai benchmark pubblici di llama.cpp. Dati rivisti il 26 settembre 2026.
Su un PC decide la memoria della scheda grafica (VRAM): 8 GB per modelli da 4 a 8 miliardi di parametri, 16 GB per 14 miliardi o gpt-oss-20b, da 24 a 32 GB per 32 miliardi.
Le schede grafiche leggono la loro memoria molto velocemente: con un modello che ci sta, scrivono più velocemente di qualsiasi Mac.
Twoody per Windows e Linux è in preparazione; la versione in fase di test esegue i modelli sul processore. Nel frattempo, queste velocità sono quelle di LM Studio o Ollama.
Domande sull'uso di un LLM in locale
Quale LLM per una RTX 4090?
Con 24 GB, Qwen3 32B o Gemma 4 31B entrano a 4 bit, e gpt-oss-20b scrive a ben più di 100 token al secondo.
Basta una scheda grafica da 8 GB?
Per modelli da 4 a 8 miliardi di parametri sì, con una conversazione breve. Quelli più grandi sconfinano nella memoria del computer e rallentano molto.
Twoody funziona su Windows con una scheda NVIDIA?
Non ancora: la versione per Windows è in preparazione. Lascia la tua email nella pagina delle piattaforme: ti avviseremo quando sarà pronta.
Il miglior LLM locale, computer per computer
Prova l'IA locale sul tuo Mac, gratis.
Versione 0.12.1 · macOS 13 o successivo · senza account, senza abbonamento. Scarica l'app, installa un modello con un clic e fai la tua prima domanda — anche offline.