Calcolatore di LLM locali
Quale LLM locale gira sul tuo computer, e a che velocità?
Scegli il tuo Mac o PC. Scopri quali modelli aperti entrano nella sua memoria, a che velocità scrivono, quanto ci mettono a leggere un documento e a cosa servono.
I modelli per questo computer
Su iMac, Mac mini Intel (2017–2020) con 64 GB: 32 modelli su 36 girano bene.
Cosa installa Twoody su questo Mac
Qwen3 14B, installato con un clic, per conversazioni da 16k token.
Gira senza problemi · 1,8–3,2 token/s (più lento della tua lettura) · 20 pagine in 15 min
Su un Mac Intel il modello gira sul processore: funziona, ma lentamente.
Girano bene su questo computer
48,3 su 60 GB
Gira senza problemi
6,4–11 token/s
più o meno al tuo ritmo di lettura
20 pagine in 4 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Codice
- Ragionamento
- Agenti
47,1 su 60 GB
Gira senza problemi
0,4–0,7 token/s
più lento della tua lettura
20 pagine in 73 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Codice
- Ragionamento
- Agenti
19,2 su 60 GB
Gira senza problemi
7,5–13 token/s
più veloce della tua lettura
20 pagine in 4 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Codice
- Ragionamento
- Agenti
20,1 su 60 GB
Gira senza problemi
6,5–12 token/s
più o meno al tuo ritmo di lettura
20 pagine in 4 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Codice
- Ragionamento
- Agenti
20,1 su 60 GB
Gira senza problemi
6,5–12 token/s
più o meno al tuo ritmo di lettura
20 pagine in 4 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Codice
- Agenti
22,5 su 60 GB
Gira senza problemi
6,4–11 token/s
più o meno al tuo ritmo di lettura
20 pagine in 4 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Codice
- Ragionamento
- Agenti
12,7 su 60 GB
Gira senza problemi
5,4–9,7 token/s
più o meno al tuo ritmo di lettura
20 pagine in 5 min
- Chat e scrittura
- I tuoi documenti
- Codice
- Ragionamento
- Agenti
17,7 su 60 GB
Gira senza problemi
5,3–9,5 token/s
più o meno al tuo ritmo di lettura
20 pagine in 5 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Codice
- Agenti
17 su 60 GB
Gira senza problemi
1,1–2 token/s
più lento della tua lettura
20 pagine in 25 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Codice
- Agenti
17 su 60 GB
Gira senza problemi
1,1–2 token/s
più lento della tua lettura
20 pagine in 25 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Codice
- Agenti
19,8 su 60 GB
Gira senza problemi
0,9–1,6 token/s
più lento della tua lettura
20 pagine in 32 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Codice
- Agenti
17,6 su 60 GB
Gira senza problemi
0,8–1,5 token/s
più lento della tua lettura
20 pagine in 29 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Codice
- Ragionamento
- Agenti
23,8 su 60 GB
Gira senza problemi
0,8–1,5 token/s
più lento della tua lettura
20 pagine in 34 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Codice
- Ragionamento
- Agenti
7,3 su 60 GB
Gira senza problemi
3,2–5,7 token/s
più lento della tua lettura
20 pagine in 8 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
7,7 su 60 GB
Gira senza problemi
3,1–5,6 token/s
più lento della tua lettura
20 pagine in 8 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Ragionamento
7,7 su 60 GB
Gira senza problemi
3,1–5,6 token/s
più lento della tua lettura
20 pagine in 8 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Ragionamento
7,7 su 60 GB
Gira senza problemi
3–5,4 token/s
più lento della tua lettura
20 pagine in 9 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
6,6 su 60 GB
Gira senza problemi
2,4–4,3 token/s
più lento della tua lettura
20 pagine in 10 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Ragionamento
8,1 su 60 GB
Gira senza problemi
2,3–4,1 token/s
più lento della tua lettura
20 pagine in 12 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
11,1 su 60 GB
Gira senza problemi
1,9–3,5 token/s
più lento della tua lettura
20 pagine in 14 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
12,3 su 60 GB
Gira senza problemi
1,8–3,2 token/s
più lento della tua lettura
20 pagine in 15 min
- Chat e scrittura
- I tuoi documenti
- Ragionamento
11,8 su 60 GB
Gira senza problemi
1,8–3,2 token/s
più lento della tua lettura
20 pagine in 15 min
- Chat e scrittura
- I tuoi documenti
- Traduzione
- Ragionamento
4,2 su 60 GB
Gira senza problemi
7,5–13 token/s
più veloce della tua lettura
20 pagine in 3 min
- Chat e scrittura
- Traduzione
4,9 su 60 GB
Gira senza problemi
6,1–11 token/s
più o meno al tuo ritmo di lettura
20 pagine in 4 min
- Chat e scrittura
5,2 su 60 GB
Gira senza problemi
6,1–11 token/s
più o meno al tuo ritmo di lettura
20 pagine in 4 min
- Chat e scrittura
- Traduzione
5,9 su 60 GB
Gira senza problemi
5,7–10 token/s
più o meno al tuo ritmo di lettura
20 pagine in 5 min
- Chat e scrittura
- Traduzione
3,7 su 60 GB
Gira senza problemi
4,9–8,8 token/s
più o meno al tuo ritmo di lettura
20 pagine in 5 min
- Chat e scrittura
- Traduzione
2,6 su 60 GB
Gira senza problemi
21–62 token/s
quasi istantaneo
20 pagine in 37 s
3,3 su 60 GB
Gira senza problemi
9,2–28 token/s
più veloce della tua lettura
20 pagine in 2 min
3,8 su 60 GB
Gira senza problemi
11–20 token/s
più veloce della tua lettura
20 pagine in 2 min
1,9 su 60 GB
Gira senza problemi
10–19 token/s
più veloce della tua lettura
20 pagine in 2 min
2,7 su 60 GB
Gira senza problemi
9,8–17 token/s
più veloce della tua lettura
20 pagine in 3 min
Troppo grandi per questo computer (4)
- gpt-oss-120b · 63,1 su 60 GB
- Mistral Small 4 119B · 71,1 su 60 GB
- Qwen3.5 122B-A10B · 75,7 su 60 GB
- Qwen3 235B-A22B · 142,4 su 60 GB
Stime, non misurazioni, calcolate a partire dai benchmark pubblici di llama.cpp. Dati rivisti il 26 settembre 2026.
Quanta memoria serve per un LLM locale?
È la memoria a decidere quali modelli ci stanno: il file del modello, più la conversazione che tiene a mente. Un Mac lascia usare alla grafica circa due terzi della memoria fino a 32 GB, tre quarti oltre. Con i file a 4 bit, ecco cosa gira senza problemi:
| Memoria | Consigliato — gira senza problemi |
|---|---|
| 8 GB | Llama 3.2 3B, Phi-4-mini, Qwen3.5 4B |
| 16 GB | Llama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B |
| 24 GB | gpt-oss-20b, Llama 3.1 8B, Qwen3 8B |
| 32 GB | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 48 GB | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 64 GB | Llama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B |
| 128 GB | Qwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B |
| 256 GB | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
| 512 GB | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
Perché la velocità dipende dalla banda di memoria
Per scrivere ogni parola, il computer legge dalla memoria i pesi attivi del modello. La velocità dipende quindi più dalla banda di memoria che dalla potenza del processore. Qwen3 8B, a 4 bit, su alcune macchine:
| Computer | Banda di memoria | Scrive |
|---|---|---|
| M1 | 68 GB/s | 8,7–12 token/s |
| M2 | 100 GB/s | 13–19 token/s |
| M4 | 120 GB/s | 15–21 token/s |
| M5 | 153 GB/s | 19–27 token/s |
| M4 Pro | 273 GB/s | 31–45 token/s |
| M4 Max | 546 GB/s | 53–76 token/s |
| M5 Max | 614 GB/s | 72–104 token/s |
| GeForce RTX 4090 (24 GB) | 1 008 GB/s | 100+ token/s |
4 bit o 8 bit?
I modelli vengono distribuiti compressi. I file a 4 bit (Q4_K_M, o MXFP4 per gpt-oss) sono grandi la metà di quelli a 8 bit, con una piccola perdita di qualità: è ciò che installa Twoody, e la scelta giusta sulla maggior parte dei computer. L'8 bit è un po' più preciso e richiede il doppio della memoria.
Token al secondo: cosa significa in pratica
Un token è un pezzo di parola: circa tre quarti di parola in inglese, un po' meno in italiano. Quando leggi in silenzio, procedi a circa 5 token al secondo.
| meno di 5 | più lento della tua lettura |
| da 5 a 10 | più o meno al tuo ritmo di lettura |
| da 10 a 20 | più veloce della tua lettura |
| da 20 a 50 | quasi istantaneo |
| più di 50 | sembra istantaneo |
Un modello che ragiona scrive da 300 a 3.000 token di ragionamento prima di rispondere: a 10 token al secondo, da mezzo minuto a cinque minuti. In Twoody, i livelli «Fast», «Thinking» e «Deep» stabiliscono quanto a lungo ragiona.
Leggere un documento
Prima di rispondere a domande su un documento, il modello lo legge — ed è qui che i chip recenti guadagnano di più. Qwen3 8B che legge un documento di 20 pagine, con 16 GB:
| M1 | 3 min |
| M4 | 76 s |
| M5 | 27 s |
Mac o PC?
Un Mac condivide la memoria tra processore e grafica: un Mac da 64 GB fa girare modelli che nessuna scheda grafica da 24 GB può contenere. La scheda grafica di un PC ha meno memoria ma la legge molto velocemente: con un modello che ci sta, una RTX 4090 scrive più velocemente di qualsiasi Mac. Oggi Twoody funziona su Mac; le versioni per Windows e Linux sono in preparazione.
Il miglior LLM locale, computer per computer
Metodo e fonti
La velocità di ogni macchina è calcolata a partire dalla sua velocità misurata sul modello di riferimento di llama.cpp (LLaMA 2 7B, 4 bit), riscalata in base a quanto ogni modello legge per parola, con le bande di memoria delle specifiche di Apple e NVIDIA. Il metodo è stato verificato su 20 misurazioni pubblicate che non sono servite a costruirlo: errore mediano del 4,5%, massimo del 23%, tutte entro gli intervalli mostrati.
Dati rivisti il 26 settembre 2026.
Fonti
- www.apple.com/newsroom/
- support.apple.com/specs
- github.com/ggml-org/llama.cpp/discussions/4167
- github.com/ggml-org/llama.cpp/discussions/15013
- github.com/ggml-org/llama.cpp/discussions/10879
- github.com/ggml-org/llama.cpp/discussions/15396
- www.nvidia.com/en-us/geforce/graphics-cards/compare/
- huggingface.co/models
- www.sciencedirect.com/science/article/abs/pii/S0749596X19300786
Domande sull'uso di un LLM in locale
Posso eseguire un LLM locale con 8 GB di memoria?
Sì, uno piccolo: Qwen3 4B o Qwen3.5 4B girano su un Mac da 8 GB e bastano per email, riassunti e domande semplici. Mentre lo usi, chiudi le app pesanti. Su questi Mac, Twoody installa Qwen3 4B.
Quale LLM per un Mac con 16 GB?
Un modello da 7 a 9 miliardi di parametri: Qwen3 8B, Qwen3.5 9B o Llama 3.1 8B scrivono circa 15–25 token al secondo sui Mac recenti e rispondono bene alle domande sui tuoi documenti. Twoody installa Qwen3 8B.
Quanta memoria serve per un modello 70B?
Circa 48 GB per il suo file a 4 bit e una conversazione breve: un Mac da 64 GB fa girare Llama 3.3 70B, a 7–13 token al secondo a seconda del chip. I modelli MoE (mixture of experts) come gpt-oss-120b richiedono più memoria, ma scrivono molto più velocemente.
Un modello a 4 bit è molto peggio di uno a 8 bit?
Di poco. Per scrivere, riassumere e fare domande sui documenti la differenza si nota appena, e il 4 bit dimezza la memoria e raddoppia la velocità. Scegli l'8 bit solo se hai memoria in abbondanza.
Mac o scheda grafica NVIDIA per un LLM locale?
Una scheda grafica scrive più velocemente con un modello che entra nella sua memoria (da 8 a 32 GB); un Mac contiene modelli molto più grandi nella sua memoria unificata (fino a 512 GB). Per una persona che lavora sui documenti, un Mac da 16 a 64 GB è la scelta più semplice.
Un LLM locale fa scaldare troppo un MacBook Air?
Un MacBook Air non ha ventola: dopo qualche minuto di scrittura continua rallenta per restare fresco. Con risposte di lunghezza normale non si nota; per sessioni lunghe, un MacBook Pro o un Mac mini mantengono la loro velocità.
Mi servono LM Studio, Ollama o MLX?
Non con Twoody: installa un modello con un clic e lo fa girare sul proprio motore, llama.cpp. Se usi già LM Studio, Ollama o mlx-lm, Twoody usa anche i loro modelli.
Quanto sono precise queste stime?
Su 20 misurazioni pubblicate che non sono servite a costruire la formula, l'errore mediano è del 4,5% e il massimo del 23%; ognuna rientrava nell'intervallo mostrato. La tua velocità dipende anche dall'app, dalla sua versione e da cos'altro sta facendo il computer.
Prova l'IA locale sul tuo Mac, gratis.
Versione 0.12.1 · macOS 13 o successivo · senza account, senza abbonamento. Scarica l'app, installa un modello con un clic e fai la tua prima domanda — anche offline.