Calcolatore di LLM locali
Quale LLM locale gira sul tuo computer, e a che velocità?
Scegli il tuo Mac o PC. Scopri quali modelli aperti entrano nella sua memoria, a che velocità scrivono, quanto ci mettono a leggere un documento e a cosa servono.
I modelli per questo computer
Su MacBook Air, MacBook Pro 13″ Intel (2018–2020) con 8 GB: 8 modelli su 36 girano bene.
Cosa installa Twoody su questo Mac
Qwen3 4B, installato con un clic, per conversazioni da 8k token.
Troppo grande per questo computer · 6,4–11 token/s (più o meno al tuo ritmo di lettura) · 12 pagine in 2 min
Su un Mac Intel il modello gira sul processore: funziona, ma lentamente.
Girano bene su questo computer
3,4 su 4 GB
Gira — chiudi le altre app
7,9–14 token/s
più veloce della tua lettura
12 pagine in 2 min
- Chat e scrittura
- Traduzione
3,9 su 4 GB
Gira — chiudi le altre app
6,5–12 token/s
più o meno al tuo ritmo di lettura
12 pagine in 2 min
- Chat e scrittura
3,4 su 4 GB
Gira — chiudi le altre app
5,2–9,3 token/s
più o meno al tuo ritmo di lettura
12 pagine in 3 min
- Chat e scrittura
- Traduzione
1,8 su 4 GB
Gira senza problemi
22–65 token/s
quasi istantaneo
12 pagine in 19 s
2,5 su 4 GB
Gira — chiudi le altre app
9,7–29 token/s
più veloce della tua lettura
12 pagine in 55 s
3,8 su 4 GB
Gira — chiudi le altre app
12–21 token/s
più veloce della tua lettura
12 pagine in 75 s
1,8 su 4 GB
Gira senza problemi
11–20 token/s
più veloce della tua lettura
12 pagine in 69 s
2,4 su 4 GB
Gira — chiudi le altre app
10–18 token/s
più veloce della tua lettura
12 pagine in 81 s
Troppo grandi per questo computer (28)
- Qwen3 4B · 4,1 su 4 GB
- Gemma 4 E4B · 5,8 su 4 GB
- Qwen3.5 9B · 6,3 su 4 GB
- Llama 3.1 8B · 6,3 su 4 GB
- Qwen3 8B · 6,5 su 4 GB
- DeepSeek-R1-0528-Qwen3-8B · 6,5 su 4 GB
- Ministral 3 8B · 6,6 su 4 GB
- Gemma 4 12B · 8 su 4 GB
- Ministral 3 14B · 9,8 su 4 GB
- Qwen3 14B · 10,6 su 4 GB
- Phi-4 14B · 10,8 su 4 GB
- gpt-oss-20b · 12,5 su 4 GB
- Devstral Small 2 24B · 15,8 su 4 GB
- Mistral Small 3.2 24B · 15,8 su 4 GB
- Qwen3.8 27B · 17,1 su 4 GB
- Gemma 4 26B-A4B · 17,7 su 4 GB
- GLM-4.7-Flash · 18,8 su 4 GB
- Qwen3 30B-A3B · 19,4 su 4 GB
- Qwen3-Coder 30B-A3B · 19,4 su 4 GB
- Gemma 4 31B · 19,5 su 4 GB
- Qwen3 32B · 21,8 su 4 GB
- Qwen3.6 35B-A3B · 22,3 su 4 GB
- Llama 3.3 70B · 44,6 su 4 GB
- Qwen3-Next 80B-A3B · 48,1 su 4 GB
- gpt-oss-120b · 62,8 su 4 GB
- Mistral Small 4 119B · 70,9 su 4 GB
- Qwen3.5 122B-A10B · 75,5 su 4 GB
- Qwen3 235B-A22B · 141 su 4 GB
Stime, non misurazioni, calcolate a partire dai benchmark pubblici di llama.cpp. Dati rivisti il 26 settembre 2026.
Quanta memoria serve per un LLM locale?
È la memoria a decidere quali modelli ci stanno: il file del modello, più la conversazione che tiene a mente. Un Mac lascia usare alla grafica circa due terzi della memoria fino a 32 GB, tre quarti oltre. Con i file a 4 bit, ecco cosa gira senza problemi:
| Memoria | Consigliato — gira senza problemi |
|---|---|
| 8 GB | Llama 3.2 3B, Phi-4-mini, Qwen3.5 4B |
| 16 GB | Llama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B |
| 24 GB | gpt-oss-20b, Llama 3.1 8B, Qwen3 8B |
| 32 GB | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 48 GB | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 64 GB | Llama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B |
| 128 GB | Qwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B |
| 256 GB | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
| 512 GB | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
Perché la velocità dipende dalla banda di memoria
Per scrivere ogni parola, il computer legge dalla memoria i pesi attivi del modello. La velocità dipende quindi più dalla banda di memoria che dalla potenza del processore. Qwen3 8B, a 4 bit, su alcune macchine:
| Computer | Banda di memoria | Scrive |
|---|---|---|
| M1 | 68 GB/s | 8,7–12 token/s |
| M2 | 100 GB/s | 13–19 token/s |
| M4 | 120 GB/s | 15–21 token/s |
| M5 | 153 GB/s | 19–27 token/s |
| M4 Pro | 273 GB/s | 31–45 token/s |
| M4 Max | 546 GB/s | 53–76 token/s |
| M5 Max | 614 GB/s | 72–104 token/s |
| GeForce RTX 4090 (24 GB) | 1 008 GB/s | 100+ token/s |
4 bit o 8 bit?
I modelli vengono distribuiti compressi. I file a 4 bit (Q4_K_M, o MXFP4 per gpt-oss) sono grandi la metà di quelli a 8 bit, con una piccola perdita di qualità: è ciò che installa Twoody, e la scelta giusta sulla maggior parte dei computer. L'8 bit è un po' più preciso e richiede il doppio della memoria.
Token al secondo: cosa significa in pratica
Un token è un pezzo di parola: circa tre quarti di parola in inglese, un po' meno in italiano. Quando leggi in silenzio, procedi a circa 5 token al secondo.
| meno di 5 | più lento della tua lettura |
| da 5 a 10 | più o meno al tuo ritmo di lettura |
| da 10 a 20 | più veloce della tua lettura |
| da 20 a 50 | quasi istantaneo |
| più di 50 | sembra istantaneo |
Un modello che ragiona scrive da 300 a 3.000 token di ragionamento prima di rispondere: a 10 token al secondo, da mezzo minuto a cinque minuti. In Twoody, i livelli «Fast», «Thinking» e «Deep» stabiliscono quanto a lungo ragiona.
Leggere un documento
Prima di rispondere a domande su un documento, il modello lo legge — ed è qui che i chip recenti guadagnano di più. Qwen3 8B che legge un documento di 20 pagine, con 16 GB:
| M1 | 3 min |
| M4 | 76 s |
| M5 | 27 s |
Mac o PC?
Un Mac condivide la memoria tra processore e grafica: un Mac da 64 GB fa girare modelli che nessuna scheda grafica da 24 GB può contenere. La scheda grafica di un PC ha meno memoria ma la legge molto velocemente: con un modello che ci sta, una RTX 4090 scrive più velocemente di qualsiasi Mac. Oggi Twoody funziona su Mac; le versioni per Windows e Linux sono in preparazione.
Il miglior LLM locale, computer per computer
Metodo e fonti
La velocità di ogni macchina è calcolata a partire dalla sua velocità misurata sul modello di riferimento di llama.cpp (LLaMA 2 7B, 4 bit), riscalata in base a quanto ogni modello legge per parola, con le bande di memoria delle specifiche di Apple e NVIDIA. Il metodo è stato verificato su 20 misurazioni pubblicate che non sono servite a costruirlo: errore mediano del 4,5%, massimo del 23%, tutte entro gli intervalli mostrati.
Dati rivisti il 26 settembre 2026.
Fonti
- www.apple.com/newsroom/
- support.apple.com/specs
- github.com/ggml-org/llama.cpp/discussions/4167
- github.com/ggml-org/llama.cpp/discussions/15013
- github.com/ggml-org/llama.cpp/discussions/10879
- github.com/ggml-org/llama.cpp/discussions/15396
- www.nvidia.com/en-us/geforce/graphics-cards/compare/
- huggingface.co/models
- www.sciencedirect.com/science/article/abs/pii/S0749596X19300786
Domande sull'uso di un LLM in locale
Posso eseguire un LLM locale con 8 GB di memoria?
Sì, uno piccolo: Qwen3 4B o Qwen3.5 4B girano su un Mac da 8 GB e bastano per email, riassunti e domande semplici. Mentre lo usi, chiudi le app pesanti. Su questi Mac, Twoody installa Qwen3 4B.
Quale LLM per un Mac con 16 GB?
Un modello da 7 a 9 miliardi di parametri: Qwen3 8B, Qwen3.5 9B o Llama 3.1 8B scrivono circa 15–25 token al secondo sui Mac recenti e rispondono bene alle domande sui tuoi documenti. Twoody installa Qwen3 8B.
Quanta memoria serve per un modello 70B?
Circa 48 GB per il suo file a 4 bit e una conversazione breve: un Mac da 64 GB fa girare Llama 3.3 70B, a 7–13 token al secondo a seconda del chip. I modelli MoE (mixture of experts) come gpt-oss-120b richiedono più memoria, ma scrivono molto più velocemente.
Un modello a 4 bit è molto peggio di uno a 8 bit?
Di poco. Per scrivere, riassumere e fare domande sui documenti la differenza si nota appena, e il 4 bit dimezza la memoria e raddoppia la velocità. Scegli l'8 bit solo se hai memoria in abbondanza.
Mac o scheda grafica NVIDIA per un LLM locale?
Una scheda grafica scrive più velocemente con un modello che entra nella sua memoria (da 8 a 32 GB); un Mac contiene modelli molto più grandi nella sua memoria unificata (fino a 512 GB). Per una persona che lavora sui documenti, un Mac da 16 a 64 GB è la scelta più semplice.
Un LLM locale fa scaldare troppo un MacBook Air?
Un MacBook Air non ha ventola: dopo qualche minuto di scrittura continua rallenta per restare fresco. Con risposte di lunghezza normale non si nota; per sessioni lunghe, un MacBook Pro o un Mac mini mantengono la loro velocità.
Mi servono LM Studio, Ollama o MLX?
Non con Twoody: installa un modello con un clic e lo fa girare sul proprio motore, llama.cpp. Se usi già LM Studio, Ollama o mlx-lm, Twoody usa anche i loro modelli.
Quanto sono precise queste stime?
Su 20 misurazioni pubblicate che non sono servite a costruire la formula, l'errore mediano è del 4,5% e il massimo del 23%; ognuna rientrava nell'intervallo mostrato. La tua velocità dipende anche dall'app, dalla sua versione e da cos'altro sta facendo il computer.
Prova l'IA locale sul tuo Mac, gratis.
Versione 0.12.1 · macOS 13 o successivo · senza account, senza abbonamento. Scarica l'app, installa un modello con un clic e fai la tua prima domanda — anche offline.