Twoody

Calcolatore di LLM locali

Quale LLM locale gira sul tuo computer, e a che velocità?

Scegli il tuo Mac o PC. Scopri quali modelli aperti entrano nella sua memoria, a che velocità scrivono, quanto ci mettono a leggere un documento e a cosa servono.

Quale Mac ho? Menu Apple › Informazioni su questo Mac indica il chip e la memoria. Su un PC: Gestione attività › Prestazioni › GPU.

I modelli per questo computer

Su M1 Pro con 32 GB: 28 modelli su 36 girano bene.

Cosa installa Twoody su questo Mac

Qwen3 14B, installato con un clic, per conversazioni da 16k token.

Gira senza problemi · 13–19 token/s (più veloce della tua lettura) · 20 pagine in 2 min

Scarica per Mac con Apple Silicon

Girano bene su questo computer

GLM-4.7-Flash

Z.ai · MIT

Tramite LM Studio, Ollama o mlx-lm

19,2 su 20,3 GB

Gira senza problemi

39–56 token/s

quasi istantaneo

20 pagine in 34 s

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
  • Codice
  • Ragionamento
  • Agenti
gpt-oss-20b

OpenAI · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

12,7 su 20,3 GB

Gira senza problemi

37–53 token/s

quasi istantaneo

20 pagine in 41 s

  • Chat e scrittura
  • I tuoi documenti
  • Codice
  • Ragionamento
  • Agenti
Qwen3 30B-A3B

Qwen (Alibaba) · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

20,1 su 20,3 GB

Gira senza problemi

35–51 token/s

quasi istantaneo

20 pagine in 37 s

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
  • Codice
  • Ragionamento
  • Agenti
Qwen3-Coder 30B-A3B

Qwen (Alibaba) · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

20,1 su 20,3 GB

Gira senza problemi

35–51 token/s

quasi istantaneo

20 pagine in 37 s

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
  • Codice
  • Agenti
Gemma 4 26B-A4B

Google · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

17,7 su 20,3 GB

Gira senza problemi

35–50 token/s

quasi istantaneo

20 pagine in 45 s

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
  • Codice
  • Agenti
Mistral Small 3.2 24B

Mistral AI · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

17 su 20,3 GB

Gira senza problemi

8,8–13 token/s

più veloce della tua lettura

20 pagine in 4 min

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
  • Codice
  • Agenti
Devstral Small 2 24B

Mistral AI · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

17 su 20,3 GB

Gira senza problemi

8,8–13 token/s

più veloce della tua lettura

20 pagine in 4 min

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
  • Codice
  • Agenti
Gemma 4 31B

Google · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

19,8 su 20,3 GB

Gira senza problemi

6,8–9,8 token/s

più o meno al tuo ritmo di lettura

20 pagine in 5 min

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
  • Codice
  • Agenti
Qwen3.8 27B

Qwen (Alibaba) · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

17,6 su 20,3 GB

Gira senza problemi

5,2–10 token/s

più o meno al tuo ritmo di lettura

20 pagine in 4 min

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
  • Codice
  • Ragionamento
  • Agenti
Llama 3.1 8B

Meta · Llama 3.1 Community

Tramite LM Studio, Ollama o mlx-lm

7,3 su 20,3 GB

Gira senza problemi

23–33 token/s

quasi istantaneo

20 pagine in 71 s

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
Qwen3 8B

Qwen (Alibaba) · Apache 2.0

Con un clic in Twoody

7,7 su 20,3 GB

Gira senza problemi

22–32 token/s

quasi istantaneo

20 pagine in 73 s

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
  • Ragionamento
DeepSeek-R1-0528-Qwen3-8B

DeepSeek · MIT

Tramite LM Studio, Ollama o mlx-lm

7,7 su 20,3 GB

Gira senza problemi

22–32 token/s

quasi istantaneo

20 pagine in 73 s

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
  • Ragionamento
Ministral 3 8B

Mistral AI · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

7,7 su 20,3 GB

Gira senza problemi

22–31 token/s

quasi istantaneo

20 pagine in 79 s

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
Qwen3.5 9B

Qwen (Alibaba) · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

6,6 su 20,3 GB

Gira senza problemi

14–29 token/s

quasi istantaneo

20 pagine in 87 s

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
  • Ragionamento
Gemma 4 12B

Google · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

8,1 su 20,3 GB

Gira senza problemi

16–23 token/s

quasi istantaneo

20 pagine in 2 min

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
Ministral 3 14B

Mistral AI · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

11,1 su 20,3 GB

Gira senza problemi

14–21 token/s

più veloce della tua lettura

20 pagine in 2 min

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
Phi-4 14B

Microsoft · MIT

Tramite LM Studio, Ollama o mlx-lm

12,3 su 20,3 GB

Gira senza problemi

13–19 token/s

più veloce della tua lettura

20 pagine in 2 min

  • Chat e scrittura
  • I tuoi documenti
  • Ragionamento
Qwen3 14B

Qwen (Alibaba) · Apache 2.0

Con un clic in Twoody

11,8 su 20,3 GB

Gira senza problemi

13–19 token/s

più veloce della tua lettura

20 pagine in 2 min

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
  • Ragionamento
Llama 3.2 3B

Meta · Llama 3.2 Community

Tramite LM Studio, Ollama o mlx-lm

4,2 su 20,3 GB

Gira senza problemi

48–68 token/s

sembra istantaneo

20 pagine in 28 s

  • Chat e scrittura
  • Traduzione
Phi-4-mini

Microsoft · MIT

Tramite LM Studio, Ollama o mlx-lm

4,9 su 20,3 GB

Gira senza problemi

39–57 token/s

quasi istantaneo

20 pagine in 34 s

  • Chat e scrittura
Qwen3 4B

Qwen (Alibaba) · Apache 2.0

Con un clic in Twoody

5,2 su 20,3 GB

Gira senza problemi

38–55 token/s

quasi istantaneo

20 pagine in 35 s

  • Chat e scrittura
  • Traduzione
Gemma 4 E4B

Google · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

5,9 su 20,3 GB

Gira senza problemi

35–50 token/s

quasi istantaneo

20 pagine in 40 s

  • Chat e scrittura
  • Traduzione
Qwen3.5 4B

Qwen (Alibaba) · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

3,7 su 20,3 GB

Gira senza problemi

26–52 token/s

quasi istantaneo

20 pagine in 42 s

  • Chat e scrittura
  • Traduzione
Qwen3 0.6B

Qwen (Alibaba) · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

2,6 su 20,3 GB

Gira senza problemi

69–206 token/s

sembra istantaneo

20 pagine in 5 s

Qwen3 1.7B

Qwen (Alibaba) · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

3,3 su 20,3 GB

Gira senza problemi

44–131 token/s

sembra istantaneo

20 pagine in 15 s

Qwen3.5 2B

Qwen (Alibaba) · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

1,9 su 20,3 GB

Gira senza problemi

49–98 token/s

sembra istantaneo

20 pagine in 18 s

Gemma 4 E2B

Google · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

3,8 su 20,3 GB

Gira senza problemi

59–85 token/s

sembra istantaneo

20 pagine in 20 s

MiniCPM5 2B

OpenBMB · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

2,7 su 20,3 GB

Gira senza problemi

51–73 token/s

sembra istantaneo

20 pagine in 22 s

Girano, ma molto più lentamente (2)
Qwen3.6 35B-A3B

Qwen (Alibaba) · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

22,5 su 20,3 GB

In parte sul processore: molto più lento

11–23 token/s

più veloce della tua lettura

20 pagine in 76 s

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
  • Codice
  • Ragionamento
  • Agenti
Qwen3 32B

Qwen (Alibaba) · Apache 2.0

Tramite LM Studio, Ollama o mlx-lm

23,8 su 20,3 GB

In parte sul processore: molto più lento

2,5–3,6 token/s

più lento della tua lettura

20 pagine in 12 min

  • Chat e scrittura
  • I tuoi documenti
  • Traduzione
  • Codice
  • Ragionamento
  • Agenti
Troppo grandi per questo computer (6)
  • Llama 3.3 70B · 47,1 su 20,3 GB
  • Qwen3-Next 80B-A3B · 48,3 su 20,3 GB
  • gpt-oss-120b · 63,1 su 20,3 GB
  • Mistral Small 4 119B · 71,1 su 20,3 GB
  • Qwen3.5 122B-A10B · 75,7 su 20,3 GB
  • Qwen3 235B-A22B · 142,4 su 20,3 GB

Stime, non misurazioni, calcolate a partire dai benchmark pubblici di llama.cpp. Dati rivisti il 26 settembre 2026.

Quanta memoria serve per un LLM locale?

È la memoria a decidere quali modelli ci stanno: il file del modello, più la conversazione che tiene a mente. Un Mac lascia usare alla grafica circa due terzi della memoria fino a 32 GB, tre quarti oltre. Con i file a 4 bit, ecco cosa gira senza problemi:

MemoriaConsigliato — gira senza problemi
8 GBLlama 3.2 3B, Phi-4-mini, Qwen3.5 4B
16 GBLlama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B
24 GBgpt-oss-20b, Llama 3.1 8B, Qwen3 8B
32 GBGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
48 GBGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
64 GBLlama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B
128 GBQwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B
256 GBQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B
512 GBQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B

Perché la velocità dipende dalla banda di memoria

Per scrivere ogni parola, il computer legge dalla memoria i pesi attivi del modello. La velocità dipende quindi più dalla banda di memoria che dalla potenza del processore. Qwen3 8B, a 4 bit, su alcune macchine:

Computer Banda di memoria Scrive
M1 68 GB/s 8,7–12 token/s
M2 100 GB/s 13–19 token/s
M4 120 GB/s 15–21 token/s
M5 153 GB/s 19–27 token/s
M4 Pro 273 GB/s 31–45 token/s
M4 Max 546 GB/s 53–76 token/s
M5 Max 614 GB/s 72–104 token/s
GeForce RTX 4090 (24 GB) 1 008 GB/s 100+ token/s

4 bit o 8 bit?

I modelli vengono distribuiti compressi. I file a 4 bit (Q4_K_M, o MXFP4 per gpt-oss) sono grandi la metà di quelli a 8 bit, con una piccola perdita di qualità: è ciò che installa Twoody, e la scelta giusta sulla maggior parte dei computer. L'8 bit è un po' più preciso e richiede il doppio della memoria.

Token al secondo: cosa significa in pratica

Un token è un pezzo di parola: circa tre quarti di parola in inglese, un po' meno in italiano. Quando leggi in silenzio, procedi a circa 5 token al secondo.

meno di 5più lento della tua lettura
da 5 a 10più o meno al tuo ritmo di lettura
da 10 a 20più veloce della tua lettura
da 20 a 50quasi istantaneo
più di 50sembra istantaneo

Un modello che ragiona scrive da 300 a 3.000 token di ragionamento prima di rispondere: a 10 token al secondo, da mezzo minuto a cinque minuti. In Twoody, i livelli «Fast», «Thinking» e «Deep» stabiliscono quanto a lungo ragiona.

Leggere un documento

Prima di rispondere a domande su un documento, il modello lo legge — ed è qui che i chip recenti guadagnano di più. Qwen3 8B che legge un documento di 20 pagine, con 16 GB:

M13 min
M476 s
M527 s

Mac o PC?

Un Mac condivide la memoria tra processore e grafica: un Mac da 64 GB fa girare modelli che nessuna scheda grafica da 24 GB può contenere. La scheda grafica di un PC ha meno memoria ma la legge molto velocemente: con un modello che ci sta, una RTX 4090 scrive più velocemente di qualsiasi Mac. Oggi Twoody funziona su Mac; le versioni per Windows e Linux sono in preparazione.

Il miglior LLM locale, computer per computer

Metodo e fonti

La velocità di ogni macchina è calcolata a partire dalla sua velocità misurata sul modello di riferimento di llama.cpp (LLaMA 2 7B, 4 bit), riscalata in base a quanto ogni modello legge per parola, con le bande di memoria delle specifiche di Apple e NVIDIA. Il metodo è stato verificato su 20 misurazioni pubblicate che non sono servite a costruirlo: errore mediano del 4,5%, massimo del 23%, tutte entro gli intervalli mostrati.

Dati rivisti il 26 settembre 2026.

Fonti

Scarica i dati (JSON, CC BY 4.0)

Domande sull'uso di un LLM in locale

Posso eseguire un LLM locale con 8 GB di memoria?

Sì, uno piccolo: Qwen3 4B o Qwen3.5 4B girano su un Mac da 8 GB e bastano per email, riassunti e domande semplici. Mentre lo usi, chiudi le app pesanti. Su questi Mac, Twoody installa Qwen3 4B.

Quale LLM per un Mac con 16 GB?

Un modello da 7 a 9 miliardi di parametri: Qwen3 8B, Qwen3.5 9B o Llama 3.1 8B scrivono circa 15–25 token al secondo sui Mac recenti e rispondono bene alle domande sui tuoi documenti. Twoody installa Qwen3 8B.

Quanta memoria serve per un modello 70B?

Circa 48 GB per il suo file a 4 bit e una conversazione breve: un Mac da 64 GB fa girare Llama 3.3 70B, a 7–13 token al secondo a seconda del chip. I modelli MoE (mixture of experts) come gpt-oss-120b richiedono più memoria, ma scrivono molto più velocemente.

Un modello a 4 bit è molto peggio di uno a 8 bit?

Di poco. Per scrivere, riassumere e fare domande sui documenti la differenza si nota appena, e il 4 bit dimezza la memoria e raddoppia la velocità. Scegli l'8 bit solo se hai memoria in abbondanza.

Mac o scheda grafica NVIDIA per un LLM locale?

Una scheda grafica scrive più velocemente con un modello che entra nella sua memoria (da 8 a 32 GB); un Mac contiene modelli molto più grandi nella sua memoria unificata (fino a 512 GB). Per una persona che lavora sui documenti, un Mac da 16 a 64 GB è la scelta più semplice.

Un LLM locale fa scaldare troppo un MacBook Air?

Un MacBook Air non ha ventola: dopo qualche minuto di scrittura continua rallenta per restare fresco. Con risposte di lunghezza normale non si nota; per sessioni lunghe, un MacBook Pro o un Mac mini mantengono la loro velocità.

Mi servono LM Studio, Ollama o MLX?

Non con Twoody: installa un modello con un clic e lo fa girare sul proprio motore, llama.cpp. Se usi già LM Studio, Ollama o mlx-lm, Twoody usa anche i loro modelli.

Quanto sono precise queste stime?

Su 20 misurazioni pubblicate che non sono servite a costruire la formula, l'errore mediano è del 4,5% e il massimo del 23%; ognuna rientrava nell'intervallo mostrato. La tua velocità dipende anche dall'app, dalla sua versione e da cos'altro sta facendo il computer.

Prova l'IA locale sul tuo Mac, gratis.

Versione 0.12.1 · macOS 13 o successivo · senza account, senza abbonamento. Scarica l'app, installa un modello con un clic e fai la tua prima domanda — anche offline.