Calcolatore di LLM locali
Il miglior LLM locale per il tuo MacBook Pro
Da un M1 con 8 GB a un M5 Max con 128 GB: il modello più potente che gira senza problemi su ogni MacBook Pro, e a che velocità scrive.
| Il tuo computer | Memoria | Consigliato — gira senza problemi | Scrive | Con un clic in Twoody |
|---|---|---|---|---|
M5 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 100+ token/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 100+ token/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 100+ token/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 96–193 token/s | Qwen3 14B | |
M5 Pro — MacBook Pro, Mac mini |
24 GB | gpt-oss-20b | 68–97 token/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 92–132 token/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 92–132 token/s | Qwen3 14B | |
M5 — MacBook Air, MacBook Pro |
16 GB | Llama 3.1 8B | 20–28 token/s | Qwen3 8B |
| 24 GB | gpt-oss-20b | 32–47 token/s | Qwen3 14B | |
| 32 GB | GLM-4.7-Flash | 41–59 token/s | Qwen3 14B | |
M4 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 73–106 token/s | Qwen3 14B |
| 48 GB | gpt-oss-20b | 85–122 token/s | Qwen3 14B | |
| 64 GB | gpt-oss-20b | 85–122 token/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 53–107 token/s | Qwen3 14B | |
M4 Pro — MacBook Pro, Mac mini |
24 GB | gpt-oss-20b | 52–74 token/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 56–81 token/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 56–81 token/s | Qwen3 14B | |
M4 — MacBook Air, MacBook Pro, Mac mini, iMac |
16 GB | Llama 3.1 8B | 15–22 token/s | Qwen3 8B |
| 24 GB | gpt-oss-20b | 25–36 token/s | Qwen3 14B | |
| 32 GB | GLM-4.7-Flash | 32–46 token/s | Qwen3 14B | |
M3 Max — MacBook Pro |
36 GB | GLM-4.7-Flash | 68–97 token/s | Qwen3 14B |
| 48 GB | gpt-oss-20b | 68–98 token/s | Qwen3 14B | |
| 64 GB | gpt-oss-20b | 68–98 token/s | Qwen3 14B | |
| 96 GB | Qwen3-Next 80B-A3B | 47–93 token/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 46–93 token/s | Qwen3 14B | |
M3 Pro — MacBook Pro |
18 GB | Llama 3.1 8B | 19–28 token/s | Qwen3 8B |
| 36 GB | GLM-4.7-Flash | 42–60 token/s | Qwen3 14B | |
M3 — MacBook Air, MacBook Pro, iMac |
8 GB | Llama 3.2 3B | 31–45 token/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 13–19 token/s | Qwen3 8B | |
| 24 GB | gpt-oss-20b | 23–32 token/s | Qwen3 14B | |
M2 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 62–90 token/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 62–90 token/s | Qwen3 14B | |
| 96 GB | Qwen3-Next 80B-A3B | 39–78 token/s | Qwen3 14B | |
M2 Pro — MacBook Pro, Mac mini |
16 GB | Llama 3.1 8B | 24–35 token/s | Qwen3 8B |
| 32 GB | GLM-4.7-Flash | 45–65 token/s | Qwen3 14B | |
M2 — MacBook Air, MacBook Pro, Mac mini |
8 GB | Llama 3.2 3B | 32–45 token/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 13–19 token/s | Qwen3 8B | |
| 24 GB | gpt-oss-20b | 23–33 token/s | Qwen3 14B | |
M1 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 56–80 token/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 56–80 token/s | Qwen3 14B | |
M1 Pro — MacBook Pro |
16 GB | Llama 3.1 8B | 23–33 token/s | Qwen3 8B |
| 32 GB | GLM-4.7-Flash | 39–56 token/s | Qwen3 14B | |
M1 — MacBook Air, MacBook Pro, Mac mini, iMac |
8 GB | Llama 3.2 3B | 20–29 token/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 8,9–13 token/s | Qwen3 8B |
Stime, non misurazioni, calcolate a partire dai benchmark pubblici di llama.cpp. Dati rivisti il 26 settembre 2026.
La memoria decide la dimensione del modello: 16 GB per 8 miliardi di parametri, da 32 a 48 GB per i modelli MoE (mixture of experts) come Qwen3 30B-A3B, 64 GB e oltre per i modelli da 70 miliardi.
I chip Pro e Max leggono la memoria da due a cinque volte più velocemente dei chip base: è questo che li rende veloci con i modelli grandi.
Grazie alle ventole, un MacBook Pro mantiene la velocità durante le sessioni lunghe, sia a batteria sia collegato alla corrente.
Domande sull'uso di un LLM in locale
Quale LLM per un MacBook Pro con M4 Max?
Con 64 GB o più, gpt-oss-120b (con 128 GB), Llama 3.3 70B o Qwen3 30B-A3B; i modelli MoE scrivono diverse volte più velocemente del 70B denso.
Cosa cambia con 48 GB su un MacBook Pro?
Fa girare senza problemi modelli MoE come Qwen3 30B-A3B o gpt-oss-20b, a diverse decine di token al secondo, lasciando spazio alle altre app.
Un LLM locale scarica la batteria di un MacBook Pro?
Scrivere una risposta impegna la grafica al massimo per qualche secondo; tra una risposta e l'altra il modello resta in attesa senza consumare. Lavorare a lungo sui documenti a batteria va bene; ore di scrittura continua, no.
Il miglior LLM locale, computer per computer
Prova l'IA locale sul tuo Mac, gratis.
Versione 0.12.1 · macOS 13 o successivo · senza account, senza abbonamento. Scarica l'app, installa un modello con un clic e fai la tua prima domanda — anche offline.