Calcolatore di LLM locali
Il miglior LLM locale per il tuo Mac Studio
Dall'M1 Max all'M5 Ultra con 512 GB: i modelli più grandi che un Mac possa contenere, e a che velocità scrivono.
| Il tuo computer | Memoria | Consigliato — gira senza problemi | Scrive | Con un clic in Twoody |
|---|---|---|---|---|
M5 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 100+ token/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 100+ token/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 100+ token/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 96–193 token/s | Qwen3 14B | |
M5 Ultra — Mac Studio |
96 GB | gpt-oss-120b | 92–163 token/s | Qwen3 14B |
| 256 GB | Qwen3 235B-A22B | 28–50 token/s | Qwen3 14B | |
| 512 GB | Qwen3 235B-A22B | 28–50 token/s | Qwen3 14B | |
M3 Ultra — Mac Studio |
96 GB | gpt-oss-120b | 63–90 token/s | Qwen3 14B |
| 256 GB | Qwen3 235B-A22B | 20–28 token/s | Qwen3 14B | |
| 512 GB | Qwen3 235B-A22B | 20–28 token/s | Qwen3 14B | |
M4 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 73–106 token/s | Qwen3 14B |
| 48 GB | gpt-oss-20b | 85–122 token/s | Qwen3 14B | |
| 64 GB | gpt-oss-20b | 85–122 token/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 53–107 token/s | Qwen3 14B | |
M2 Ultra — Mac Studio |
64 GB | gpt-oss-20b | 89–128 token/s | Qwen3 14B |
| 128 GB | gpt-oss-120b | 63–91 token/s | Qwen3 14B | |
| 192 GB | Qwen3 235B-A22B | 20–28 token/s | Qwen3 14B | |
M2 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 62–90 token/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 62–90 token/s | Qwen3 14B | |
| 96 GB | Qwen3-Next 80B-A3B | 39–78 token/s | Qwen3 14B | |
M1 Ultra — Mac Studio |
64 GB | gpt-oss-20b | 75–107 token/s | Qwen3 14B |
| 128 GB | gpt-oss-120b | 52–75 token/s | Qwen3 14B | |
M1 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 56–80 token/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 56–80 token/s | Qwen3 14B |
Stime, non misurazioni, calcolate a partire dai benchmark pubblici di llama.cpp. Dati rivisti il 26 settembre 2026.
Con 128–512 GB di memoria unificata, un Mac Studio carica modelli che nessuna scheda grafica può contenere: gpt-oss-120b, Qwen3.5 122B-A10B, persino Qwen3 235B-A22B.
I suoi chip Max e Ultra leggono la memoria da 400 GB/s a 1,2 TB/s: i modelli MoE (mixture of experts) rispondono a decine di token al secondo.
Silenzioso anche sotto carico, mantiene la velocità durante le sessioni lunghe.
Domande sull'uso di un LLM in locale
Quale LLM per un Mac Studio con chip Ultra?
Con 256 o 512 GB, Qwen3 235B-A22B, il modello più grande qui, gira senza problemi; gpt-oss-120b e Qwen3.5 122B-A10B scrivono più velocemente.
128 GB bastano per un modello 70B?
Sì, senza problemi: Llama 3.3 70B richiede circa 48 GB a 4 bit. Con 128 GB ci stanno anche modelli MoE come gpt-oss-120b.
Max o Ultra per un LLM locale?
L'Ultra raddoppia la banda di memoria e la memoria: risposte più veloci con i modelli grandi, e i modelli più grandi in assoluto. Per modelli fino a 70B basta un Max.
Il miglior LLM locale, computer per computer
Prova l'IA locale sul tuo Mac, gratis.
Versione 0.12.1 · macOS 13 o successivo · senza account, senza abbonamento. Scarica l'app, installa un modello con un clic e fai la tua prima domanda — anche offline.