Local LLM calculator
The best local LLM for your MacBook Pro
From an M1 with 8 GB to an M5 Max with 128 GB: the strongest model that runs comfortably on each MacBook Pro, and how fast it writes.
| Your computer | Memory | Recommended — runs comfortably | Writes | One click in Twoody |
|---|---|---|---|---|
M5 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 96–193 tokens/s | Qwen3 14B | |
M5 Pro — MacBook Pro, Mac mini |
24 GB | gpt-oss-20b | 68–97 tokens/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 92–132 tokens/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 92–132 tokens/s | Qwen3 14B | |
M5 — MacBook Air, MacBook Pro |
16 GB | Llama 3.1 8B | 20–28 tokens/s | Qwen3 8B |
| 24 GB | gpt-oss-20b | 32–47 tokens/s | Qwen3 14B | |
| 32 GB | GLM-4.7-Flash | 41–59 tokens/s | Qwen3 14B | |
M4 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 73–106 tokens/s | Qwen3 14B |
| 48 GB | gpt-oss-20b | 85–122 tokens/s | Qwen3 14B | |
| 64 GB | gpt-oss-20b | 85–122 tokens/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 53–107 tokens/s | Qwen3 14B | |
M4 Pro — MacBook Pro, Mac mini |
24 GB | gpt-oss-20b | 52–74 tokens/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 56–81 tokens/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 56–81 tokens/s | Qwen3 14B | |
M4 — MacBook Air, MacBook Pro, Mac mini, iMac |
16 GB | Llama 3.1 8B | 15–22 tokens/s | Qwen3 8B |
| 24 GB | gpt-oss-20b | 25–36 tokens/s | Qwen3 14B | |
| 32 GB | GLM-4.7-Flash | 32–46 tokens/s | Qwen3 14B | |
M3 Max — MacBook Pro |
36 GB | GLM-4.7-Flash | 68–97 tokens/s | Qwen3 14B |
| 48 GB | gpt-oss-20b | 68–98 tokens/s | Qwen3 14B | |
| 64 GB | gpt-oss-20b | 68–98 tokens/s | Qwen3 14B | |
| 96 GB | Qwen3-Next 80B-A3B | 47–93 tokens/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 46–93 tokens/s | Qwen3 14B | |
M3 Pro — MacBook Pro |
18 GB | Llama 3.1 8B | 19–28 tokens/s | Qwen3 8B |
| 36 GB | GLM-4.7-Flash | 42–60 tokens/s | Qwen3 14B | |
M3 — MacBook Air, MacBook Pro, iMac |
8 GB | Llama 3.2 3B | 31–45 tokens/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 13–19 tokens/s | Qwen3 8B | |
| 24 GB | gpt-oss-20b | 23–32 tokens/s | Qwen3 14B | |
M2 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 62–90 tokens/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 62–90 tokens/s | Qwen3 14B | |
| 96 GB | Qwen3-Next 80B-A3B | 39–78 tokens/s | Qwen3 14B | |
M2 Pro — MacBook Pro, Mac mini |
16 GB | Llama 3.1 8B | 24–35 tokens/s | Qwen3 8B |
| 32 GB | GLM-4.7-Flash | 45–65 tokens/s | Qwen3 14B | |
M2 — MacBook Air, MacBook Pro, Mac mini |
8 GB | Llama 3.2 3B | 32–45 tokens/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 13–19 tokens/s | Qwen3 8B | |
| 24 GB | gpt-oss-20b | 23–33 tokens/s | Qwen3 14B | |
M1 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 56–80 tokens/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 56–80 tokens/s | Qwen3 14B | |
M1 Pro — MacBook Pro |
16 GB | Llama 3.1 8B | 23–33 tokens/s | Qwen3 8B |
| 32 GB | GLM-4.7-Flash | 39–56 tokens/s | Qwen3 14B | |
M1 — MacBook Air, MacBook Pro, Mac mini, iMac |
8 GB | Llama 3.2 3B | 20–29 tokens/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 8.9–13 tokens/s | Qwen3 8B |
Estimates, not measurements, computed from public llama.cpp benchmarks. Figures reviewed on September 26, 2026.
Memory decides the size of the model: 16 GB for 8 billion parameters, 32 to 48 GB for mixtures of experts such as Qwen3 30B-A3B, 64 GB and more for 70-billion models.
The Pro and Max chips read their memory two to five times faster than the base chips: that is what makes them write fast with large models.
With its fans, a MacBook Pro keeps its speed through long sessions, on battery as on power.
Questions about running an LLM locally
Which LLM for a MacBook Pro with an M4 Max?
With 64 GB or more, gpt-oss-120b (on 128 GB), Llama 3.3 70B or Qwen3 30B-A3B; the mixtures of experts write several times faster than the dense 70B.
What does 48 GB change on a MacBook Pro?
It runs mixtures of experts such as Qwen3 30B-A3B or gpt-oss-20b comfortably, at several dozen tokens per second, with room for your other apps.
Does a local LLM drain a MacBook Pro's battery?
Writing an answer uses the graphics at full power for a few seconds; between answers the model waits without using any. Long document work on battery is fine; hours of continuous writing are not.
The best local LLM, by computer
Try local AI on your Mac, for free.
Version 0.11.5 · macOS 13 or later · no account, no subscription. Download it, install a model in one click, and ask your first question — even offline.