Rechner für lokale LLMs
Das beste lokale LLM für Ihr MacBook Pro
Vom M1 mit 8 GB bis zum M5 Max mit 128 GB: das stärkste Modell, das auf dem jeweiligen MacBook Pro problemlos läuft, und wie schnell es schreibt.
| Ihr Computer | Arbeitsspeicher | Empfohlen – läuft problemlos | Schreibt | Mit einem Klick in Twoody |
|---|---|---|---|---|
M5 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 100+ Token/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 100+ Token/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 100+ Token/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 96–193 Token/s | Qwen3 14B | |
M5 Pro — MacBook Pro, Mac mini |
24 GB | gpt-oss-20b | 68–97 Token/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 92–132 Token/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 92–132 Token/s | Qwen3 14B | |
M5 — MacBook Air, MacBook Pro |
16 GB | Llama 3.1 8B | 20–28 Token/s | Qwen3 8B |
| 24 GB | gpt-oss-20b | 32–47 Token/s | Qwen3 14B | |
| 32 GB | GLM-4.7-Flash | 41–59 Token/s | Qwen3 14B | |
M4 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 73–106 Token/s | Qwen3 14B |
| 48 GB | gpt-oss-20b | 85–122 Token/s | Qwen3 14B | |
| 64 GB | gpt-oss-20b | 85–122 Token/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 53–107 Token/s | Qwen3 14B | |
M4 Pro — MacBook Pro, Mac mini |
24 GB | gpt-oss-20b | 52–74 Token/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 56–81 Token/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 56–81 Token/s | Qwen3 14B | |
M4 — MacBook Air, MacBook Pro, Mac mini, iMac |
16 GB | Llama 3.1 8B | 15–22 Token/s | Qwen3 8B |
| 24 GB | gpt-oss-20b | 25–36 Token/s | Qwen3 14B | |
| 32 GB | GLM-4.7-Flash | 32–46 Token/s | Qwen3 14B | |
M3 Max — MacBook Pro |
36 GB | GLM-4.7-Flash | 68–97 Token/s | Qwen3 14B |
| 48 GB | gpt-oss-20b | 68–98 Token/s | Qwen3 14B | |
| 64 GB | gpt-oss-20b | 68–98 Token/s | Qwen3 14B | |
| 96 GB | Qwen3-Next 80B-A3B | 47–93 Token/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 46–93 Token/s | Qwen3 14B | |
M3 Pro — MacBook Pro |
18 GB | Llama 3.1 8B | 19–28 Token/s | Qwen3 8B |
| 36 GB | GLM-4.7-Flash | 42–60 Token/s | Qwen3 14B | |
M3 — MacBook Air, MacBook Pro, iMac |
8 GB | Llama 3.2 3B | 31–45 Token/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 13–19 Token/s | Qwen3 8B | |
| 24 GB | gpt-oss-20b | 23–32 Token/s | Qwen3 14B | |
M2 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 62–90 Token/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 62–90 Token/s | Qwen3 14B | |
| 96 GB | Qwen3-Next 80B-A3B | 39–78 Token/s | Qwen3 14B | |
M2 Pro — MacBook Pro, Mac mini |
16 GB | Llama 3.1 8B | 24–35 Token/s | Qwen3 8B |
| 32 GB | GLM-4.7-Flash | 45–65 Token/s | Qwen3 14B | |
M2 — MacBook Air, MacBook Pro, Mac mini |
8 GB | Llama 3.2 3B | 32–45 Token/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 13–19 Token/s | Qwen3 8B | |
| 24 GB | gpt-oss-20b | 23–33 Token/s | Qwen3 14B | |
M1 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 56–80 Token/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 56–80 Token/s | Qwen3 14B | |
M1 Pro — MacBook Pro |
16 GB | Llama 3.1 8B | 23–33 Token/s | Qwen3 8B |
| 32 GB | GLM-4.7-Flash | 39–56 Token/s | Qwen3 14B | |
M1 — MacBook Air, MacBook Pro, Mac mini, iMac |
8 GB | Llama 3.2 3B | 20–29 Token/s | Qwen3 4B |
| 16 GB | Llama 3.1 8B | 8,9–13 Token/s | Qwen3 8B |
Schätzungen, keine Messungen, berechnet aus öffentlichen llama.cpp-Benchmarks. Zahlen geprüft am 26. September 2026.
Der Arbeitsspeicher bestimmt die Größe des Modells: 16 GB für 8 Milliarden Parameter, 32 bis 48 GB für Mixture-of-Experts-Modelle wie Qwen3 30B-A3B, 64 GB und mehr für Modelle mit 70 Milliarden Parametern.
Die Pro- und Max-Chips lesen ihren Speicher zwei- bis fünfmal so schnell wie die Basis-Chips: Deshalb schreiben sie auch mit großen Modellen schnell.
Dank seiner Lüfter hält ein MacBook Pro sein Tempo auch über lange Sitzungen, im Akku- wie im Netzbetrieb.
Fragen zu lokalen LLMs
Welches LLM für ein MacBook Pro mit M4 Max?
Mit 64 GB oder mehr: gpt-oss-120b (mit 128 GB), Llama 3.3 70B oder Qwen3 30B-A3B; die Mixture-of-Experts-Modelle schreiben um ein Mehrfaches schneller als das dichte 70B-Modell.
Was bringen 48 GB bei einem MacBook Pro?
Damit laufen Mixture-of-Experts-Modelle wie Qwen3 30B-A3B oder gpt-oss-20b problemlos, mit mehreren Dutzend Token pro Sekunde, und es bleibt Platz für Ihre anderen Apps.
Saugt ein lokales LLM den Akku eines MacBook Pro leer?
Beim Schreiben einer Antwort arbeitet die Grafikeinheit einige Sekunden mit voller Leistung; zwischen den Antworten wartet das Modell, ohne sie zu beanspruchen. Lange Arbeit an Dokumenten im Akkubetrieb ist kein Problem, stundenlanges ununterbrochenes Schreiben schon.
Das beste lokale LLM, je nach Computer
Probieren Sie lokale KI auf Ihrem Mac aus – kostenlos.
Version 0.12.1 · macOS 13 oder neuer · ohne Konto, ohne Abo. Laden Sie die App herunter, installieren Sie ein Modell mit einem Klick und stellen Sie Ihre erste Frage – sogar offline.