Rechner für lokale LLMs
Das beste lokale LLM für Ihren Mac Studio
Vom M1 Max bis zum M5 Ultra mit 512 GB: die größten Modelle, die ein Mac fassen kann, und wie schnell sie schreiben.
| Ihr Computer | Arbeitsspeicher | Empfohlen – läuft problemlos | Schreibt | Mit einem Klick in Twoody |
|---|---|---|---|---|
M5 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 100+ Token/s | Qwen3 14B |
| 48 GB | GLM-4.7-Flash | 100+ Token/s | Qwen3 14B | |
| 64 GB | GLM-4.7-Flash | 100+ Token/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 96–193 Token/s | Qwen3 14B | |
M5 Ultra — Mac Studio |
96 GB | gpt-oss-120b | 92–163 Token/s | Qwen3 14B |
| 256 GB | Qwen3 235B-A22B | 28–50 Token/s | Qwen3 14B | |
| 512 GB | Qwen3 235B-A22B | 28–50 Token/s | Qwen3 14B | |
M3 Ultra — Mac Studio |
96 GB | gpt-oss-120b | 63–90 Token/s | Qwen3 14B |
| 256 GB | Qwen3 235B-A22B | 20–28 Token/s | Qwen3 14B | |
| 512 GB | Qwen3 235B-A22B | 20–28 Token/s | Qwen3 14B | |
M4 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 73–106 Token/s | Qwen3 14B |
| 48 GB | gpt-oss-20b | 85–122 Token/s | Qwen3 14B | |
| 64 GB | gpt-oss-20b | 85–122 Token/s | Qwen3 14B | |
| 128 GB | Qwen3-Next 80B-A3B | 53–107 Token/s | Qwen3 14B | |
M2 Ultra — Mac Studio |
64 GB | gpt-oss-20b | 89–128 Token/s | Qwen3 14B |
| 128 GB | gpt-oss-120b | 63–91 Token/s | Qwen3 14B | |
| 192 GB | Qwen3 235B-A22B | 20–28 Token/s | Qwen3 14B | |
M2 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 62–90 Token/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 62–90 Token/s | Qwen3 14B | |
| 96 GB | Qwen3-Next 80B-A3B | 39–78 Token/s | Qwen3 14B | |
M1 Ultra — Mac Studio |
64 GB | gpt-oss-20b | 75–107 Token/s | Qwen3 14B |
| 128 GB | gpt-oss-120b | 52–75 Token/s | Qwen3 14B | |
M1 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 56–80 Token/s | Qwen3 14B |
| 64 GB | gpt-oss-20b | 56–80 Token/s | Qwen3 14B |
Schätzungen, keine Messungen, berechnet aus öffentlichen llama.cpp-Benchmarks. Zahlen geprüft am 26. September 2026.
Mit 128 bis 512 GB gemeinsamem Arbeitsspeicher fasst ein Mac Studio Modelle, für die keine Grafikkarte reicht: gpt-oss-120b, Qwen3.5 122B-A10B, sogar Qwen3 235B-A22B.
Seine Max- und Ultra-Chips lesen ihren Speicher mit 400 GB/s bis 1,2 TB/s: Mixture-of-Experts-Modelle antworten mit Dutzenden Token pro Sekunde.
Er bleibt auch unter Last leise und hält sein Tempo über lange Sitzungen.
Fragen zu lokalen LLMs
Welches LLM für einen Mac Studio mit Ultra-Chip?
Mit 256 oder 512 GB läuft Qwen3 235B-A22B, das größte Modell hier, problemlos; gpt-oss-120b und Qwen3.5 122B-A10B schreiben schneller.
Reichen 128 GB für ein 70B-Modell?
Ja, mit Reserve: Llama 3.3 70B braucht in 4 Bit etwa 48 GB. Mit 128 GB passen auch Mixture-of-Experts-Modelle wie gpt-oss-120b.
Max oder Ultra für ein lokales LLM?
Der Ultra verdoppelt Speicherbandbreite und Arbeitsspeicher: schnellere Antworten mit großen Modellen und Platz für die größten Modelle. Für Modelle bis 70B reicht ein Max.
Das beste lokale LLM, je nach Computer
Probieren Sie lokale KI auf Ihrem Mac aus – kostenlos.
Version 0.12.1 · macOS 13 oder neuer · ohne Konto, ohne Abo. Laden Sie die App herunter, installieren Sie ein Modell mit einem Klick und stellen Sie Ihre erste Frage – sogar offline.