Twoody

Rechner für lokale LLMs

Das beste lokale LLM für Ihren Mac Studio

Vom M1 Max bis zum M5 Ultra mit 512 GB: die größten Modelle, die ein Mac fassen kann, und wie schnell sie schreiben.

Ihr Computer Arbeitsspeicher Empfohlen – läuft problemlos Schreibt Mit einem Klick in Twoody

M5 Max — MacBook Pro, Mac Studio

36 GB GLM-4.7-Flash 100+ Token/s Qwen3 14B
48 GB GLM-4.7-Flash 100+ Token/s Qwen3 14B
64 GB GLM-4.7-Flash 100+ Token/s Qwen3 14B
128 GB Qwen3-Next 80B-A3B 96–193 Token/s Qwen3 14B

M5 Ultra — Mac Studio

96 GB gpt-oss-120b 92–163 Token/s Qwen3 14B
256 GB Qwen3 235B-A22B 28–50 Token/s Qwen3 14B
512 GB Qwen3 235B-A22B 28–50 Token/s Qwen3 14B

M3 Ultra — Mac Studio

96 GB gpt-oss-120b 63–90 Token/s Qwen3 14B
256 GB Qwen3 235B-A22B 20–28 Token/s Qwen3 14B
512 GB Qwen3 235B-A22B 20–28 Token/s Qwen3 14B

M4 Max — MacBook Pro, Mac Studio

36 GB GLM-4.7-Flash 73–106 Token/s Qwen3 14B
48 GB gpt-oss-20b 85–122 Token/s Qwen3 14B
64 GB gpt-oss-20b 85–122 Token/s Qwen3 14B
128 GB Qwen3-Next 80B-A3B 53–107 Token/s Qwen3 14B

M2 Ultra — Mac Studio

64 GB gpt-oss-20b 89–128 Token/s Qwen3 14B
128 GB gpt-oss-120b 63–91 Token/s Qwen3 14B
192 GB Qwen3 235B-A22B 20–28 Token/s Qwen3 14B

M2 Max — MacBook Pro, Mac Studio

32 GB gpt-oss-20b 62–90 Token/s Qwen3 14B
64 GB gpt-oss-20b 62–90 Token/s Qwen3 14B
96 GB Qwen3-Next 80B-A3B 39–78 Token/s Qwen3 14B

M1 Ultra — Mac Studio

64 GB gpt-oss-20b 75–107 Token/s Qwen3 14B
128 GB gpt-oss-120b 52–75 Token/s Qwen3 14B

M1 Max — MacBook Pro, Mac Studio

32 GB gpt-oss-20b 56–80 Token/s Qwen3 14B
64 GB gpt-oss-20b 56–80 Token/s Qwen3 14B

Schätzungen, keine Messungen, berechnet aus öffentlichen llama.cpp-Benchmarks. Zahlen geprüft am 26. September 2026.

Mit 128 bis 512 GB gemeinsamem Arbeitsspeicher fasst ein Mac Studio Modelle, für die keine Grafikkarte reicht: gpt-oss-120b, Qwen3.5 122B-A10B, sogar Qwen3 235B-A22B.

Seine Max- und Ultra-Chips lesen ihren Speicher mit 400 GB/s bis 1,2 TB/s: Mixture-of-Experts-Modelle antworten mit Dutzenden Token pro Sekunde.

Er bleibt auch unter Last leise und hält sein Tempo über lange Sitzungen.

Fragen zu lokalen LLMs

Welches LLM für einen Mac Studio mit Ultra-Chip?

Mit 256 oder 512 GB läuft Qwen3 235B-A22B, das größte Modell hier, problemlos; gpt-oss-120b und Qwen3.5 122B-A10B schreiben schneller.

Reichen 128 GB für ein 70B-Modell?

Ja, mit Reserve: Llama 3.3 70B braucht in 4 Bit etwa 48 GB. Mit 128 GB passen auch Mixture-of-Experts-Modelle wie gpt-oss-120b.

Max oder Ultra für ein lokales LLM?

Der Ultra verdoppelt Speicherbandbreite und Arbeitsspeicher: schnellere Antworten mit großen Modellen und Platz für die größten Modelle. Für Modelle bis 70B reicht ein Max.

Probieren Sie lokale KI auf Ihrem Mac aus – kostenlos.

Version 0.12.1 · macOS 13 oder neuer · ohne Konto, ohne Abo. Laden Sie die App herunter, installieren Sie ein Modell mit einem Klick und stellen Sie Ihre erste Frage – sogar offline.