Twoody

Rechner für lokale LLMs

Welches lokale LLM läuft auf Ihrem Computer – und wie schnell?

Wählen Sie Ihren Mac oder PC. Sehen Sie, welche offenen Modelle in seinen Arbeitsspeicher passen, wie schnell sie schreiben, wie lange sie für ein Dokument brauchen und wofür sie sich eignen.

Welchen Mac habe ich? Apple-Menü › „Über diesen Mac“ zeigt Chip und Arbeitsspeicher. Auf einem PC: Task-Manager › Leistung › GPU.

Die Modelle für diesen Computer

M4 Pro mit 24 GB: 20 von 36 Modellen laufen gut.

Was Twoody auf diesem Mac installiert

Qwen3 14B, mit einem Klick, für Unterhaltungen bis 16k Token.

Läuft problemlos · 18–27 Token/s (nahezu verzögerungsfrei) · 20 Seiten in 84 s

Download für Mac mit Apple Silicon

Laufen gut auf diesem Computer

gpt-oss-20b

OpenAI · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

12,7 von 15 GB

Läuft problemlos

52–74 Token/s

wirkt verzögerungsfrei

20 Seiten in 26 s

  • Chat und Schreiben
  • Ihre Dokumente
  • Code
  • Logisches Denken
  • Agenten
Llama 3.1 8B

Meta · Llama 3.1 Community

Über LM Studio, Ollama oder mlx-lm

7,3 von 15 GB

Läuft problemlos

32–46 Token/s

nahezu verzögerungsfrei

20 Seiten in 45 s

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
Qwen3 8B

Qwen (Alibaba) · Apache 2.0

Mit einem Klick in Twoody

7,7 von 15 GB

Läuft problemlos

31–45 Token/s

nahezu verzögerungsfrei

20 Seiten in 46 s

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
  • Logisches Denken
DeepSeek-R1-0528-Qwen3-8B

DeepSeek · MIT

Über LM Studio, Ollama oder mlx-lm

7,7 von 15 GB

Läuft problemlos

31–45 Token/s

nahezu verzögerungsfrei

20 Seiten in 46 s

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
  • Logisches Denken
Ministral 3 8B

Mistral AI · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

7,7 von 15 GB

Läuft problemlos

30–44 Token/s

nahezu verzögerungsfrei

20 Seiten in 50 s

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
Qwen3.5 9B

Qwen (Alibaba) · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

6,6 von 15 GB

Läuft problemlos

20–40 Token/s

nahezu verzögerungsfrei

20 Seiten in 56 s

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
  • Logisches Denken
Gemma 4 12B

Google · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

8,1 von 15 GB

Läuft problemlos

23–33 Token/s

nahezu verzögerungsfrei

20 Seiten in 68 s

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
Ministral 3 14B

Mistral AI · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

11,1 von 15 GB

Läuft problemlos

20–29 Token/s

nahezu verzögerungsfrei

20 Seiten in 79 s

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
Phi-4 14B

Microsoft · MIT

Über LM Studio, Ollama oder mlx-lm

12,3 von 15 GB

Läuft problemlos

19–27 Token/s

nahezu verzögerungsfrei

20 Seiten in 83 s

  • Chat und Schreiben
  • Ihre Dokumente
  • Logisches Denken
Qwen3 14B

Qwen (Alibaba) · Apache 2.0

Mit einem Klick in Twoody

11,8 von 15 GB

Läuft problemlos

18–27 Token/s

nahezu verzögerungsfrei

20 Seiten in 84 s

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
  • Logisches Denken
Llama 3.2 3B

Meta · Llama 3.2 Community

Über LM Studio, Ollama oder mlx-lm

4,2 von 15 GB

Läuft problemlos

67–97 Token/s

wirkt verzögerungsfrei

20 Seiten in 18 s

  • Chat und Schreiben
  • Übersetzung
Phi-4-mini

Microsoft · MIT

Über LM Studio, Ollama oder mlx-lm

4,9 von 15 GB

Läuft problemlos

56–80 Token/s

wirkt verzögerungsfrei

20 Seiten in 21 s

  • Chat und Schreiben
Qwen3 4B

Qwen (Alibaba) · Apache 2.0

Mit einem Klick in Twoody

5,2 von 15 GB

Läuft problemlos

54–77 Token/s

wirkt verzögerungsfrei

20 Seiten in 23 s

  • Chat und Schreiben
  • Übersetzung
Gemma 4 E4B

Google · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

5,9 von 15 GB

Läuft problemlos

49–71 Token/s

wirkt verzögerungsfrei

20 Seiten in 25 s

  • Chat und Schreiben
  • Übersetzung
Qwen3.5 4B

Qwen (Alibaba) · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

3,7 von 15 GB

Läuft problemlos

37–73 Token/s

wirkt verzögerungsfrei

20 Seiten in 27 s

  • Chat und Schreiben
  • Übersetzung
Qwen3 0.6B

Qwen (Alibaba) · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

2,6 von 15 GB

Läuft problemlos

100+ Token/s

wirkt verzögerungsfrei

20 Seiten in 3 s

Qwen3 1.7B

Qwen (Alibaba) · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

3,3 von 15 GB

Läuft problemlos

63–188 Token/s

wirkt verzögerungsfrei

20 Seiten in 10 s

Qwen3.5 2B

Qwen (Alibaba) · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

1,9 von 15 GB

Läuft problemlos

70–140 Token/s

wirkt verzögerungsfrei

20 Seiten in 12 s

Gemma 4 E2B

Google · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

3,8 von 15 GB

Läuft problemlos

85–122 Token/s

wirkt verzögerungsfrei

20 Seiten in 13 s

MiniCPM5 2B

OpenBMB · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

2,7 von 15 GB

Läuft problemlos

73–105 Token/s

wirkt verzögerungsfrei

20 Seiten in 14 s

Laufen, aber deutlich langsamer (8)
GLM-4.7-Flash

Z.ai · MIT

Über LM Studio, Ollama oder mlx-lm

19,2 von 15 GB

Teils auf dem Prozessor: deutlich langsamer

23–32 Token/s

nahezu verzögerungsfrei

20 Seiten in 54 s

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
  • Code
  • Logisches Denken
  • Agenten
Qwen3 30B-A3B

Qwen (Alibaba) · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

20,1 von 15 GB

Teils auf dem Prozessor: deutlich langsamer

20–29 Token/s

nahezu verzögerungsfrei

20 Seiten in 59 s

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
  • Code
  • Logisches Denken
  • Agenten
Qwen3-Coder 30B-A3B

Qwen (Alibaba) · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

20,1 von 15 GB

Teils auf dem Prozessor: deutlich langsamer

20–29 Token/s

nahezu verzögerungsfrei

20 Seiten in 59 s

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
  • Code
  • Agenten
Gemma 4 26B-A4B

Google · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

17,7 von 15 GB

Teils auf dem Prozessor: deutlich langsamer

20–28 Token/s

nahezu verzögerungsfrei

20 Seiten in 72 s

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
  • Code
  • Agenten
Mistral Small 3.2 24B

Mistral AI · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

17 von 15 GB

Teils auf dem Prozessor: deutlich langsamer

4,8–6,9 Token/s

etwa Ihr Lesetempo

20 Seiten in 6 min

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
  • Code
  • Agenten
Devstral Small 2 24B

Mistral AI · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

17 von 15 GB

Teils auf dem Prozessor: deutlich langsamer

4,8–6,9 Token/s

etwa Ihr Lesetempo

20 Seiten in 6 min

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
  • Code
  • Agenten
Gemma 4 31B

Google · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

19,8 von 15 GB

Teils auf dem Prozessor: deutlich langsamer

3,8–5,4 Token/s

langsamer, als Sie lesen

20 Seiten in 7 min

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
  • Code
  • Agenten
Qwen3.8 27B

Qwen (Alibaba) · Apache 2.0

Über LM Studio, Ollama oder mlx-lm

17,6 von 15 GB

Teils auf dem Prozessor: deutlich langsamer

2,9–5,7 Token/s

langsamer, als Sie lesen

20 Seiten in 7 min

  • Chat und Schreiben
  • Ihre Dokumente
  • Übersetzung
  • Code
  • Logisches Denken
  • Agenten
Zu groß für diesen Computer (8)
  • Qwen3.6 35B-A3B · 22,5 von 15 GB
  • Qwen3 32B · 23,8 von 15 GB
  • Llama 3.3 70B · 47,1 von 15 GB
  • Qwen3-Next 80B-A3B · 48,3 von 15 GB
  • gpt-oss-120b · 63,1 von 15 GB
  • Mistral Small 4 119B · 71,1 von 15 GB
  • Qwen3.5 122B-A10B · 75,7 von 15 GB
  • Qwen3 235B-A22B · 142,4 von 15 GB

Schätzungen, keine Messungen, berechnet aus öffentlichen llama.cpp-Benchmarks. Zahlen geprüft am 26. September 2026.

Wie viel Arbeitsspeicher braucht ein lokales LLM?

Der Arbeitsspeicher entscheidet, welche Modelle passen: die Modelldatei plus die Unterhaltung, die das Modell im Gedächtnis behält. Ein Mac lässt seine Grafikeinheit bis 32 GB etwa zwei Drittel seines Arbeitsspeichers nutzen, darüber drei Viertel. Was mit 4-Bit-Dateien problemlos läuft:

ArbeitsspeicherEmpfohlen – läuft problemlos
8 GBLlama 3.2 3B, Phi-4-mini, Qwen3.5 4B
16 GBLlama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B
24 GBgpt-oss-20b, Llama 3.1 8B, Qwen3 8B
32 GBGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
48 GBGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
64 GBLlama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B
128 GBQwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B
256 GBQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B
512 GBQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B

Warum die Speicherbandbreite das Tempo bestimmt

Für jedes Wort liest der Computer die aktiven Gewichte des Modells aus dem Speicher. Das Tempo hängt daher mehr von der Speicherbandbreite ab als von der Rechenleistung des Prozessors. Qwen3 8B in 4 Bit auf einigen Geräten:

Computer Speicherbandbreite Schreibt
M1 68 GB/s 8,7–12 Token/s
M2 100 GB/s 13–19 Token/s
M4 120 GB/s 15–21 Token/s
M5 153 GB/s 19–27 Token/s
M4 Pro 273 GB/s 31–45 Token/s
M4 Max 546 GB/s 53–76 Token/s
M5 Max 614 GB/s 72–104 Token/s
GeForce RTX 4090 (24 GB) 1 008 GB/s 100+ Token/s

4 Bit oder 8 Bit?

Modelle werden komprimiert verteilt. 4-Bit-Dateien (Q4_K_M, bei gpt-oss MXFP4) sind halb so groß wie 8-Bit-Dateien, bei geringem Qualitätsverlust: Das installiert Twoody, und es ist auf den meisten Computern die richtige Wahl. 8 Bit ist etwas feiner und braucht doppelt so viel Arbeitsspeicher.

Token pro Sekunde: wie sich das anfühlt

Ein Token ist ein Wortstück: im Englischen etwa drei Viertel eines Wortes, im Deutschen weniger. Beim stillen Lesen schaffen Sie etwa 5 Token pro Sekunde.

unter 5langsamer, als Sie lesen
5 bis 10etwa Ihr Lesetempo
10 bis 20schneller, als Sie lesen
20 bis 50nahezu verzögerungsfrei
über 50wirkt verzögerungsfrei

Ein Modell, das zuerst nachdenkt, schreibt vor seiner Antwort 300 bis 3.000 Token an Überlegungen: bei 10 Token pro Sekunde eine halbe Minute bis fünf Minuten. In Twoody legen die Stufen „Fast“, „Thinking“ und „Deep“ fest, wie lange es nachdenkt.

Ein Dokument lesen

Bevor das Modell eine Frage zu einem Dokument beantwortet, liest es das Dokument – und genau hier legen neuere Chips am meisten zu. Qwen3 8B liest ein Dokument mit 20 Seiten, bei 16 GB:

M13 min
M476 s
M527 s

Mac oder PC?

Ein Mac teilt seinen Arbeitsspeicher zwischen Prozessor und Grafikeinheit: Ein Mac mit 64 GB führt Modelle aus, die in keine Grafikkarte mit 24 GB passen. Eine PC-Grafikkarte hat weniger Speicher, liest ihn aber sehr schnell: Mit einem Modell, das hineinpasst, schreibt eine RTX 4090 schneller als jeder Mac. Twoody läuft heute auf dem Mac; die Versionen für Windows und Linux sind in Vorbereitung.

Das beste lokale LLM, je nach Computer

Methode und Quellen

Das Tempo jedes Geräts wird aus seiner gemessenen Geschwindigkeit mit dem Referenzmodell von llama.cpp (LLaMA 2 7B, 4 Bit) berechnet, skaliert nach dem, was jedes Modell pro Wort liest, mit den Speicherbandbreiten aus den technischen Daten von Apple und NVIDIA. Geprüft an 20 veröffentlichten Messungen, die nicht in die Berechnung eingeflossen sind: Abweichung im Median 4,5 %, höchstens 23 %, alle innerhalb der angegebenen Spannen.

Zahlen geprüft am 26. September 2026.

Quellen

Daten herunterladen (JSON, CC BY 4.0)

Fragen zu lokalen LLMs

Kann ich mit 8 GB Arbeitsspeicher ein lokales LLM ausführen?

Ja, ein kleines: Qwen3 4B oder Qwen3.5 4B laufen auf einem Mac mit 8 GB und reichen für E-Mails, Zusammenfassungen und einfache Fragen. Schließen Sie währenddessen speicherhungrige Apps. Twoody installiert auf diesen Macs Qwen3 4B.

Welches LLM für einen Mac mit 16 GB?

Ein Modell mit 7 bis 9 Milliarden Parametern: Qwen3 8B, Qwen3.5 9B oder Llama 3.1 8B schreiben auf aktuellen Macs etwa 15 bis 25 Token pro Sekunde und beantworten Fragen zu Ihren Dokumenten gut. Twoody installiert Qwen3 8B.

Wie viel Arbeitsspeicher braucht ein 70B-Modell?

Etwa 48 GB für die 4-Bit-Datei und eine kurze Unterhaltung: Ein Mac mit 64 GB führt Llama 3.3 70B aus, je nach Chip mit 7 bis 13 Token pro Sekunde. Mixture-of-Experts-Modelle wie gpt-oss-120b brauchen mehr Arbeitsspeicher, schreiben aber deutlich schneller.

Ist ein 4-Bit-Modell viel schlechter als ein 8-Bit-Modell?

Nur geringfügig. Beim Schreiben, bei Zusammenfassungen und bei Fragen zu Dokumenten fällt der Unterschied kaum auf, und 4 Bit halbiert den Speicherbedarf und verdoppelt das Tempo. Wählen Sie 8 Bit nur, wenn Sie reichlich Arbeitsspeicher haben.

Mac oder NVIDIA-Grafikkarte für ein lokales LLM?

Eine Grafikkarte schreibt schneller, wenn das Modell in ihren Speicher passt (8 bis 32 GB); ein Mac fasst in seinem gemeinsamen Arbeitsspeicher deutlich größere Modelle (bis zu 512 GB). Für eine einzelne Person, die mit Dokumenten arbeitet, ist ein Mac mit 16 bis 64 GB die einfachste Wahl.

Wird ein MacBook Air durch ein lokales LLM zu heiß?

Ein MacBook Air hat keinen Lüfter: Nach einigen Minuten ununterbrochenen Schreibens wird es langsamer, um kühl zu bleiben. Bei Antworten normaler Länge merkt man das nicht; bei langen Sitzungen hält ein MacBook Pro oder ein Mac mini sein Tempo.

Brauche ich LM Studio, Ollama oder MLX?

Nicht mit Twoody: Es installiert ein Modell und führt es mit seiner eigenen Engine, llama.cpp, aus – mit einem Klick. Wenn Sie bereits LM Studio, Ollama oder mlx-lm nutzen, verwendet Twoody auch deren Modelle.

Wie genau sind diese Schätzungen?

Bei 20 veröffentlichten Messungen, die nicht in die Formel eingeflossen sind, liegt die Abweichung im Median bei 4,5 % und höchstens bei 23 %; jede Messung lag innerhalb der angegebenen Spanne. Ihr Tempo hängt außerdem von der App ab, von ihrer Version und davon, was der Computer sonst noch tut.

Probieren Sie lokale KI auf Ihrem Mac aus – kostenlos.

Version 0.12.1 · macOS 13 oder neuer · ohne Konto, ohne Abo. Laden Sie die App herunter, installieren Sie ein Modell mit einem Klick und stellen Sie Ihre erste Frage – sogar offline.