Rechner für lokale LLMs
Welches lokale LLM läuft auf Ihrem Computer – und wie schnell?
Wählen Sie Ihren Mac oder PC. Sehen Sie, welche offenen Modelle in seinen Arbeitsspeicher passen, wie schnell sie schreiben, wie lange sie für ein Dokument brauchen und wofür sie sich eignen.
Die Modelle für diesen Computer
iMac, Mac mini (Intel, 2017–2020) mit 32 GB: 30 von 36 Modellen laufen gut.
Was Twoody auf diesem Mac installiert
Qwen3 14B, mit einem Klick, für Unterhaltungen bis 16k Token.
Läuft problemlos · 1,8–3,2 Token/s (langsamer, als Sie lesen) · 20 Seiten in 15 min
Auf einem Intel-Mac läuft das Modell auf dem Prozessor: Es funktioniert, aber langsam.
Laufen gut auf diesem Computer
19,2 von 28 GB
Läuft problemlos
7,5–13 Token/s
schneller, als Sie lesen
20 Seiten in 4 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Logisches Denken
- Agenten
20,1 von 28 GB
Läuft problemlos
6,5–12 Token/s
etwa Ihr Lesetempo
20 Seiten in 4 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Logisches Denken
- Agenten
20,1 von 28 GB
Läuft problemlos
6,5–12 Token/s
etwa Ihr Lesetempo
20 Seiten in 4 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Agenten
22,5 von 28 GB
Läuft problemlos
6,4–11 Token/s
etwa Ihr Lesetempo
20 Seiten in 4 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Logisches Denken
- Agenten
12,7 von 28 GB
Läuft problemlos
5,4–9,7 Token/s
etwa Ihr Lesetempo
20 Seiten in 5 min
- Chat und Schreiben
- Ihre Dokumente
- Code
- Logisches Denken
- Agenten
17,7 von 28 GB
Läuft problemlos
5,3–9,5 Token/s
etwa Ihr Lesetempo
20 Seiten in 5 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Agenten
17 von 28 GB
Läuft problemlos
1,1–2 Token/s
langsamer, als Sie lesen
20 Seiten in 25 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Agenten
17 von 28 GB
Läuft problemlos
1,1–2 Token/s
langsamer, als Sie lesen
20 Seiten in 25 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Agenten
19,8 von 28 GB
Läuft problemlos
0,9–1,6 Token/s
langsamer, als Sie lesen
20 Seiten in 32 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Agenten
17,6 von 28 GB
Läuft problemlos
0,8–1,5 Token/s
langsamer, als Sie lesen
20 Seiten in 29 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Logisches Denken
- Agenten
23,8 von 28 GB
Läuft problemlos
0,8–1,5 Token/s
langsamer, als Sie lesen
20 Seiten in 34 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Logisches Denken
- Agenten
7,3 von 28 GB
Läuft problemlos
3,2–5,7 Token/s
langsamer, als Sie lesen
20 Seiten in 8 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
7,7 von 28 GB
Läuft problemlos
3,1–5,6 Token/s
langsamer, als Sie lesen
20 Seiten in 8 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Logisches Denken
7,7 von 28 GB
Läuft problemlos
3,1–5,6 Token/s
langsamer, als Sie lesen
20 Seiten in 8 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Logisches Denken
7,7 von 28 GB
Läuft problemlos
3–5,4 Token/s
langsamer, als Sie lesen
20 Seiten in 9 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
6,6 von 28 GB
Läuft problemlos
2,4–4,3 Token/s
langsamer, als Sie lesen
20 Seiten in 10 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Logisches Denken
8,1 von 28 GB
Läuft problemlos
2,3–4,1 Token/s
langsamer, als Sie lesen
20 Seiten in 12 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
11,1 von 28 GB
Läuft problemlos
1,9–3,5 Token/s
langsamer, als Sie lesen
20 Seiten in 14 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
12,3 von 28 GB
Läuft problemlos
1,8–3,2 Token/s
langsamer, als Sie lesen
20 Seiten in 15 min
- Chat und Schreiben
- Ihre Dokumente
- Logisches Denken
11,8 von 28 GB
Läuft problemlos
1,8–3,2 Token/s
langsamer, als Sie lesen
20 Seiten in 15 min
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Logisches Denken
4,2 von 28 GB
Läuft problemlos
7,5–13 Token/s
schneller, als Sie lesen
20 Seiten in 3 min
- Chat und Schreiben
- Übersetzung
4,9 von 28 GB
Läuft problemlos
6,1–11 Token/s
etwa Ihr Lesetempo
20 Seiten in 4 min
- Chat und Schreiben
5,2 von 28 GB
Läuft problemlos
6,1–11 Token/s
etwa Ihr Lesetempo
20 Seiten in 4 min
- Chat und Schreiben
- Übersetzung
5,9 von 28 GB
Läuft problemlos
5,7–10 Token/s
etwa Ihr Lesetempo
20 Seiten in 5 min
- Chat und Schreiben
- Übersetzung
3,7 von 28 GB
Läuft problemlos
4,9–8,8 Token/s
etwa Ihr Lesetempo
20 Seiten in 5 min
- Chat und Schreiben
- Übersetzung
2,6 von 28 GB
Läuft problemlos
21–62 Token/s
nahezu verzögerungsfrei
20 Seiten in 37 s
3,3 von 28 GB
Läuft problemlos
9,2–28 Token/s
schneller, als Sie lesen
20 Seiten in 2 min
3,8 von 28 GB
Läuft problemlos
11–20 Token/s
schneller, als Sie lesen
20 Seiten in 2 min
1,9 von 28 GB
Läuft problemlos
10–19 Token/s
schneller, als Sie lesen
20 Seiten in 2 min
2,7 von 28 GB
Läuft problemlos
9,8–17 Token/s
schneller, als Sie lesen
20 Seiten in 3 min
Zu groß für diesen Computer (6)
- Llama 3.3 70B · 47,1 von 28 GB
- Qwen3-Next 80B-A3B · 48,3 von 28 GB
- gpt-oss-120b · 63,1 von 28 GB
- Mistral Small 4 119B · 71,1 von 28 GB
- Qwen3.5 122B-A10B · 75,7 von 28 GB
- Qwen3 235B-A22B · 142,4 von 28 GB
Schätzungen, keine Messungen, berechnet aus öffentlichen llama.cpp-Benchmarks. Zahlen geprüft am 26. September 2026.
Wie viel Arbeitsspeicher braucht ein lokales LLM?
Der Arbeitsspeicher entscheidet, welche Modelle passen: die Modelldatei plus die Unterhaltung, die das Modell im Gedächtnis behält. Ein Mac lässt seine Grafikeinheit bis 32 GB etwa zwei Drittel seines Arbeitsspeichers nutzen, darüber drei Viertel. Was mit 4-Bit-Dateien problemlos läuft:
| Arbeitsspeicher | Empfohlen – läuft problemlos |
|---|---|
| 8 GB | Llama 3.2 3B, Phi-4-mini, Qwen3.5 4B |
| 16 GB | Llama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B |
| 24 GB | gpt-oss-20b, Llama 3.1 8B, Qwen3 8B |
| 32 GB | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 48 GB | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 64 GB | Llama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B |
| 128 GB | Qwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B |
| 256 GB | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
| 512 GB | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
Warum die Speicherbandbreite das Tempo bestimmt
Für jedes Wort liest der Computer die aktiven Gewichte des Modells aus dem Speicher. Das Tempo hängt daher mehr von der Speicherbandbreite ab als von der Rechenleistung des Prozessors. Qwen3 8B in 4 Bit auf einigen Geräten:
| Computer | Speicherbandbreite | Schreibt |
|---|---|---|
| M1 | 68 GB/s | 8,7–12 Token/s |
| M2 | 100 GB/s | 13–19 Token/s |
| M4 | 120 GB/s | 15–21 Token/s |
| M5 | 153 GB/s | 19–27 Token/s |
| M4 Pro | 273 GB/s | 31–45 Token/s |
| M4 Max | 546 GB/s | 53–76 Token/s |
| M5 Max | 614 GB/s | 72–104 Token/s |
| GeForce RTX 4090 (24 GB) | 1 008 GB/s | 100+ Token/s |
4 Bit oder 8 Bit?
Modelle werden komprimiert verteilt. 4-Bit-Dateien (Q4_K_M, bei gpt-oss MXFP4) sind halb so groß wie 8-Bit-Dateien, bei geringem Qualitätsverlust: Das installiert Twoody, und es ist auf den meisten Computern die richtige Wahl. 8 Bit ist etwas feiner und braucht doppelt so viel Arbeitsspeicher.
Token pro Sekunde: wie sich das anfühlt
Ein Token ist ein Wortstück: im Englischen etwa drei Viertel eines Wortes, im Deutschen weniger. Beim stillen Lesen schaffen Sie etwa 5 Token pro Sekunde.
| unter 5 | langsamer, als Sie lesen |
| 5 bis 10 | etwa Ihr Lesetempo |
| 10 bis 20 | schneller, als Sie lesen |
| 20 bis 50 | nahezu verzögerungsfrei |
| über 50 | wirkt verzögerungsfrei |
Ein Modell, das zuerst nachdenkt, schreibt vor seiner Antwort 300 bis 3.000 Token an Überlegungen: bei 10 Token pro Sekunde eine halbe Minute bis fünf Minuten. In Twoody legen die Stufen „Fast“, „Thinking“ und „Deep“ fest, wie lange es nachdenkt.
Ein Dokument lesen
Bevor das Modell eine Frage zu einem Dokument beantwortet, liest es das Dokument – und genau hier legen neuere Chips am meisten zu. Qwen3 8B liest ein Dokument mit 20 Seiten, bei 16 GB:
| M1 | 3 min |
| M4 | 76 s |
| M5 | 27 s |
Mac oder PC?
Ein Mac teilt seinen Arbeitsspeicher zwischen Prozessor und Grafikeinheit: Ein Mac mit 64 GB führt Modelle aus, die in keine Grafikkarte mit 24 GB passen. Eine PC-Grafikkarte hat weniger Speicher, liest ihn aber sehr schnell: Mit einem Modell, das hineinpasst, schreibt eine RTX 4090 schneller als jeder Mac. Twoody läuft heute auf dem Mac; die Versionen für Windows und Linux sind in Vorbereitung.
Das beste lokale LLM, je nach Computer
Methode und Quellen
Das Tempo jedes Geräts wird aus seiner gemessenen Geschwindigkeit mit dem Referenzmodell von llama.cpp (LLaMA 2 7B, 4 Bit) berechnet, skaliert nach dem, was jedes Modell pro Wort liest, mit den Speicherbandbreiten aus den technischen Daten von Apple und NVIDIA. Geprüft an 20 veröffentlichten Messungen, die nicht in die Berechnung eingeflossen sind: Abweichung im Median 4,5 %, höchstens 23 %, alle innerhalb der angegebenen Spannen.
Zahlen geprüft am 26. September 2026.
Quellen
- www.apple.com/newsroom/
- support.apple.com/specs
- github.com/ggml-org/llama.cpp/discussions/4167
- github.com/ggml-org/llama.cpp/discussions/15013
- github.com/ggml-org/llama.cpp/discussions/10879
- github.com/ggml-org/llama.cpp/discussions/15396
- www.nvidia.com/en-us/geforce/graphics-cards/compare/
- huggingface.co/models
- www.sciencedirect.com/science/article/abs/pii/S0749596X19300786
Fragen zu lokalen LLMs
Kann ich mit 8 GB Arbeitsspeicher ein lokales LLM ausführen?
Ja, ein kleines: Qwen3 4B oder Qwen3.5 4B laufen auf einem Mac mit 8 GB und reichen für E-Mails, Zusammenfassungen und einfache Fragen. Schließen Sie währenddessen speicherhungrige Apps. Twoody installiert auf diesen Macs Qwen3 4B.
Welches LLM für einen Mac mit 16 GB?
Ein Modell mit 7 bis 9 Milliarden Parametern: Qwen3 8B, Qwen3.5 9B oder Llama 3.1 8B schreiben auf aktuellen Macs etwa 15 bis 25 Token pro Sekunde und beantworten Fragen zu Ihren Dokumenten gut. Twoody installiert Qwen3 8B.
Wie viel Arbeitsspeicher braucht ein 70B-Modell?
Etwa 48 GB für die 4-Bit-Datei und eine kurze Unterhaltung: Ein Mac mit 64 GB führt Llama 3.3 70B aus, je nach Chip mit 7 bis 13 Token pro Sekunde. Mixture-of-Experts-Modelle wie gpt-oss-120b brauchen mehr Arbeitsspeicher, schreiben aber deutlich schneller.
Ist ein 4-Bit-Modell viel schlechter als ein 8-Bit-Modell?
Nur geringfügig. Beim Schreiben, bei Zusammenfassungen und bei Fragen zu Dokumenten fällt der Unterschied kaum auf, und 4 Bit halbiert den Speicherbedarf und verdoppelt das Tempo. Wählen Sie 8 Bit nur, wenn Sie reichlich Arbeitsspeicher haben.
Mac oder NVIDIA-Grafikkarte für ein lokales LLM?
Eine Grafikkarte schreibt schneller, wenn das Modell in ihren Speicher passt (8 bis 32 GB); ein Mac fasst in seinem gemeinsamen Arbeitsspeicher deutlich größere Modelle (bis zu 512 GB). Für eine einzelne Person, die mit Dokumenten arbeitet, ist ein Mac mit 16 bis 64 GB die einfachste Wahl.
Wird ein MacBook Air durch ein lokales LLM zu heiß?
Ein MacBook Air hat keinen Lüfter: Nach einigen Minuten ununterbrochenen Schreibens wird es langsamer, um kühl zu bleiben. Bei Antworten normaler Länge merkt man das nicht; bei langen Sitzungen hält ein MacBook Pro oder ein Mac mini sein Tempo.
Brauche ich LM Studio, Ollama oder MLX?
Nicht mit Twoody: Es installiert ein Modell und führt es mit seiner eigenen Engine, llama.cpp, aus – mit einem Klick. Wenn Sie bereits LM Studio, Ollama oder mlx-lm nutzen, verwendet Twoody auch deren Modelle.
Wie genau sind diese Schätzungen?
Bei 20 veröffentlichten Messungen, die nicht in die Formel eingeflossen sind, liegt die Abweichung im Median bei 4,5 % und höchstens bei 23 %; jede Messung lag innerhalb der angegebenen Spanne. Ihr Tempo hängt außerdem von der App ab, von ihrer Version und davon, was der Computer sonst noch tut.
Probieren Sie lokale KI auf Ihrem Mac aus – kostenlos.
Version 0.12.1 · macOS 13 oder neuer · ohne Konto, ohne Abo. Laden Sie die App herunter, installieren Sie ein Modell mit einem Klick und stellen Sie Ihre erste Frage – sogar offline.