Rechner für lokale LLMs
Welches lokale LLM läuft auf Ihrem Computer – und wie schnell?
Wählen Sie Ihren Mac oder PC. Sehen Sie, welche offenen Modelle in seinen Arbeitsspeicher passen, wie schnell sie schreiben, wie lange sie für ein Dokument brauchen und wofür sie sich eignen.
Die Modelle für diesen Computer
M3 Max mit 48 GB: 30 von 36 Modellen laufen gut.
Was Twoody auf diesem Mac installiert
Qwen3 14B, mit einem Klick, für Unterhaltungen bis 16k Token.
Läuft problemlos · 26–37 Token/s (nahezu verzögerungsfrei) · 20 Seiten in 40 s
Laufen gut auf diesem Computer
12,7 von 35 GB
Läuft problemlos
68–98 Token/s
wirkt verzögerungsfrei
20 Seiten in 12 s
- Chat und Schreiben
- Ihre Dokumente
- Code
- Logisches Denken
- Agenten
19,2 von 35 GB
Läuft problemlos
67–97 Token/s
wirkt verzögerungsfrei
20 Seiten in 10 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Logisches Denken
- Agenten
17,7 von 35 GB
Läuft problemlos
64–91 Token/s
wirkt verzögerungsfrei
20 Seiten in 14 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Agenten
22,5 von 35 GB
Läuft problemlos
50–100 Token/s
wirkt verzögerungsfrei
20 Seiten in 9 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Logisches Denken
- Agenten
20,1 von 35 GB
Läuft problemlos
62–89 Token/s
wirkt verzögerungsfrei
20 Seiten in 11 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Logisches Denken
- Agenten
20,1 von 35 GB
Läuft problemlos
62–89 Token/s
wirkt verzögerungsfrei
20 Seiten in 11 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Agenten
17 von 35 GB
Läuft problemlos
17–25 Token/s
nahezu verzögerungsfrei
20 Seiten in 65 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Agenten
17 von 35 GB
Läuft problemlos
17–25 Token/s
nahezu verzögerungsfrei
20 Seiten in 65 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Agenten
19,8 von 35 GB
Läuft problemlos
13–19 Token/s
schneller, als Sie lesen
20 Seiten in 85 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Agenten
17,6 von 35 GB
Läuft problemlos
10–20 Token/s
schneller, als Sie lesen
20 Seiten in 77 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Logisches Denken
- Agenten
23,8 von 35 GB
Läuft problemlos
12–18 Token/s
schneller, als Sie lesen
20 Seiten in 89 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Code
- Logisches Denken
- Agenten
7,3 von 35 GB
Läuft problemlos
44–63 Token/s
wirkt verzögerungsfrei
20 Seiten in 22 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
7,7 von 35 GB
Läuft problemlos
42–60 Token/s
wirkt verzögerungsfrei
20 Seiten in 22 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Logisches Denken
7,7 von 35 GB
Läuft problemlos
42–60 Token/s
wirkt verzögerungsfrei
20 Seiten in 22 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Logisches Denken
7,7 von 35 GB
Läuft problemlos
41–60 Token/s
wirkt verzögerungsfrei
20 Seiten in 24 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
6,6 von 35 GB
Läuft problemlos
27–55 Token/s
nahezu verzögerungsfrei
20 Seiten in 27 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Logisches Denken
8,1 von 35 GB
Läuft problemlos
31–44 Token/s
nahezu verzögerungsfrei
20 Seiten in 33 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
11,1 von 35 GB
Läuft problemlos
28–40 Token/s
nahezu verzögerungsfrei
20 Seiten in 38 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
12,3 von 35 GB
Läuft problemlos
26–37 Token/s
nahezu verzögerungsfrei
20 Seiten in 40 s
- Chat und Schreiben
- Ihre Dokumente
- Logisches Denken
11,8 von 35 GB
Läuft problemlos
26–37 Token/s
nahezu verzögerungsfrei
20 Seiten in 40 s
- Chat und Schreiben
- Ihre Dokumente
- Übersetzung
- Logisches Denken
4,2 von 35 GB
Läuft problemlos
86–124 Token/s
wirkt verzögerungsfrei
20 Seiten in 9 s
- Chat und Schreiben
- Übersetzung
4,9 von 35 GB
Läuft problemlos
72–104 Token/s
wirkt verzögerungsfrei
20 Seiten in 10 s
- Chat und Schreiben
5,2 von 35 GB
Läuft problemlos
69–99 Token/s
wirkt verzögerungsfrei
20 Seiten in 11 s
- Chat und Schreiben
- Übersetzung
5,9 von 35 GB
Läuft problemlos
63–90 Token/s
wirkt verzögerungsfrei
20 Seiten in 12 s
- Chat und Schreiben
- Übersetzung
3,7 von 35 GB
Läuft problemlos
48–96 Token/s
wirkt verzögerungsfrei
20 Seiten in 13 s
- Chat und Schreiben
- Übersetzung
2,6 von 35 GB
Läuft problemlos
100+ Token/s
wirkt verzögerungsfrei
20 Seiten in 2 s
3,3 von 35 GB
Läuft problemlos
76–228 Token/s
wirkt verzögerungsfrei
20 Seiten in 5 s
1,9 von 35 GB
Läuft problemlos
87–174 Token/s
wirkt verzögerungsfrei
20 Seiten in 6 s
3,8 von 35 GB
Läuft problemlos
100+ Token/s
wirkt verzögerungsfrei
20 Seiten in 6 s
2,7 von 35 GB
Läuft problemlos
87–125 Token/s
wirkt verzögerungsfrei
20 Seiten in 7 s
Zu groß für diesen Computer (6)
- Llama 3.3 70B · 47,1 von 35 GB
- Qwen3-Next 80B-A3B · 48,3 von 35 GB
- gpt-oss-120b · 63,1 von 35 GB
- Mistral Small 4 119B · 71,1 von 35 GB
- Qwen3.5 122B-A10B · 75,7 von 35 GB
- Qwen3 235B-A22B · 142,4 von 35 GB
Schätzungen, keine Messungen, berechnet aus öffentlichen llama.cpp-Benchmarks. Zahlen geprüft am 26. September 2026.
Wie viel Arbeitsspeicher braucht ein lokales LLM?
Der Arbeitsspeicher entscheidet, welche Modelle passen: die Modelldatei plus die Unterhaltung, die das Modell im Gedächtnis behält. Ein Mac lässt seine Grafikeinheit bis 32 GB etwa zwei Drittel seines Arbeitsspeichers nutzen, darüber drei Viertel. Was mit 4-Bit-Dateien problemlos läuft:
| Arbeitsspeicher | Empfohlen – läuft problemlos |
|---|---|
| 8 GB | Llama 3.2 3B, Phi-4-mini, Qwen3.5 4B |
| 16 GB | Llama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B |
| 24 GB | gpt-oss-20b, Llama 3.1 8B, Qwen3 8B |
| 32 GB | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 48 GB | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 64 GB | Llama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B |
| 128 GB | Qwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B |
| 256 GB | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
| 512 GB | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
Warum die Speicherbandbreite das Tempo bestimmt
Für jedes Wort liest der Computer die aktiven Gewichte des Modells aus dem Speicher. Das Tempo hängt daher mehr von der Speicherbandbreite ab als von der Rechenleistung des Prozessors. Qwen3 8B in 4 Bit auf einigen Geräten:
| Computer | Speicherbandbreite | Schreibt |
|---|---|---|
| M1 | 68 GB/s | 8,7–12 Token/s |
| M2 | 100 GB/s | 13–19 Token/s |
| M4 | 120 GB/s | 15–21 Token/s |
| M5 | 153 GB/s | 19–27 Token/s |
| M4 Pro | 273 GB/s | 31–45 Token/s |
| M4 Max | 546 GB/s | 53–76 Token/s |
| M5 Max | 614 GB/s | 72–104 Token/s |
| GeForce RTX 4090 (24 GB) | 1 008 GB/s | 100+ Token/s |
4 Bit oder 8 Bit?
Modelle werden komprimiert verteilt. 4-Bit-Dateien (Q4_K_M, bei gpt-oss MXFP4) sind halb so groß wie 8-Bit-Dateien, bei geringem Qualitätsverlust: Das installiert Twoody, und es ist auf den meisten Computern die richtige Wahl. 8 Bit ist etwas feiner und braucht doppelt so viel Arbeitsspeicher.
Token pro Sekunde: wie sich das anfühlt
Ein Token ist ein Wortstück: im Englischen etwa drei Viertel eines Wortes, im Deutschen weniger. Beim stillen Lesen schaffen Sie etwa 5 Token pro Sekunde.
| unter 5 | langsamer, als Sie lesen |
| 5 bis 10 | etwa Ihr Lesetempo |
| 10 bis 20 | schneller, als Sie lesen |
| 20 bis 50 | nahezu verzögerungsfrei |
| über 50 | wirkt verzögerungsfrei |
Ein Modell, das zuerst nachdenkt, schreibt vor seiner Antwort 300 bis 3.000 Token an Überlegungen: bei 10 Token pro Sekunde eine halbe Minute bis fünf Minuten. In Twoody legen die Stufen „Fast“, „Thinking“ und „Deep“ fest, wie lange es nachdenkt.
Ein Dokument lesen
Bevor das Modell eine Frage zu einem Dokument beantwortet, liest es das Dokument – und genau hier legen neuere Chips am meisten zu. Qwen3 8B liest ein Dokument mit 20 Seiten, bei 16 GB:
| M1 | 3 min |
| M4 | 76 s |
| M5 | 27 s |
Mac oder PC?
Ein Mac teilt seinen Arbeitsspeicher zwischen Prozessor und Grafikeinheit: Ein Mac mit 64 GB führt Modelle aus, die in keine Grafikkarte mit 24 GB passen. Eine PC-Grafikkarte hat weniger Speicher, liest ihn aber sehr schnell: Mit einem Modell, das hineinpasst, schreibt eine RTX 4090 schneller als jeder Mac. Twoody läuft heute auf dem Mac; die Versionen für Windows und Linux sind in Vorbereitung.
Das beste lokale LLM, je nach Computer
Methode und Quellen
Das Tempo jedes Geräts wird aus seiner gemessenen Geschwindigkeit mit dem Referenzmodell von llama.cpp (LLaMA 2 7B, 4 Bit) berechnet, skaliert nach dem, was jedes Modell pro Wort liest, mit den Speicherbandbreiten aus den technischen Daten von Apple und NVIDIA. Geprüft an 20 veröffentlichten Messungen, die nicht in die Berechnung eingeflossen sind: Abweichung im Median 4,5 %, höchstens 23 %, alle innerhalb der angegebenen Spannen.
Zahlen geprüft am 26. September 2026.
Quellen
- www.apple.com/newsroom/
- support.apple.com/specs
- github.com/ggml-org/llama.cpp/discussions/4167
- github.com/ggml-org/llama.cpp/discussions/15013
- github.com/ggml-org/llama.cpp/discussions/10879
- github.com/ggml-org/llama.cpp/discussions/15396
- www.nvidia.com/en-us/geforce/graphics-cards/compare/
- huggingface.co/models
- www.sciencedirect.com/science/article/abs/pii/S0749596X19300786
Fragen zu lokalen LLMs
Kann ich mit 8 GB Arbeitsspeicher ein lokales LLM ausführen?
Ja, ein kleines: Qwen3 4B oder Qwen3.5 4B laufen auf einem Mac mit 8 GB und reichen für E-Mails, Zusammenfassungen und einfache Fragen. Schließen Sie währenddessen speicherhungrige Apps. Twoody installiert auf diesen Macs Qwen3 4B.
Welches LLM für einen Mac mit 16 GB?
Ein Modell mit 7 bis 9 Milliarden Parametern: Qwen3 8B, Qwen3.5 9B oder Llama 3.1 8B schreiben auf aktuellen Macs etwa 15 bis 25 Token pro Sekunde und beantworten Fragen zu Ihren Dokumenten gut. Twoody installiert Qwen3 8B.
Wie viel Arbeitsspeicher braucht ein 70B-Modell?
Etwa 48 GB für die 4-Bit-Datei und eine kurze Unterhaltung: Ein Mac mit 64 GB führt Llama 3.3 70B aus, je nach Chip mit 7 bis 13 Token pro Sekunde. Mixture-of-Experts-Modelle wie gpt-oss-120b brauchen mehr Arbeitsspeicher, schreiben aber deutlich schneller.
Ist ein 4-Bit-Modell viel schlechter als ein 8-Bit-Modell?
Nur geringfügig. Beim Schreiben, bei Zusammenfassungen und bei Fragen zu Dokumenten fällt der Unterschied kaum auf, und 4 Bit halbiert den Speicherbedarf und verdoppelt das Tempo. Wählen Sie 8 Bit nur, wenn Sie reichlich Arbeitsspeicher haben.
Mac oder NVIDIA-Grafikkarte für ein lokales LLM?
Eine Grafikkarte schreibt schneller, wenn das Modell in ihren Speicher passt (8 bis 32 GB); ein Mac fasst in seinem gemeinsamen Arbeitsspeicher deutlich größere Modelle (bis zu 512 GB). Für eine einzelne Person, die mit Dokumenten arbeitet, ist ein Mac mit 16 bis 64 GB die einfachste Wahl.
Wird ein MacBook Air durch ein lokales LLM zu heiß?
Ein MacBook Air hat keinen Lüfter: Nach einigen Minuten ununterbrochenen Schreibens wird es langsamer, um kühl zu bleiben. Bei Antworten normaler Länge merkt man das nicht; bei langen Sitzungen hält ein MacBook Pro oder ein Mac mini sein Tempo.
Brauche ich LM Studio, Ollama oder MLX?
Nicht mit Twoody: Es installiert ein Modell und führt es mit seiner eigenen Engine, llama.cpp, aus – mit einem Klick. Wenn Sie bereits LM Studio, Ollama oder mlx-lm nutzen, verwendet Twoody auch deren Modelle.
Wie genau sind diese Schätzungen?
Bei 20 veröffentlichten Messungen, die nicht in die Formel eingeflossen sind, liegt die Abweichung im Median bei 4,5 % und höchstens bei 23 %; jede Messung lag innerhalb der angegebenen Spanne. Ihr Tempo hängt außerdem von der App ab, von ihrer Version und davon, was der Computer sonst noch tut.
Probieren Sie lokale KI auf Ihrem Mac aus – kostenlos.
Version 0.12.1 · macOS 13 oder neuer · ohne Konto, ohne Abo. Laden Sie die App herunter, installieren Sie ein Modell mit einem Klick und stellen Sie Ihre erste Frage – sogar offline.