Twoody

Rechner für lokale LLMs

Das beste lokale LLM für Ihre NVIDIA-Grafikkarte

Von der RTX 3060 bis zur RTX 5090: das stärkste Modell, das in den Speicher der jeweiligen Karte passt, und wie schnell es schreibt.

Ihr Computer Arbeitsspeicher Empfohlen – läuft problemlos Schreibt

GeForce RTX 5090 (32 GB)

32 GB gpt-oss-20b 100+ Token/s

GeForce RTX 5080 (16 GB)

16 GB gpt-oss-20b 100+ Token/s

GeForce RTX 5070 Ti (16 GB)

16 GB gpt-oss-20b 100+ Token/s

GeForce RTX 5070 (12 GB)

12 GB Llama 3.1 8B 80–116 Token/s

GeForce RTX 5060 Ti (16 GB)

16 GB gpt-oss-20b 82–142 Token/s

GeForce RTX 5060 Ti (8 GB)

8 GB Llama 3.1 8B 57–83 Token/s

GeForce RTX 5060 (8 GB)

8 GB Llama 3.1 8B 50–89 Token/s

GeForce RTX 4090 (24 GB)

24 GB GLM-4.7-Flash 100+ Token/s

GeForce RTX 4080 SUPER (16 GB)

16 GB gpt-oss-20b 100+ Token/s

GeForce RTX 4080 (16 GB)

16 GB gpt-oss-20b 100+ Token/s

GeForce RTX 4070 Ti SUPER (16 GB)

16 GB gpt-oss-20b 100+ Token/s

GeForce RTX 4070 Ti (12 GB)

12 GB Llama 3.1 8B 66–95 Token/s

GeForce RTX 4070 SUPER (12 GB)

12 GB Llama 3.1 8B 66–95 Token/s

GeForce RTX 4070 (12 GB)

12 GB Llama 3.1 8B 58–84 Token/s

GeForce RTX 4060 Ti (16 GB)

16 GB gpt-oss-20b 55–96 Token/s

GeForce RTX 4060 Ti (8 GB)

8 GB Llama 3.1 8B 38–55 Token/s

GeForce RTX 4060 (8 GB)

8 GB Llama 3.1 8B 31–56 Token/s

GeForce RTX 3090 (24 GB)

24 GB gpt-oss-20b 100+ Token/s

GeForce RTX 3080 (10 GB)

10 GB Llama 3.1 8B 88–127 Token/s

GeForce RTX 3070 (8 GB)

8 GB Llama 3.1 8B 50–72 Token/s

GeForce RTX 3060 Ti (8 GB)

8 GB Llama 3.1 8B 54–78 Token/s

GeForce RTX 3060 (12 GB)

12 GB Llama 3.1 8B 47–68 Token/s

Schätzungen, keine Messungen, berechnet aus öffentlichen llama.cpp-Benchmarks. Zahlen geprüft am 26. September 2026.

Auf einem PC entscheidet der Speicher der Grafikkarte (VRAM): 8 GB für Modelle mit 4 bis 8 Milliarden Parametern, 16 GB für 14 Milliarden oder gpt-oss-20b, 24 bis 32 GB für 32 Milliarden.

Grafikkarten lesen ihren Speicher sehr schnell: Mit einem Modell, das hineinpasst, schreiben sie schneller als jeder Mac.

Twoody für Windows und Linux ist in Vorbereitung; die Version, die gerade getestet wird, lässt die Modelle auf dem Prozessor laufen. Bis dahin zeigen diese Werte das Tempo von LM Studio oder Ollama.

Fragen zu lokalen LLMs

Welches LLM für eine RTX 4090?

Mit 24 GB passen Qwen3 32B oder Gemma 4 31B in 4 Bit, und gpt-oss-20b schreibt mit deutlich über 100 Token pro Sekunde.

Reicht eine Grafikkarte mit 8 GB?

Für Modelle mit 4 bis 8 Milliarden Parametern ja, bei einer kurzen Unterhaltung. Größere Modelle lagern Teile in den Arbeitsspeicher des Computers aus und werden deutlich langsamer.

Läuft Twoody unter Windows mit einer NVIDIA-Karte?

Noch nicht: Die Windows-Version ist in Vorbereitung. Hinterlassen Sie auf der Seite „Plattformen“ Ihre E-Mail-Adresse, um benachrichtigt zu werden, sobald sie bereit ist.

Das beste lokale LLM, je nach Computer

Probieren Sie lokale KI auf Ihrem Mac aus – kostenlos.

Version 0.12.1 · macOS 13 oder neuer · ohne Konto, ohne Abo. Laden Sie die App herunter, installieren Sie ein Modell mit einem Klick und stellen Sie Ihre erste Frage – sogar offline.