Calculateur de LLM local
Le meilleur LLM local pour votre carte graphique NVIDIA
De la RTX 3060 à la RTX 5090 : le modèle le plus fort qui tient dans la mémoire de chaque carte, et à quelle vitesse il écrit.
| Votre ordinateur | Mémoire | Recommandé — tourne confortablement | Écrit |
|---|---|---|---|
GeForce RTX 5090 (32 GB) |
32 Go | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 5080 (16 GB) |
16 Go | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 5070 Ti (16 GB) |
16 Go | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 5070 (12 GB) |
12 Go | Llama 3.1 8B | 80–116 tokens/s |
GeForce RTX 5060 Ti (16 GB) |
16 Go | gpt-oss-20b | 82–142 tokens/s |
GeForce RTX 5060 Ti (8 GB) |
8 Go | Llama 3.1 8B | 57–83 tokens/s |
GeForce RTX 5060 (8 GB) |
8 Go | Llama 3.1 8B | 50–89 tokens/s |
GeForce RTX 4090 (24 GB) |
24 Go | GLM-4.7-Flash | 100+ tokens/s |
GeForce RTX 4080 SUPER (16 GB) |
16 Go | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 4080 (16 GB) |
16 Go | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 4070 Ti SUPER (16 GB) |
16 Go | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 4070 Ti (12 GB) |
12 Go | Llama 3.1 8B | 66–95 tokens/s |
GeForce RTX 4070 SUPER (12 GB) |
12 Go | Llama 3.1 8B | 66–95 tokens/s |
GeForce RTX 4070 (12 GB) |
12 Go | Llama 3.1 8B | 58–84 tokens/s |
GeForce RTX 4060 Ti (16 GB) |
16 Go | gpt-oss-20b | 55–96 tokens/s |
GeForce RTX 4060 Ti (8 GB) |
8 Go | Llama 3.1 8B | 38–55 tokens/s |
GeForce RTX 4060 (8 GB) |
8 Go | Llama 3.1 8B | 31–56 tokens/s |
GeForce RTX 3090 (24 GB) |
24 Go | gpt-oss-20b | 100+ tokens/s |
GeForce RTX 3080 (10 GB) |
10 Go | Llama 3.1 8B | 88–127 tokens/s |
GeForce RTX 3070 (8 GB) |
8 Go | Llama 3.1 8B | 50–72 tokens/s |
GeForce RTX 3060 Ti (8 GB) |
8 Go | Llama 3.1 8B | 54–78 tokens/s |
GeForce RTX 3060 (12 GB) |
12 Go | Llama 3.1 8B | 47–68 tokens/s |
Des estimations, pas des mesures, calculées à partir des benchmarks publics de llama.cpp. Chiffres revus le 26 septembre 2026.
Sur un PC, la mémoire de la carte graphique (VRAM) décide : 8 Go pour des modèles de 4 à 8 milliards de paramètres, 16 Go pour 14 milliards ou gpt-oss-20b, 24 à 32 Go pour 32 milliards.
Les cartes graphiques lisent leur mémoire très vite : avec un modèle qui tient, elles écrivent plus vite que n'importe quel Mac.
Twoody pour Windows et Linux est en préparation ; la version en test fait tourner les modèles sur le processeur. En attendant, ces vitesses sont celles de LM Studio ou d'Ollama.
Questions sur les LLM en local
Quel LLM pour une RTX 4090 ?
Avec 24 Go, Qwen3 32B ou Gemma 4 31B tiennent en 4 bits, et gpt-oss-20b écrit à bien plus de 100 tokens par seconde.
Une carte graphique de 8 Go suffit-elle ?
Pour des modèles de 4 à 8 milliards de paramètres, oui, avec une conversation courte. Les plus grands débordent sur la mémoire de l'ordinateur et ralentissent beaucoup.
Twoody tourne-t-il sur Windows avec une carte NVIDIA ?
Pas encore : la version Windows est en préparation. Laissez votre e-mail sur la page des plateformes pour être prévenu quand elle sera prête.
Le meilleur LLM local, par ordinateur
Essayez l'IA locale sur votre Mac, gratuitement.
Version 0.11.5 · macOS 13 ou plus récent · sans compte, sans abonnement. Téléchargez, installez un modèle en un clic, et posez votre première question — même hors ligne.