Calculateur de LLM local
Quel LLM local votre ordinateur peut-il faire tourner, et à quelle vitesse ?
Choisissez votre Mac ou votre PC. Voyez quels modèles ouverts tiennent dans sa mémoire, à quelle vitesse ils écrivent, en combien de temps ils lisent un document, et à quoi ils servent.
Les modèles pour cet ordinateur
Sur M4 avec 32 Go : 28 modèles sur 36 tournent bien.
Ce que Twoody installe sur ce Mac
Qwen3 14B, en un clic, avec des conversations de 16k tokens.
Tourne confortablement · 8,6–12 tokens/s (plus rapide que votre lecture) · 20 pages en 2 min
Tournent bien sur cet ordinateur
19,2 sur 20,3 Go
Tourne confortablement
32–46 tokens/s
quasi instantané
20 pages en 36 s
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Raisonnement
- Agents
20,1 sur 20,3 Go
Tourne confortablement
28–40 tokens/s
quasi instantané
20 pages en 39 s
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Raisonnement
- Agents
20,1 sur 20,3 Go
Tourne confortablement
28–40 tokens/s
quasi instantané
20 pages en 39 s
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Agents
12,7 sur 20,3 Go
Tourne confortablement
25–36 tokens/s
quasi instantané
20 pages en 43 s
- Discussion et rédaction
- Vos documents
- Code
- Raisonnement
- Agents
17,7 sur 20,3 Go
Tourne confortablement
24–35 tokens/s
quasi instantané
20 pages en 47 s
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Agents
17 sur 20,3 Go
Tourne confortablement
5,5–7,9 tokens/s
à votre vitesse de lecture
20 pages en 4 min
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Agents
17 sur 20,3 Go
Tourne confortablement
5,5–7,9 tokens/s
à votre vitesse de lecture
20 pages en 4 min
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Agents
19,8 sur 20,3 Go
Tourne confortablement
4,3–6,2 tokens/s
à votre vitesse de lecture
20 pages en 5 min
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Agents
17,6 sur 20,3 Go
Tourne confortablement
3,3–6,6 tokens/s
à votre vitesse de lecture
20 pages en 4 min
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Raisonnement
- Agents
7,3 sur 20,3 Go
Tourne confortablement
15–22 tokens/s
plus rapide que votre lecture
20 pages en 74 s
- Discussion et rédaction
- Vos documents
- Traduction
7,7 sur 20,3 Go
Tourne confortablement
15–21 tokens/s
plus rapide que votre lecture
20 pages en 76 s
- Discussion et rédaction
- Vos documents
- Traduction
- Raisonnement
7,7 sur 20,3 Go
Tourne confortablement
15–21 tokens/s
plus rapide que votre lecture
20 pages en 76 s
- Discussion et rédaction
- Vos documents
- Traduction
- Raisonnement
7,7 sur 20,3 Go
Tourne confortablement
14–21 tokens/s
plus rapide que votre lecture
20 pages en 83 s
- Discussion et rédaction
- Vos documents
- Traduction
6,6 sur 20,3 Go
Tourne confortablement
9,4–19 tokens/s
plus rapide que votre lecture
20 pages en 2 min
- Discussion et rédaction
- Vos documents
- Traduction
- Raisonnement
8,1 sur 20,3 Go
Tourne confortablement
11–16 tokens/s
plus rapide que votre lecture
20 pages en 2 min
- Discussion et rédaction
- Vos documents
- Traduction
11,1 sur 20,3 Go
Tourne confortablement
9,3–13 tokens/s
plus rapide que votre lecture
20 pages en 2 min
- Discussion et rédaction
- Vos documents
- Traduction
12,3 sur 20,3 Go
Tourne confortablement
8,6–12 tokens/s
plus rapide que votre lecture
20 pages en 2 min
- Discussion et rédaction
- Vos documents
- Raisonnement
11,8 sur 20,3 Go
Tourne confortablement
8,6–12 tokens/s
plus rapide que votre lecture
20 pages en 2 min
- Discussion et rédaction
- Vos documents
- Traduction
- Raisonnement
4,2 sur 20,3 Go
Tourne confortablement
34–49 tokens/s
quasi instantané
20 pages en 30 s
- Discussion et rédaction
- Traduction
4,9 sur 20,3 Go
Tourne confortablement
28–40 tokens/s
quasi instantané
20 pages en 35 s
- Discussion et rédaction
5,2 sur 20,3 Go
Tourne confortablement
28–40 tokens/s
quasi instantané
20 pages en 37 s
- Discussion et rédaction
- Traduction
5,9 sur 20,3 Go
Tourne confortablement
26–37 tokens/s
quasi instantané
20 pages en 42 s
- Discussion et rédaction
- Traduction
3,7 sur 20,3 Go
Tourne confortablement
18–37 tokens/s
quasi instantané
20 pages en 44 s
- Discussion et rédaction
- Traduction
2,6 sur 20,3 Go
Tourne confortablement
67–200 tokens/s
semble instantané
20 pages en 6 s
3,3 sur 20,3 Go
Tourne confortablement
35–104 tokens/s
semble instantané
20 pages en 16 s
3,8 sur 20,3 Go
Tourne confortablement
48–68 tokens/s
semble instantané
20 pages en 21 s
1,9 sur 20,3 Go
Tourne confortablement
37–75 tokens/s
semble instantané
20 pages en 19 s
2,7 sur 20,3 Go
Tourne confortablement
41–59 tokens/s
semble instantané
20 pages en 23 s
Tournent, mais bien plus lentement (2)
22,5 sur 20,3 Go
En partie sur le processeur : bien plus lent
9–18 tokens/s
plus rapide que votre lecture
20 pages en 80 s
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Raisonnement
- Agents
23,8 sur 20,3 Go
En partie sur le processeur : bien plus lent
1,6–2,3 tokens/s
plus lent que votre lecture
20 pages en 13 min
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Raisonnement
- Agents
Trop gros pour cet ordinateur (6)
- Llama 3.3 70B · 47,1 sur 20,3 Go
- Qwen3-Next 80B-A3B · 48,3 sur 20,3 Go
- gpt-oss-120b · 63,1 sur 20,3 Go
- Mistral Small 4 119B · 71,1 sur 20,3 Go
- Qwen3.5 122B-A10B · 75,7 sur 20,3 Go
- Qwen3 235B-A22B · 142,4 sur 20,3 Go
Des estimations, pas des mesures, calculées à partir des benchmarks publics de llama.cpp. Chiffres revus le 26 septembre 2026.
De combien de mémoire a-t-on besoin pour un LLM local ?
La mémoire décide des modèles qui tiennent : le fichier du modèle, plus la conversation qu'il garde en tête. Un Mac laisse ses graphiques utiliser environ les deux tiers de sa mémoire jusqu'à 32 Go, les trois quarts au-delà. En 4 bits, ce qui tourne confortablement :
| Mémoire | Recommandé — tourne confortablement |
|---|---|
| 8 Go | Llama 3.2 3B, Phi-4-mini, Qwen3.5 4B |
| 16 Go | Llama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B |
| 24 Go | gpt-oss-20b, Llama 3.1 8B, Qwen3 8B |
| 32 Go | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 48 Go | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 64 Go | Llama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B |
| 128 Go | Qwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B |
| 256 Go | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
| 512 Go | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
Pourquoi la bande passante mémoire fait la vitesse
Pour écrire chaque mot, l'ordinateur relit en mémoire les poids actifs du modèle. La vitesse suit donc la bande passante mémoire plus que la puissance du processeur. Qwen3 8B, en 4 bits, sur quelques machines :
| Ordinateur | Bande passante mémoire | Écrit |
|---|---|---|
| M1 | 68 Go/s | 8,7–12 tokens/s |
| M2 | 100 Go/s | 13–19 tokens/s |
| M4 | 120 Go/s | 15–21 tokens/s |
| M5 | 153 Go/s | 19–27 tokens/s |
| M4 Pro | 273 Go/s | 31–45 tokens/s |
| M4 Max | 546 Go/s | 53–76 tokens/s |
| M5 Max | 614 Go/s | 72–104 tokens/s |
| GeForce RTX 4090 (24 GB) | 1 008 Go/s | 100+ tokens/s |
4 bits ou 8 bits ?
Les modèles sont diffusés compressés. En 4 bits (Q4_K_M, ou MXFP4 pour gpt-oss), un fichier fait la moitié de sa version 8 bits pour une petite perte de qualité : c'est ce qu'installe Twoody, et le bon choix sur la plupart des ordinateurs. Le 8 bits est un peu plus fin et demande deux fois plus de mémoire.
Les tokens par seconde, en pratique
Un token est un morceau de mot : environ trois quarts de mot en anglais, un peu moins en français. Vous lisez en silence à environ 5 tokens par seconde.
| moins de 5 | plus lent que votre lecture |
| 5 à 10 | à votre vitesse de lecture |
| 10 à 20 | plus rapide que votre lecture |
| 20 à 50 | quasi instantané |
| plus de 50 | semble instantané |
Un modèle qui réfléchit écrit d'abord 300 à 3 000 tokens de raisonnement avant sa réponse : à 10 tokens par seconde, de trente secondes à cinq minutes. Dans Twoody, les réglages Rapide, Réfléchi et Approfondi choisissent combien de temps il réfléchit.
Lire un document
Avant de répondre sur un document, le modèle le lit — et c'est là que les puces récentes gagnent le plus. Qwen3 8B qui lit un document de 20 pages, avec 16 Go :
| M1 | 3 min |
| M4 | 76 s |
| M5 | 27 s |
Mac ou PC ?
Un Mac partage sa mémoire entre le processeur et les graphiques : un Mac de 64 Go fait tourner des modèles qu'aucune carte graphique de 24 Go ne contient. Une carte graphique de PC a moins de mémoire mais la lit très vite : avec un modèle qui tient, une RTX 4090 écrit plus vite que n'importe quel Mac. Twoody tourne aujourd'hui sur Mac ; les versions Windows et Linux sont en préparation.
Le meilleur LLM local, par ordinateur
Méthode et sources
La vitesse de chaque machine est calculée à partir de sa vitesse mesurée sur le modèle de référence de llama.cpp (LLaMA 2 7B, 4 bits), mise à l'échelle de ce que chaque modèle lit par mot, avec les bandes passantes mémoire des fiches techniques d'Apple et de NVIDIA. Vérifiée sur 20 mesures publiées qui n'ont pas servi à la construire : écart médian de 4,5 %, le plus grand de 23 %, toutes dans les fourchettes affichées.
Chiffres revus le 26 septembre 2026.
Sources
- www.apple.com/newsroom/
- support.apple.com/specs
- github.com/ggml-org/llama.cpp/discussions/4167
- github.com/ggml-org/llama.cpp/discussions/15013
- github.com/ggml-org/llama.cpp/discussions/10879
- github.com/ggml-org/llama.cpp/discussions/15396
- www.nvidia.com/en-us/geforce/graphics-cards/compare/
- huggingface.co/models
- www.sciencedirect.com/science/article/abs/pii/S0749596X19300786
Questions sur les LLM en local
Peut-on faire tourner un LLM local avec 8 Go de mémoire ?
Oui, un petit : Qwen3 4B ou Qwen3.5 4B tournent sur un Mac de 8 Go et suffisent pour les e-mails, les résumés et les questions simples. Fermez les applications lourdes pendant ce temps. Twoody installe Qwen3 4B sur ces Mac.
Quel LLM pour un Mac de 16 Go ?
Un modèle de 7 à 9 milliards de paramètres : Qwen3 8B, Qwen3.5 9B ou Llama 3.1 8B écrivent environ 15 à 25 tokens par seconde sur les Mac récents et répondent bien sur vos documents. Twoody installe Qwen3 8B.
De combien de mémoire un modèle 70B a-t-il besoin ?
Environ 48 Go pour son fichier en 4 bits et une conversation courte : un Mac de 64 Go fait tourner Llama 3.3 70B, à 7 à 13 tokens par seconde selon la puce. Les mélanges d'experts comme gpt-oss-120b demandent plus de mémoire mais écrivent bien plus vite.
Un modèle en 4 bits est-il bien moins bon qu'en 8 bits ?
Un peu. Pour rédiger, résumer et interroger des documents, la différence se remarque à peine, et le 4 bits divise la mémoire par deux et double la vitesse. Ne choisissez le 8 bits que si la mémoire est largement suffisante.
Mac ou carte graphique NVIDIA pour un LLM local ?
Une carte graphique écrit plus vite avec un modèle qui tient dans sa mémoire (8 à 32 Go) ; un Mac contient des modèles bien plus grands dans sa mémoire unifiée (jusqu'à 512 Go). Pour une personne qui travaille sur des documents, un Mac de 16 à 64 Go est le choix le plus simple.
Un LLM local fait-il trop chauffer un MacBook Air ?
Un MacBook Air n'a pas de ventilateur : après quelques minutes d'écriture continue, il ralentit pour rester frais. Pour des réponses de longueur normale, cela ne se remarque pas ; pour de longues sessions, un MacBook Pro ou un Mac mini gardent leur vitesse.
Faut-il LM Studio, Ollama ou MLX ?
Pas avec Twoody : il installe un modèle et le fait tourner avec son propre moteur, llama.cpp, en un clic. Si vous utilisez déjà LM Studio, Ollama ou mlx-lm, Twoody se sert aussi de leurs modèles.
Ces estimations sont-elles fiables ?
Sur 20 mesures publiées qui n'ont pas servi à construire la formule, l'écart médian est de 4,5 % et le plus grand de 23 % ; chacune tombe dans la fourchette affichée. Votre vitesse dépend aussi de l'application, de sa version et de ce que fait l'ordinateur en même temps.
Essayez l'IA locale sur votre Mac, gratuitement.
Version 0.12.1 · macOS 13 ou plus récent · sans compte, sans abonnement. Téléchargez, installez un modèle en un clic, et posez votre première question — même hors ligne.