Calculateur de LLM local
Quel LLM local votre ordinateur peut-il faire tourner, et à quelle vitesse ?
Choisissez votre Mac ou votre PC. Voyez quels modèles ouverts tiennent dans sa mémoire, à quelle vitesse ils écrivent, en combien de temps ils lisent un document, et à quoi ils servent.
Les modèles pour cet ordinateur
Sur M4 Pro avec 24 Go : 20 modèles sur 36 tournent bien.
Ce que Twoody installe sur ce Mac
Qwen3 14B, en un clic, avec des conversations de 16k tokens.
Tourne confortablement · 18–27 tokens/s (quasi instantané) · 20 pages en 84 s
Tournent bien sur cet ordinateur
12,7 sur 15 Go
Tourne confortablement
52–74 tokens/s
semble instantané
20 pages en 26 s
- Discussion et rédaction
- Vos documents
- Code
- Raisonnement
- Agents
7,3 sur 15 Go
Tourne confortablement
32–46 tokens/s
quasi instantané
20 pages en 45 s
- Discussion et rédaction
- Vos documents
- Traduction
7,7 sur 15 Go
Tourne confortablement
31–45 tokens/s
quasi instantané
20 pages en 46 s
- Discussion et rédaction
- Vos documents
- Traduction
- Raisonnement
7,7 sur 15 Go
Tourne confortablement
31–45 tokens/s
quasi instantané
20 pages en 46 s
- Discussion et rédaction
- Vos documents
- Traduction
- Raisonnement
7,7 sur 15 Go
Tourne confortablement
30–44 tokens/s
quasi instantané
20 pages en 50 s
- Discussion et rédaction
- Vos documents
- Traduction
6,6 sur 15 Go
Tourne confortablement
20–40 tokens/s
quasi instantané
20 pages en 56 s
- Discussion et rédaction
- Vos documents
- Traduction
- Raisonnement
8,1 sur 15 Go
Tourne confortablement
23–33 tokens/s
quasi instantané
20 pages en 68 s
- Discussion et rédaction
- Vos documents
- Traduction
11,1 sur 15 Go
Tourne confortablement
20–29 tokens/s
quasi instantané
20 pages en 79 s
- Discussion et rédaction
- Vos documents
- Traduction
12,3 sur 15 Go
Tourne confortablement
19–27 tokens/s
quasi instantané
20 pages en 83 s
- Discussion et rédaction
- Vos documents
- Raisonnement
11,8 sur 15 Go
Tourne confortablement
18–27 tokens/s
quasi instantané
20 pages en 84 s
- Discussion et rédaction
- Vos documents
- Traduction
- Raisonnement
4,2 sur 15 Go
Tourne confortablement
67–97 tokens/s
semble instantané
20 pages en 18 s
- Discussion et rédaction
- Traduction
4,9 sur 15 Go
Tourne confortablement
56–80 tokens/s
semble instantané
20 pages en 21 s
- Discussion et rédaction
5,2 sur 15 Go
Tourne confortablement
54–77 tokens/s
semble instantané
20 pages en 23 s
- Discussion et rédaction
- Traduction
5,9 sur 15 Go
Tourne confortablement
49–71 tokens/s
semble instantané
20 pages en 25 s
- Discussion et rédaction
- Traduction
3,7 sur 15 Go
Tourne confortablement
37–73 tokens/s
semble instantané
20 pages en 27 s
- Discussion et rédaction
- Traduction
2,6 sur 15 Go
Tourne confortablement
100+ tokens/s
semble instantané
20 pages en 3 s
3,3 sur 15 Go
Tourne confortablement
63–188 tokens/s
semble instantané
20 pages en 10 s
1,9 sur 15 Go
Tourne confortablement
70–140 tokens/s
semble instantané
20 pages en 12 s
3,8 sur 15 Go
Tourne confortablement
85–122 tokens/s
semble instantané
20 pages en 13 s
2,7 sur 15 Go
Tourne confortablement
73–105 tokens/s
semble instantané
20 pages en 14 s
Tournent, mais bien plus lentement (8)
19,2 sur 15 Go
En partie sur le processeur : bien plus lent
23–32 tokens/s
quasi instantané
20 pages en 54 s
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Raisonnement
- Agents
20,1 sur 15 Go
En partie sur le processeur : bien plus lent
20–29 tokens/s
quasi instantané
20 pages en 59 s
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Raisonnement
- Agents
20,1 sur 15 Go
En partie sur le processeur : bien plus lent
20–29 tokens/s
quasi instantané
20 pages en 59 s
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Agents
17,7 sur 15 Go
En partie sur le processeur : bien plus lent
20–28 tokens/s
quasi instantané
20 pages en 72 s
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Agents
17 sur 15 Go
En partie sur le processeur : bien plus lent
4,8–6,9 tokens/s
à votre vitesse de lecture
20 pages en 6 min
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Agents
17 sur 15 Go
En partie sur le processeur : bien plus lent
4,8–6,9 tokens/s
à votre vitesse de lecture
20 pages en 6 min
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Agents
19,8 sur 15 Go
En partie sur le processeur : bien plus lent
3,8–5,4 tokens/s
plus lent que votre lecture
20 pages en 7 min
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Agents
17,6 sur 15 Go
En partie sur le processeur : bien plus lent
2,9–5,7 tokens/s
plus lent que votre lecture
20 pages en 7 min
- Discussion et rédaction
- Vos documents
- Traduction
- Code
- Raisonnement
- Agents
Trop gros pour cet ordinateur (8)
- Qwen3.6 35B-A3B · 22,5 sur 15 Go
- Qwen3 32B · 23,8 sur 15 Go
- Llama 3.3 70B · 47,1 sur 15 Go
- Qwen3-Next 80B-A3B · 48,3 sur 15 Go
- gpt-oss-120b · 63,1 sur 15 Go
- Mistral Small 4 119B · 71,1 sur 15 Go
- Qwen3.5 122B-A10B · 75,7 sur 15 Go
- Qwen3 235B-A22B · 142,4 sur 15 Go
Des estimations, pas des mesures, calculées à partir des benchmarks publics de llama.cpp. Chiffres revus le 26 septembre 2026.
De combien de mémoire a-t-on besoin pour un LLM local ?
La mémoire décide des modèles qui tiennent : le fichier du modèle, plus la conversation qu'il garde en tête. Un Mac laisse ses graphiques utiliser environ les deux tiers de sa mémoire jusqu'à 32 Go, les trois quarts au-delà. En 4 bits, ce qui tourne confortablement :
| Mémoire | Recommandé — tourne confortablement |
|---|---|
| 8 Go | Llama 3.2 3B, Phi-4-mini, Qwen3.5 4B |
| 16 Go | Llama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B |
| 24 Go | gpt-oss-20b, Llama 3.1 8B, Qwen3 8B |
| 32 Go | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 48 Go | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 64 Go | Llama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B |
| 128 Go | Qwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B |
| 256 Go | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
| 512 Go | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
Pourquoi la bande passante mémoire fait la vitesse
Pour écrire chaque mot, l'ordinateur relit en mémoire les poids actifs du modèle. La vitesse suit donc la bande passante mémoire plus que la puissance du processeur. Qwen3 8B, en 4 bits, sur quelques machines :
| Ordinateur | Bande passante mémoire | Écrit |
|---|---|---|
| M1 | 68 Go/s | 8,7–12 tokens/s |
| M2 | 100 Go/s | 13–19 tokens/s |
| M4 | 120 Go/s | 15–21 tokens/s |
| M5 | 153 Go/s | 19–27 tokens/s |
| M4 Pro | 273 Go/s | 31–45 tokens/s |
| M4 Max | 546 Go/s | 53–76 tokens/s |
| M5 Max | 614 Go/s | 72–104 tokens/s |
| GeForce RTX 4090 (24 GB) | 1 008 Go/s | 100+ tokens/s |
4 bits ou 8 bits ?
Les modèles sont diffusés compressés. En 4 bits (Q4_K_M, ou MXFP4 pour gpt-oss), un fichier fait la moitié de sa version 8 bits pour une petite perte de qualité : c'est ce qu'installe Twoody, et le bon choix sur la plupart des ordinateurs. Le 8 bits est un peu plus fin et demande deux fois plus de mémoire.
Les tokens par seconde, en pratique
Un token est un morceau de mot : environ trois quarts de mot en anglais, un peu moins en français. Vous lisez en silence à environ 5 tokens par seconde.
| moins de 5 | plus lent que votre lecture |
| 5 à 10 | à votre vitesse de lecture |
| 10 à 20 | plus rapide que votre lecture |
| 20 à 50 | quasi instantané |
| plus de 50 | semble instantané |
Un modèle qui réfléchit écrit d'abord 300 à 3 000 tokens de raisonnement avant sa réponse : à 10 tokens par seconde, de trente secondes à cinq minutes. Dans Twoody, les réglages Rapide, Réfléchi et Approfondi choisissent combien de temps il réfléchit.
Lire un document
Avant de répondre sur un document, le modèle le lit — et c'est là que les puces récentes gagnent le plus. Qwen3 8B qui lit un document de 20 pages, avec 16 Go :
| M1 | 3 min |
| M4 | 76 s |
| M5 | 27 s |
Mac ou PC ?
Un Mac partage sa mémoire entre le processeur et les graphiques : un Mac de 64 Go fait tourner des modèles qu'aucune carte graphique de 24 Go ne contient. Une carte graphique de PC a moins de mémoire mais la lit très vite : avec un modèle qui tient, une RTX 4090 écrit plus vite que n'importe quel Mac. Twoody tourne aujourd'hui sur Mac ; les versions Windows et Linux sont en préparation.
Le meilleur LLM local, par ordinateur
Méthode et sources
La vitesse de chaque machine est calculée à partir de sa vitesse mesurée sur le modèle de référence de llama.cpp (LLaMA 2 7B, 4 bits), mise à l'échelle de ce que chaque modèle lit par mot, avec les bandes passantes mémoire des fiches techniques d'Apple et de NVIDIA. Vérifiée sur 20 mesures publiées qui n'ont pas servi à la construire : écart médian de 4,5 %, le plus grand de 23 %, toutes dans les fourchettes affichées.
Chiffres revus le 26 septembre 2026.
Sources
- www.apple.com/newsroom/
- support.apple.com/specs
- github.com/ggml-org/llama.cpp/discussions/4167
- github.com/ggml-org/llama.cpp/discussions/15013
- github.com/ggml-org/llama.cpp/discussions/10879
- github.com/ggml-org/llama.cpp/discussions/15396
- www.nvidia.com/en-us/geforce/graphics-cards/compare/
- huggingface.co/models
- www.sciencedirect.com/science/article/abs/pii/S0749596X19300786
Questions sur les LLM en local
Peut-on faire tourner un LLM local avec 8 Go de mémoire ?
Oui, un petit : Qwen3 4B ou Qwen3.5 4B tournent sur un Mac de 8 Go et suffisent pour les e-mails, les résumés et les questions simples. Fermez les applications lourdes pendant ce temps. Twoody installe Qwen3 4B sur ces Mac.
Quel LLM pour un Mac de 16 Go ?
Un modèle de 7 à 9 milliards de paramètres : Qwen3 8B, Qwen3.5 9B ou Llama 3.1 8B écrivent environ 15 à 25 tokens par seconde sur les Mac récents et répondent bien sur vos documents. Twoody installe Qwen3 8B.
De combien de mémoire un modèle 70B a-t-il besoin ?
Environ 48 Go pour son fichier en 4 bits et une conversation courte : un Mac de 64 Go fait tourner Llama 3.3 70B, à 7 à 13 tokens par seconde selon la puce. Les mélanges d'experts comme gpt-oss-120b demandent plus de mémoire mais écrivent bien plus vite.
Un modèle en 4 bits est-il bien moins bon qu'en 8 bits ?
Un peu. Pour rédiger, résumer et interroger des documents, la différence se remarque à peine, et le 4 bits divise la mémoire par deux et double la vitesse. Ne choisissez le 8 bits que si la mémoire est largement suffisante.
Mac ou carte graphique NVIDIA pour un LLM local ?
Une carte graphique écrit plus vite avec un modèle qui tient dans sa mémoire (8 à 32 Go) ; un Mac contient des modèles bien plus grands dans sa mémoire unifiée (jusqu'à 512 Go). Pour une personne qui travaille sur des documents, un Mac de 16 à 64 Go est le choix le plus simple.
Un LLM local fait-il trop chauffer un MacBook Air ?
Un MacBook Air n'a pas de ventilateur : après quelques minutes d'écriture continue, il ralentit pour rester frais. Pour des réponses de longueur normale, cela ne se remarque pas ; pour de longues sessions, un MacBook Pro ou un Mac mini gardent leur vitesse.
Faut-il LM Studio, Ollama ou MLX ?
Pas avec Twoody : il installe un modèle et le fait tourner avec son propre moteur, llama.cpp, en un clic. Si vous utilisez déjà LM Studio, Ollama ou mlx-lm, Twoody se sert aussi de leurs modèles.
Ces estimations sont-elles fiables ?
Sur 20 mesures publiées qui n'ont pas servi à construire la formule, l'écart médian est de 4,5 % et le plus grand de 23 % ; chacune tombe dans la fourchette affichée. Votre vitesse dépend aussi de l'application, de sa version et de ce que fait l'ordinateur en même temps.
Essayez l'IA locale sur votre Mac, gratuitement.
Version 0.12.1 · macOS 13 ou plus récent · sans compte, sans abonnement. Téléchargez, installez un modèle en un clic, et posez votre première question — même hors ligne.