Calculateur de LLM local
Le meilleur LLM local pour votre MacBook Pro
D'un M1 de 8 Go à un M5 Max de 128 Go : le modèle le plus fort qui tourne confortablement sur chaque MacBook Pro, et à quelle vitesse il écrit.
| Votre ordinateur | Mémoire | Recommandé — tourne confortablement | Écrit | En un clic dans Twoody |
|---|---|---|---|---|
M5 Max — MacBook Pro, Mac Studio |
36 Go | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B |
| 48 Go | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B | |
| 64 Go | GLM-4.7-Flash | 100+ tokens/s | Qwen3 14B | |
| 128 Go | Qwen3-Next 80B-A3B | 96–193 tokens/s | Qwen3 14B | |
M5 Pro — MacBook Pro, Mac mini |
24 Go | gpt-oss-20b | 68–97 tokens/s | Qwen3 14B |
| 48 Go | GLM-4.7-Flash | 92–132 tokens/s | Qwen3 14B | |
| 64 Go | GLM-4.7-Flash | 92–132 tokens/s | Qwen3 14B | |
M5 — MacBook Air, MacBook Pro |
16 Go | Llama 3.1 8B | 20–28 tokens/s | Qwen3 8B |
| 24 Go | gpt-oss-20b | 32–47 tokens/s | Qwen3 14B | |
| 32 Go | GLM-4.7-Flash | 41–59 tokens/s | Qwen3 14B | |
M4 Max — MacBook Pro, Mac Studio |
36 Go | GLM-4.7-Flash | 73–106 tokens/s | Qwen3 14B |
| 48 Go | gpt-oss-20b | 85–122 tokens/s | Qwen3 14B | |
| 64 Go | gpt-oss-20b | 85–122 tokens/s | Qwen3 14B | |
| 128 Go | Qwen3-Next 80B-A3B | 53–107 tokens/s | Qwen3 14B | |
M4 Pro — MacBook Pro, Mac mini |
24 Go | gpt-oss-20b | 52–74 tokens/s | Qwen3 14B |
| 48 Go | GLM-4.7-Flash | 56–81 tokens/s | Qwen3 14B | |
| 64 Go | GLM-4.7-Flash | 56–81 tokens/s | Qwen3 14B | |
M4 — MacBook Air, MacBook Pro, Mac mini, iMac |
16 Go | Llama 3.1 8B | 15–22 tokens/s | Qwen3 8B |
| 24 Go | gpt-oss-20b | 25–36 tokens/s | Qwen3 14B | |
| 32 Go | GLM-4.7-Flash | 32–46 tokens/s | Qwen3 14B | |
M3 Max — MacBook Pro |
36 Go | GLM-4.7-Flash | 68–97 tokens/s | Qwen3 14B |
| 48 Go | gpt-oss-20b | 68–98 tokens/s | Qwen3 14B | |
| 64 Go | gpt-oss-20b | 68–98 tokens/s | Qwen3 14B | |
| 96 Go | Qwen3-Next 80B-A3B | 47–93 tokens/s | Qwen3 14B | |
| 128 Go | Qwen3-Next 80B-A3B | 46–93 tokens/s | Qwen3 14B | |
M3 Pro — MacBook Pro |
18 Go | Llama 3.1 8B | 19–28 tokens/s | Qwen3 8B |
| 36 Go | GLM-4.7-Flash | 42–60 tokens/s | Qwen3 14B | |
M3 — MacBook Air, MacBook Pro, iMac |
8 Go | Llama 3.2 3B | 31–45 tokens/s | Qwen3 4B |
| 16 Go | Llama 3.1 8B | 13–19 tokens/s | Qwen3 8B | |
| 24 Go | gpt-oss-20b | 23–32 tokens/s | Qwen3 14B | |
M2 Max — MacBook Pro, Mac Studio |
32 Go | gpt-oss-20b | 62–90 tokens/s | Qwen3 14B |
| 64 Go | gpt-oss-20b | 62–90 tokens/s | Qwen3 14B | |
| 96 Go | Qwen3-Next 80B-A3B | 39–78 tokens/s | Qwen3 14B | |
M2 Pro — MacBook Pro, Mac mini |
16 Go | Llama 3.1 8B | 24–35 tokens/s | Qwen3 8B |
| 32 Go | GLM-4.7-Flash | 45–65 tokens/s | Qwen3 14B | |
M2 — MacBook Air, MacBook Pro, Mac mini |
8 Go | Llama 3.2 3B | 32–45 tokens/s | Qwen3 4B |
| 16 Go | Llama 3.1 8B | 13–19 tokens/s | Qwen3 8B | |
| 24 Go | gpt-oss-20b | 23–33 tokens/s | Qwen3 14B | |
M1 Max — MacBook Pro, Mac Studio |
32 Go | gpt-oss-20b | 56–80 tokens/s | Qwen3 14B |
| 64 Go | gpt-oss-20b | 56–80 tokens/s | Qwen3 14B | |
M1 Pro — MacBook Pro |
16 Go | Llama 3.1 8B | 23–33 tokens/s | Qwen3 8B |
| 32 Go | GLM-4.7-Flash | 39–56 tokens/s | Qwen3 14B | |
M1 — MacBook Air, MacBook Pro, Mac mini, iMac |
8 Go | Llama 3.2 3B | 20–29 tokens/s | Qwen3 4B |
| 16 Go | Llama 3.1 8B | 8,9–13 tokens/s | Qwen3 8B |
Des estimations, pas des mesures, calculées à partir des benchmarks publics de llama.cpp. Chiffres revus le 26 septembre 2026.
La mémoire décide de la taille du modèle : 16 Go pour 8 milliards de paramètres, 32 à 48 Go pour des mélanges d'experts comme Qwen3 30B-A3B, 64 Go et plus pour des modèles de 70 milliards.
Les puces Pro et Max lisent leur mémoire deux à cinq fois plus vite que les puces de base : c'est ce qui les fait écrire vite avec de grands modèles.
Avec ses ventilateurs, un MacBook Pro garde sa vitesse pendant les longues sessions, sur batterie comme sur secteur.
Questions sur les LLM en local
Quel LLM pour un MacBook Pro M4 Max ?
Avec 64 Go ou plus, gpt-oss-120b (sur 128 Go), Llama 3.3 70B ou Qwen3 30B-A3B ; les mélanges d'experts écrivent plusieurs fois plus vite que le 70B dense.
Que change 48 Go sur un MacBook Pro ?
Il fait tourner confortablement des mélanges d'experts comme Qwen3 30B-A3B ou gpt-oss-20b, à plusieurs dizaines de tokens par seconde, en laissant de la place aux autres applications.
Un LLM local vide-t-il la batterie d'un MacBook Pro ?
Écrire une réponse sollicite les graphiques à fond quelques secondes ; entre deux réponses, le modèle attend sans consommer. Travailler sur des documents sur batterie ne pose pas de problème ; des heures d'écriture continue, si.
Le meilleur LLM local, par ordinateur
Essayez l'IA locale sur votre Mac, gratuitement.
Version 0.11.5 · macOS 13 ou plus récent · sans compte, sans abonnement. Téléchargez, installez un modèle en un clic, et posez votre première question — même hors ligne.