Twoody

Calculateur de LLM local

Le meilleur LLM local pour votre MacBook Pro

D'un M1 de 8 Go à un M5 Max de 128 Go : le modèle le plus fort qui tourne confortablement sur chaque MacBook Pro, et à quelle vitesse il écrit.

Votre ordinateur Mémoire Recommandé — tourne confortablement Écrit En un clic dans Twoody

M5 Max — MacBook Pro, Mac Studio

36 Go GLM-4.7-Flash 100+ tokens/s Qwen3 14B
48 Go GLM-4.7-Flash 100+ tokens/s Qwen3 14B
64 Go GLM-4.7-Flash 100+ tokens/s Qwen3 14B
128 Go Qwen3-Next 80B-A3B 96–193 tokens/s Qwen3 14B

M5 Pro — MacBook Pro, Mac mini

24 Go gpt-oss-20b 68–97 tokens/s Qwen3 14B
48 Go GLM-4.7-Flash 92–132 tokens/s Qwen3 14B
64 Go GLM-4.7-Flash 92–132 tokens/s Qwen3 14B

M5 — MacBook Air, MacBook Pro

16 Go Llama 3.1 8B 20–28 tokens/s Qwen3 8B
24 Go gpt-oss-20b 32–47 tokens/s Qwen3 14B
32 Go GLM-4.7-Flash 41–59 tokens/s Qwen3 14B

M4 Max — MacBook Pro, Mac Studio

36 Go GLM-4.7-Flash 73–106 tokens/s Qwen3 14B
48 Go gpt-oss-20b 85–122 tokens/s Qwen3 14B
64 Go gpt-oss-20b 85–122 tokens/s Qwen3 14B
128 Go Qwen3-Next 80B-A3B 53–107 tokens/s Qwen3 14B

M4 Pro — MacBook Pro, Mac mini

24 Go gpt-oss-20b 52–74 tokens/s Qwen3 14B
48 Go GLM-4.7-Flash 56–81 tokens/s Qwen3 14B
64 Go GLM-4.7-Flash 56–81 tokens/s Qwen3 14B

M4 — MacBook Air, MacBook Pro, Mac mini, iMac

16 Go Llama 3.1 8B 15–22 tokens/s Qwen3 8B
24 Go gpt-oss-20b 25–36 tokens/s Qwen3 14B
32 Go GLM-4.7-Flash 32–46 tokens/s Qwen3 14B

M3 Max — MacBook Pro

36 Go GLM-4.7-Flash 68–97 tokens/s Qwen3 14B
48 Go gpt-oss-20b 68–98 tokens/s Qwen3 14B
64 Go gpt-oss-20b 68–98 tokens/s Qwen3 14B
96 Go Qwen3-Next 80B-A3B 47–93 tokens/s Qwen3 14B
128 Go Qwen3-Next 80B-A3B 46–93 tokens/s Qwen3 14B

M3 Pro — MacBook Pro

18 Go Llama 3.1 8B 19–28 tokens/s Qwen3 8B
36 Go GLM-4.7-Flash 42–60 tokens/s Qwen3 14B

M3 — MacBook Air, MacBook Pro, iMac

8 Go Llama 3.2 3B 31–45 tokens/s Qwen3 4B
16 Go Llama 3.1 8B 13–19 tokens/s Qwen3 8B
24 Go gpt-oss-20b 23–32 tokens/s Qwen3 14B

M2 Max — MacBook Pro, Mac Studio

32 Go gpt-oss-20b 62–90 tokens/s Qwen3 14B
64 Go gpt-oss-20b 62–90 tokens/s Qwen3 14B
96 Go Qwen3-Next 80B-A3B 39–78 tokens/s Qwen3 14B

M2 Pro — MacBook Pro, Mac mini

16 Go Llama 3.1 8B 24–35 tokens/s Qwen3 8B
32 Go GLM-4.7-Flash 45–65 tokens/s Qwen3 14B

M2 — MacBook Air, MacBook Pro, Mac mini

8 Go Llama 3.2 3B 32–45 tokens/s Qwen3 4B
16 Go Llama 3.1 8B 13–19 tokens/s Qwen3 8B
24 Go gpt-oss-20b 23–33 tokens/s Qwen3 14B

M1 Max — MacBook Pro, Mac Studio

32 Go gpt-oss-20b 56–80 tokens/s Qwen3 14B
64 Go gpt-oss-20b 56–80 tokens/s Qwen3 14B

M1 Pro — MacBook Pro

16 Go Llama 3.1 8B 23–33 tokens/s Qwen3 8B
32 Go GLM-4.7-Flash 39–56 tokens/s Qwen3 14B

M1 — MacBook Air, MacBook Pro, Mac mini, iMac

8 Go Llama 3.2 3B 20–29 tokens/s Qwen3 4B
16 Go Llama 3.1 8B 8,9–13 tokens/s Qwen3 8B

Des estimations, pas des mesures, calculées à partir des benchmarks publics de llama.cpp. Chiffres revus le 26 septembre 2026.

La mémoire décide de la taille du modèle : 16 Go pour 8 milliards de paramètres, 32 à 48 Go pour des mélanges d'experts comme Qwen3 30B-A3B, 64 Go et plus pour des modèles de 70 milliards.

Les puces Pro et Max lisent leur mémoire deux à cinq fois plus vite que les puces de base : c'est ce qui les fait écrire vite avec de grands modèles.

Avec ses ventilateurs, un MacBook Pro garde sa vitesse pendant les longues sessions, sur batterie comme sur secteur.

Questions sur les LLM en local

Quel LLM pour un MacBook Pro M4 Max ?

Avec 64 Go ou plus, gpt-oss-120b (sur 128 Go), Llama 3.3 70B ou Qwen3 30B-A3B ; les mélanges d'experts écrivent plusieurs fois plus vite que le 70B dense.

Que change 48 Go sur un MacBook Pro ?

Il fait tourner confortablement des mélanges d'experts comme Qwen3 30B-A3B ou gpt-oss-20b, à plusieurs dizaines de tokens par seconde, en laissant de la place aux autres applications.

Un LLM local vide-t-il la batterie d'un MacBook Pro ?

Écrire une réponse sollicite les graphiques à fond quelques secondes ; entre deux réponses, le modèle attend sans consommer. Travailler sur des documents sur batterie ne pose pas de problème ; des heures d'écriture continue, si.

Essayez l'IA locale sur votre Mac, gratuitement.

Version 0.11.5 · macOS 13 ou plus récent · sans compte, sans abonnement. Téléchargez, installez un modèle en un clic, et posez votre première question — même hors ligne.