Calculateur de LLM local
Le meilleur LLM local pour votre Mac Studio
Du M1 Max au M5 Ultra de 512 Go : les plus grands modèles qu'un Mac puisse contenir, et à quelle vitesse ils écrivent.
| Votre ordinateur | Mémoire | Recommandé — tourne confortablement | Écrit | En un clic dans Twoody |
|---|---|---|---|---|
M5 Max — MacBook Pro, Mac Studio |
36 Go | GLM-4.7-Flash | 100+ tokens/s | Qwen3.5 9B |
| 48 Go | GLM-4.7-Flash | 100+ tokens/s | Qwen3.5 9B | |
| 64 Go | GLM-4.7-Flash | 100+ tokens/s | Qwen3.5 9B | |
| 128 Go | Qwen3-Next 80B-A3B | 96–193 tokens/s | Qwen3.5 9B | |
M5 Ultra — Mac Studio |
96 Go | gpt-oss-120b | 92–163 tokens/s | Qwen3.5 9B |
| 256 Go | Qwen3 235B-A22B | 28–50 tokens/s | Qwen3.5 9B | |
| 512 Go | Qwen3 235B-A22B | 28–50 tokens/s | Qwen3.5 9B | |
M3 Ultra — Mac Studio |
96 Go | gpt-oss-120b | 63–90 tokens/s | Qwen3.5 9B |
| 256 Go | Qwen3 235B-A22B | 20–28 tokens/s | Qwen3.5 9B | |
| 512 Go | Qwen3 235B-A22B | 20–28 tokens/s | Qwen3.5 9B | |
M4 Max — MacBook Pro, Mac Studio |
36 Go | GLM-4.7-Flash | 73–106 tokens/s | Qwen3.5 9B |
| 48 Go | gpt-oss-20b | 85–122 tokens/s | Qwen3.5 9B | |
| 64 Go | gpt-oss-20b | 85–122 tokens/s | Qwen3.5 9B | |
| 128 Go | Qwen3-Next 80B-A3B | 53–107 tokens/s | Qwen3.5 9B | |
M2 Ultra — Mac Studio |
64 Go | gpt-oss-20b | 89–128 tokens/s | Qwen3.5 9B |
| 128 Go | gpt-oss-120b | 63–91 tokens/s | Qwen3.5 9B | |
| 192 Go | Qwen3 235B-A22B | 20–28 tokens/s | Qwen3.5 9B | |
M2 Max — MacBook Pro, Mac Studio |
32 Go | gpt-oss-20b | 62–90 tokens/s | Qwen3.5 9B |
| 64 Go | gpt-oss-20b | 62–90 tokens/s | Qwen3.5 9B | |
| 96 Go | Qwen3-Next 80B-A3B | 39–78 tokens/s | Qwen3.5 9B | |
M1 Ultra — Mac Studio |
64 Go | gpt-oss-20b | 75–107 tokens/s | Qwen3.5 9B |
| 128 Go | gpt-oss-120b | 52–75 tokens/s | Qwen3.5 9B | |
M1 Max — MacBook Pro, Mac Studio |
32 Go | gpt-oss-20b | 56–80 tokens/s | Qwen3.5 9B |
| 64 Go | gpt-oss-20b | 56–80 tokens/s | Qwen3.5 9B |
Des estimations, pas des mesures, calculées à partir des benchmarks publics de llama.cpp. Chiffres revus le 26 septembre 2026.
Avec 128 à 512 Go de mémoire unifiée, un Mac Studio contient des modèles qu'aucune carte graphique ne peut : gpt-oss-120b, Qwen3.5 122B-A10B, et même Qwen3 235B-A22B.
Ses puces Max et Ultra lisent leur mémoire à 400 Go/s jusqu'à 1,2 To/s : les mélanges d'experts répondent à des dizaines de tokens par seconde.
Silencieux même sous charge, il garde sa vitesse pendant les longues sessions.
Questions sur les LLM en local
Quel LLM pour un Mac Studio à puce Ultra ?
Avec 256 ou 512 Go, Qwen3 235B-A22B, le plus grand modèle ici, tourne confortablement ; gpt-oss-120b et Qwen3.5 122B-A10B écrivent plus vite.
128 Go suffisent-ils pour un modèle 70B ?
Oui, confortablement : Llama 3.3 70B demande environ 48 Go en 4 bits. Avec 128 Go, les mélanges d'experts comme gpt-oss-120b tiennent aussi.
Max ou Ultra pour un LLM local ?
L'Ultra double la bande passante et la mémoire : des réponses plus rapides avec les grands modèles, et les plus grands modèles. Jusqu'à 70B, un Max suffit.
Le meilleur LLM local, par ordinateur
Essayez l'IA locale sur votre Mac, gratuitement.
Version 0.13.1 · macOS 13 ou plus récent · sans compte, sans abonnement. Téléchargez, installez un modèle en un clic, et posez votre première question — même hors ligne.