Twoody

Calculateur de LLM local

Le meilleur LLM local pour votre Mac Studio

Du M1 Max au M5 Ultra de 512 Go : les plus grands modèles qu'un Mac puisse contenir, et à quelle vitesse ils écrivent.

Votre ordinateur Mémoire Recommandé — tourne confortablement Écrit En un clic dans Twoody

M5 Max — MacBook Pro, Mac Studio

36 Go GLM-4.7-Flash 100+ tokens/s Qwen3.5 9B
48 Go GLM-4.7-Flash 100+ tokens/s Qwen3.5 9B
64 Go GLM-4.7-Flash 100+ tokens/s Qwen3.5 9B
128 Go Qwen3-Next 80B-A3B 96–193 tokens/s Qwen3.5 9B

M5 Ultra — Mac Studio

96 Go gpt-oss-120b 92–163 tokens/s Qwen3.5 9B
256 Go Qwen3 235B-A22B 28–50 tokens/s Qwen3.5 9B
512 Go Qwen3 235B-A22B 28–50 tokens/s Qwen3.5 9B

M3 Ultra — Mac Studio

96 Go gpt-oss-120b 63–90 tokens/s Qwen3.5 9B
256 Go Qwen3 235B-A22B 20–28 tokens/s Qwen3.5 9B
512 Go Qwen3 235B-A22B 20–28 tokens/s Qwen3.5 9B

M4 Max — MacBook Pro, Mac Studio

36 Go GLM-4.7-Flash 73–106 tokens/s Qwen3.5 9B
48 Go gpt-oss-20b 85–122 tokens/s Qwen3.5 9B
64 Go gpt-oss-20b 85–122 tokens/s Qwen3.5 9B
128 Go Qwen3-Next 80B-A3B 53–107 tokens/s Qwen3.5 9B

M2 Ultra — Mac Studio

64 Go gpt-oss-20b 89–128 tokens/s Qwen3.5 9B
128 Go gpt-oss-120b 63–91 tokens/s Qwen3.5 9B
192 Go Qwen3 235B-A22B 20–28 tokens/s Qwen3.5 9B

M2 Max — MacBook Pro, Mac Studio

32 Go gpt-oss-20b 62–90 tokens/s Qwen3.5 9B
64 Go gpt-oss-20b 62–90 tokens/s Qwen3.5 9B
96 Go Qwen3-Next 80B-A3B 39–78 tokens/s Qwen3.5 9B

M1 Ultra — Mac Studio

64 Go gpt-oss-20b 75–107 tokens/s Qwen3.5 9B
128 Go gpt-oss-120b 52–75 tokens/s Qwen3.5 9B

M1 Max — MacBook Pro, Mac Studio

32 Go gpt-oss-20b 56–80 tokens/s Qwen3.5 9B
64 Go gpt-oss-20b 56–80 tokens/s Qwen3.5 9B

Des estimations, pas des mesures, calculées à partir des benchmarks publics de llama.cpp. Chiffres revus le 26 septembre 2026.

Avec 128 à 512 Go de mémoire unifiée, un Mac Studio contient des modèles qu'aucune carte graphique ne peut : gpt-oss-120b, Qwen3.5 122B-A10B, et même Qwen3 235B-A22B.

Ses puces Max et Ultra lisent leur mémoire à 400 Go/s jusqu'à 1,2 To/s : les mélanges d'experts répondent à des dizaines de tokens par seconde.

Silencieux même sous charge, il garde sa vitesse pendant les longues sessions.

Questions sur les LLM en local

Quel LLM pour un Mac Studio à puce Ultra ?

Avec 256 ou 512 Go, Qwen3 235B-A22B, le plus grand modèle ici, tourne confortablement ; gpt-oss-120b et Qwen3.5 122B-A10B écrivent plus vite.

128 Go suffisent-ils pour un modèle 70B ?

Oui, confortablement : Llama 3.3 70B demande environ 48 Go en 4 bits. Avec 128 Go, les mélanges d'experts comme gpt-oss-120b tiennent aussi.

Max ou Ultra pour un LLM local ?

L'Ultra double la bande passante et la mémoire : des réponses plus rapides avec les grands modèles, et les plus grands modèles. Jusqu'à 70B, un Max suffit.

Essayez l'IA locale sur votre Mac, gratuitement.

Version 0.13.1 · macOS 13 ou plus récent · sans compte, sans abonnement. Téléchargez, installez un modèle en un clic, et posez votre première question — même hors ligne.