Twoody

Calculateur de LLM local

Quel LLM local votre ordinateur peut-il faire tourner, et à quelle vitesse ?

Choisissez votre Mac ou votre PC. Voyez quels modèles ouverts tiennent dans sa mémoire, à quelle vitesse ils écrivent, en combien de temps ils lisent un document, et à quoi ils servent.

Quel Mac ai-je ? Menu Pomme › À propos de ce Mac indique la puce et la mémoire. Sur un PC : Gestionnaire des tâches › Performances › GPU.

Les modèles pour cet ordinateur

Sur M5 Max avec 48 Go : 30 modèles sur 36 tournent bien.

Ce que Twoody installe sur ce Mac

Qwen3 14B, en un clic, avec des conversations de 16k tokens.

Tourne confortablement · 42–61 tokens/s (semble instantané) · 20 pages en 11 s

Télécharger pour Mac Apple Silicon

Tournent bien sur cet ordinateur

GLM-4.7-Flash

Z.ai · MIT

Via LM Studio, Ollama ou mlx-lm

19,2 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 3 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
Qwen3 30B-A3B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

20,1 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 3 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
Qwen3-Coder 30B-A3B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

20,1 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 3 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Qwen3.6 35B-A3B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

22,5 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 3 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
gpt-oss-20b

OpenAI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

12,7 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 3 s

  • Discussion et rédaction
  • Vos documents
  • Code
  • Raisonnement
  • Agents
Gemma 4 26B-A4B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

17,7 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 4 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Mistral Small 3.2 24B

Mistral AI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

17 sur 35 Go

Tourne confortablement

28–40 tokens/s

quasi instantané

20 pages en 18 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Devstral Small 2 24B

Mistral AI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

17 sur 35 Go

Tourne confortablement

28–40 tokens/s

quasi instantané

20 pages en 18 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Gemma 4 31B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

19,8 sur 35 Go

Tourne confortablement

22–31 tokens/s

quasi instantané

20 pages en 23 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Qwen3.8 27B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

17,6 sur 35 Go

Tourne confortablement

16–33 tokens/s

quasi instantané

20 pages en 21 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
Qwen3 32B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

23,8 sur 35 Go

Tourne confortablement

20–28 tokens/s

quasi instantané

20 pages en 24 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
Llama 3.1 8B

Meta · Llama 3.1 Community

Via LM Studio, Ollama ou mlx-lm

7,3 sur 35 Go

Tourne confortablement

75–108 tokens/s

semble instantané

20 pages en 6 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
Qwen3 8B

Qwen (Alibaba) · Apache 2.0

En un clic dans Twoody

7,7 sur 35 Go

Tourne confortablement

72–104 tokens/s

semble instantané

20 pages en 6 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Raisonnement
DeepSeek-R1-0528-Qwen3-8B

DeepSeek · MIT

Via LM Studio, Ollama ou mlx-lm

7,7 sur 35 Go

Tourne confortablement

72–104 tokens/s

semble instantané

20 pages en 6 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Raisonnement
Ministral 3 8B

Mistral AI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

7,7 sur 35 Go

Tourne confortablement

71–102 tokens/s

semble instantané

20 pages en 7 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
Qwen3.5 9B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

6,6 sur 35 Go

Tourne confortablement

46–92 tokens/s

semble instantané

20 pages en 7 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Raisonnement
Gemma 4 12B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

8,1 sur 35 Go

Tourne confortablement

53–76 tokens/s

semble instantané

20 pages en 9 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
Ministral 3 14B

Mistral AI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

11,1 sur 35 Go

Tourne confortablement

46–66 tokens/s

semble instantané

20 pages en 10 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
Phi-4 14B

Microsoft · MIT

Via LM Studio, Ollama ou mlx-lm

12,3 sur 35 Go

Tourne confortablement

43–62 tokens/s

semble instantané

20 pages en 11 s

  • Discussion et rédaction
  • Vos documents
  • Raisonnement
Qwen3 14B

Qwen (Alibaba) · Apache 2.0

En un clic dans Twoody

11,8 sur 35 Go

Tourne confortablement

42–61 tokens/s

semble instantané

20 pages en 11 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Raisonnement
Llama 3.2 3B

Meta · Llama 3.2 Community

Via LM Studio, Ollama ou mlx-lm

4,2 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 2 s

  • Discussion et rédaction
  • Traduction
Phi-4-mini

Microsoft · MIT

Via LM Studio, Ollama ou mlx-lm

4,9 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 3 s

  • Discussion et rédaction
Qwen3 4B

Qwen (Alibaba) · Apache 2.0

En un clic dans Twoody

5,2 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 3 s

  • Discussion et rédaction
  • Traduction
Gemma 4 E4B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

5,9 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 3 s

  • Discussion et rédaction
  • Traduction
Qwen3.5 4B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

3,7 sur 35 Go

Tourne confortablement

87–175 tokens/s

semble instantané

20 pages en 3 s

  • Discussion et rédaction
  • Traduction
Qwen3 0.6B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

2,6 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 1 s

Qwen3 1.7B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

3,3 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 1 s

Gemma 4 E2B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

3,8 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 2 s

Qwen3.5 2B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

1,9 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 2 s

MiniCPM5 2B

OpenBMB · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

2,7 sur 35 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 2 s

Trop gros pour cet ordinateur (6)
  • Llama 3.3 70B · 47,1 sur 35 Go
  • Qwen3-Next 80B-A3B · 48,3 sur 35 Go
  • gpt-oss-120b · 63,1 sur 35 Go
  • Mistral Small 4 119B · 71,1 sur 35 Go
  • Qwen3.5 122B-A10B · 75,7 sur 35 Go
  • Qwen3 235B-A22B · 142,4 sur 35 Go

Des estimations, pas des mesures, calculées à partir des benchmarks publics de llama.cpp. Chiffres revus le 26 septembre 2026.

De combien de mémoire a-t-on besoin pour un LLM local ?

La mémoire décide des modèles qui tiennent : le fichier du modèle, plus la conversation qu'il garde en tête. Un Mac laisse ses graphiques utiliser environ les deux tiers de sa mémoire jusqu'à 32 Go, les trois quarts au-delà. En 4 bits, ce qui tourne confortablement :

MémoireRecommandé — tourne confortablement
8 GoLlama 3.2 3B, Phi-4-mini, Qwen3.5 4B
16 GoLlama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B
24 Gogpt-oss-20b, Llama 3.1 8B, Qwen3 8B
32 GoGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
48 GoGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
64 GoLlama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B
128 GoQwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B
256 GoQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B
512 GoQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B

Pourquoi la bande passante mémoire fait la vitesse

Pour écrire chaque mot, l'ordinateur relit en mémoire les poids actifs du modèle. La vitesse suit donc la bande passante mémoire plus que la puissance du processeur. Qwen3 8B, en 4 bits, sur quelques machines :

Ordinateur Bande passante mémoire Écrit
M1 68 Go/s 8,7–12 tokens/s
M2 100 Go/s 13–19 tokens/s
M4 120 Go/s 15–21 tokens/s
M5 153 Go/s 19–27 tokens/s
M4 Pro 273 Go/s 31–45 tokens/s
M4 Max 546 Go/s 53–76 tokens/s
M5 Max 614 Go/s 72–104 tokens/s
GeForce RTX 4090 (24 GB) 1 008 Go/s 100+ tokens/s

4 bits ou 8 bits ?

Les modèles sont diffusés compressés. En 4 bits (Q4_K_M, ou MXFP4 pour gpt-oss), un fichier fait la moitié de sa version 8 bits pour une petite perte de qualité : c'est ce qu'installe Twoody, et le bon choix sur la plupart des ordinateurs. Le 8 bits est un peu plus fin et demande deux fois plus de mémoire.

Les tokens par seconde, en pratique

Un token est un morceau de mot : environ trois quarts de mot en anglais, un peu moins en français. Vous lisez en silence à environ 5 tokens par seconde.

moins de 5plus lent que votre lecture
5 à 10à votre vitesse de lecture
10 à 20plus rapide que votre lecture
20 à 50quasi instantané
plus de 50semble instantané

Un modèle qui réfléchit écrit d'abord 300 à 3 000 tokens de raisonnement avant sa réponse : à 10 tokens par seconde, de trente secondes à cinq minutes. Dans Twoody, les réglages Rapide, Réfléchi et Approfondi choisissent combien de temps il réfléchit.

Lire un document

Avant de répondre sur un document, le modèle le lit — et c'est là que les puces récentes gagnent le plus. Qwen3 8B qui lit un document de 20 pages, avec 16 Go :

M13 min
M476 s
M527 s

Mac ou PC ?

Un Mac partage sa mémoire entre le processeur et les graphiques : un Mac de 64 Go fait tourner des modèles qu'aucune carte graphique de 24 Go ne contient. Une carte graphique de PC a moins de mémoire mais la lit très vite : avec un modèle qui tient, une RTX 4090 écrit plus vite que n'importe quel Mac. Twoody tourne aujourd'hui sur Mac ; les versions Windows et Linux sont en préparation.

Le meilleur LLM local, par ordinateur

Méthode et sources

La vitesse de chaque machine est calculée à partir de sa vitesse mesurée sur le modèle de référence de llama.cpp (LLaMA 2 7B, 4 bits), mise à l'échelle de ce que chaque modèle lit par mot, avec les bandes passantes mémoire des fiches techniques d'Apple et de NVIDIA. Vérifiée sur 20 mesures publiées qui n'ont pas servi à la construire : écart médian de 4,5 %, le plus grand de 23 %, toutes dans les fourchettes affichées.

Chiffres revus le 26 septembre 2026.

Sources

Télécharger les données (JSON, CC BY 4.0)

Questions sur les LLM en local

Peut-on faire tourner un LLM local avec 8 Go de mémoire ?

Oui, un petit : Qwen3 4B ou Qwen3.5 4B tournent sur un Mac de 8 Go et suffisent pour les e-mails, les résumés et les questions simples. Fermez les applications lourdes pendant ce temps. Twoody installe Qwen3 4B sur ces Mac.

Quel LLM pour un Mac de 16 Go ?

Un modèle de 7 à 9 milliards de paramètres : Qwen3 8B, Qwen3.5 9B ou Llama 3.1 8B écrivent environ 15 à 25 tokens par seconde sur les Mac récents et répondent bien sur vos documents. Twoody installe Qwen3 8B.

De combien de mémoire un modèle 70B a-t-il besoin ?

Environ 48 Go pour son fichier en 4 bits et une conversation courte : un Mac de 64 Go fait tourner Llama 3.3 70B, à 7 à 13 tokens par seconde selon la puce. Les mélanges d'experts comme gpt-oss-120b demandent plus de mémoire mais écrivent bien plus vite.

Un modèle en 4 bits est-il bien moins bon qu'en 8 bits ?

Un peu. Pour rédiger, résumer et interroger des documents, la différence se remarque à peine, et le 4 bits divise la mémoire par deux et double la vitesse. Ne choisissez le 8 bits que si la mémoire est largement suffisante.

Mac ou carte graphique NVIDIA pour un LLM local ?

Une carte graphique écrit plus vite avec un modèle qui tient dans sa mémoire (8 à 32 Go) ; un Mac contient des modèles bien plus grands dans sa mémoire unifiée (jusqu'à 512 Go). Pour une personne qui travaille sur des documents, un Mac de 16 à 64 Go est le choix le plus simple.

Un LLM local fait-il trop chauffer un MacBook Air ?

Un MacBook Air n'a pas de ventilateur : après quelques minutes d'écriture continue, il ralentit pour rester frais. Pour des réponses de longueur normale, cela ne se remarque pas ; pour de longues sessions, un MacBook Pro ou un Mac mini gardent leur vitesse.

Faut-il LM Studio, Ollama ou MLX ?

Pas avec Twoody : il installe un modèle et le fait tourner avec son propre moteur, llama.cpp, en un clic. Si vous utilisez déjà LM Studio, Ollama ou mlx-lm, Twoody se sert aussi de leurs modèles.

Ces estimations sont-elles fiables ?

Sur 20 mesures publiées qui n'ont pas servi à construire la formule, l'écart médian est de 4,5 % et le plus grand de 23 % ; chacune tombe dans la fourchette affichée. Votre vitesse dépend aussi de l'application, de sa version et de ce que fait l'ordinateur en même temps.

Essayez l'IA locale sur votre Mac, gratuitement.

Version 0.12.1 · macOS 13 ou plus récent · sans compte, sans abonnement. Téléchargez, installez un modèle en un clic, et posez votre première question — même hors ligne.