Twoody

Calculateur de LLM local

Quel LLM local votre ordinateur peut-il faire tourner, et à quelle vitesse ?

Choisissez votre Mac ou votre PC. Voyez quels modèles ouverts tiennent dans sa mémoire, à quelle vitesse ils écrivent, en combien de temps ils lisent un document, et à quoi ils servent.

Quel Mac ai-je ? Menu Pomme › À propos de ce Mac indique la puce et la mémoire. Sur un PC : Gestionnaire des tâches › Performances › GPU.

Les modèles pour cet ordinateur

Sur M4 Pro avec 64 Go : 31 modèles sur 36 tournent bien.

Ce que Twoody installe sur ce Mac

Qwen3 14B, en un clic, avec des conversations de 16k tokens.

Tourne confortablement · 18–27 tokens/s (quasi instantané) · 20 pages en 84 s

Télécharger pour Mac Apple Silicon

Tournent bien sur cet ordinateur

Llama 3.3 70B

Meta · Llama 3.3 Community

Via LM Studio, Ollama ou mlx-lm

47,1 sur 47 Go

Tourne — fermez les autres apps

4,2–6 tokens/s

à votre vitesse de lecture

20 pages en 7 min

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
GLM-4.7-Flash

Z.ai · MIT

Via LM Studio, Ollama ou mlx-lm

19,2 sur 47 Go

Tourne confortablement

56–81 tokens/s

semble instantané

20 pages en 22 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
gpt-oss-20b

OpenAI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

12,7 sur 47 Go

Tourne confortablement

52–74 tokens/s

semble instantané

20 pages en 26 s

  • Discussion et rédaction
  • Vos documents
  • Code
  • Raisonnement
  • Agents
Qwen3 30B-A3B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

20,1 sur 47 Go

Tourne confortablement

51–73 tokens/s

semble instantané

20 pages en 24 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
Qwen3-Coder 30B-A3B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

20,1 sur 47 Go

Tourne confortablement

51–73 tokens/s

semble instantané

20 pages en 24 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Qwen3.6 35B-A3B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

22,5 sur 47 Go

Tourne confortablement

41–82 tokens/s

semble instantané

20 pages en 19 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
Gemma 4 26B-A4B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

17,7 sur 47 Go

Tourne confortablement

49–70 tokens/s

semble instantané

20 pages en 29 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Mistral Small 3.2 24B

Mistral AI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

17 sur 47 Go

Tourne confortablement

12–17 tokens/s

plus rapide que votre lecture

20 pages en 2 min

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Devstral Small 2 24B

Mistral AI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

17 sur 47 Go

Tourne confortablement

12–17 tokens/s

plus rapide que votre lecture

20 pages en 2 min

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Gemma 4 31B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

19,8 sur 47 Go

Tourne confortablement

9,4–14 tokens/s

plus rapide que votre lecture

20 pages en 3 min

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Qwen3.8 27B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

17,6 sur 47 Go

Tourne confortablement

7,1–14 tokens/s

plus rapide que votre lecture

20 pages en 3 min

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
Qwen3 32B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

23,8 sur 47 Go

Tourne confortablement

8,7–12 tokens/s

plus rapide que votre lecture

20 pages en 3 min

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
Llama 3.1 8B

Meta · Llama 3.1 Community

Via LM Studio, Ollama ou mlx-lm

7,3 sur 47 Go

Tourne confortablement

32–46 tokens/s

quasi instantané

20 pages en 45 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
Qwen3 8B

Qwen (Alibaba) · Apache 2.0

En un clic dans Twoody

7,7 sur 47 Go

Tourne confortablement

31–45 tokens/s

quasi instantané

20 pages en 46 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Raisonnement
DeepSeek-R1-0528-Qwen3-8B

DeepSeek · MIT

Via LM Studio, Ollama ou mlx-lm

7,7 sur 47 Go

Tourne confortablement

31–45 tokens/s

quasi instantané

20 pages en 46 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Raisonnement
Ministral 3 8B

Mistral AI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

7,7 sur 47 Go

Tourne confortablement

30–44 tokens/s

quasi instantané

20 pages en 50 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
Qwen3.5 9B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

6,6 sur 47 Go

Tourne confortablement

20–40 tokens/s

quasi instantané

20 pages en 56 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Raisonnement
Gemma 4 12B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

8,1 sur 47 Go

Tourne confortablement

23–33 tokens/s

quasi instantané

20 pages en 68 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
Ministral 3 14B

Mistral AI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

11,1 sur 47 Go

Tourne confortablement

20–29 tokens/s

quasi instantané

20 pages en 79 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
Phi-4 14B

Microsoft · MIT

Via LM Studio, Ollama ou mlx-lm

12,3 sur 47 Go

Tourne confortablement

19–27 tokens/s

quasi instantané

20 pages en 83 s

  • Discussion et rédaction
  • Vos documents
  • Raisonnement
Qwen3 14B

Qwen (Alibaba) · Apache 2.0

En un clic dans Twoody

11,8 sur 47 Go

Tourne confortablement

18–27 tokens/s

quasi instantané

20 pages en 84 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Raisonnement
Llama 3.2 3B

Meta · Llama 3.2 Community

Via LM Studio, Ollama ou mlx-lm

4,2 sur 47 Go

Tourne confortablement

67–97 tokens/s

semble instantané

20 pages en 18 s

  • Discussion et rédaction
  • Traduction
Phi-4-mini

Microsoft · MIT

Via LM Studio, Ollama ou mlx-lm

4,9 sur 47 Go

Tourne confortablement

56–80 tokens/s

semble instantané

20 pages en 21 s

  • Discussion et rédaction
Qwen3 4B

Qwen (Alibaba) · Apache 2.0

En un clic dans Twoody

5,2 sur 47 Go

Tourne confortablement

54–77 tokens/s

semble instantané

20 pages en 23 s

  • Discussion et rédaction
  • Traduction
Gemma 4 E4B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

5,9 sur 47 Go

Tourne confortablement

49–71 tokens/s

semble instantané

20 pages en 25 s

  • Discussion et rédaction
  • Traduction
Qwen3.5 4B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

3,7 sur 47 Go

Tourne confortablement

37–73 tokens/s

semble instantané

20 pages en 27 s

  • Discussion et rédaction
  • Traduction
Qwen3 0.6B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

2,6 sur 47 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 3 s

Qwen3 1.7B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

3,3 sur 47 Go

Tourne confortablement

63–188 tokens/s

semble instantané

20 pages en 10 s

Qwen3.5 2B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

1,9 sur 47 Go

Tourne confortablement

70–140 tokens/s

semble instantané

20 pages en 12 s

Gemma 4 E2B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

3,8 sur 47 Go

Tourne confortablement

85–122 tokens/s

semble instantané

20 pages en 13 s

MiniCPM5 2B

OpenBMB · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

2,7 sur 47 Go

Tourne confortablement

73–105 tokens/s

semble instantané

20 pages en 14 s

Tournent, mais bien plus lentement (1)
Qwen3-Next 80B-A3B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

48,3 sur 47 Go

En partie sur le processeur : bien plus lent

16–31 tokens/s

quasi instantané

20 pages en 49 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
Trop gros pour cet ordinateur (4)
  • gpt-oss-120b · 63,1 sur 47 Go
  • Mistral Small 4 119B · 71,1 sur 47 Go
  • Qwen3.5 122B-A10B · 75,7 sur 47 Go
  • Qwen3 235B-A22B · 142,4 sur 47 Go

Des estimations, pas des mesures, calculées à partir des benchmarks publics de llama.cpp. Chiffres revus le 26 septembre 2026.

De combien de mémoire a-t-on besoin pour un LLM local ?

La mémoire décide des modèles qui tiennent : le fichier du modèle, plus la conversation qu'il garde en tête. Un Mac laisse ses graphiques utiliser environ les deux tiers de sa mémoire jusqu'à 32 Go, les trois quarts au-delà. En 4 bits, ce qui tourne confortablement :

MémoireRecommandé — tourne confortablement
8 GoLlama 3.2 3B, Phi-4-mini, Qwen3.5 4B
16 GoLlama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B
24 Gogpt-oss-20b, Llama 3.1 8B, Qwen3 8B
32 GoGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
48 GoGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
64 GoLlama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B
128 GoQwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B
256 GoQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B
512 GoQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B

Pourquoi la bande passante mémoire fait la vitesse

Pour écrire chaque mot, l'ordinateur relit en mémoire les poids actifs du modèle. La vitesse suit donc la bande passante mémoire plus que la puissance du processeur. Qwen3 8B, en 4 bits, sur quelques machines :

Ordinateur Bande passante mémoire Écrit
M1 68 Go/s 8,7–12 tokens/s
M2 100 Go/s 13–19 tokens/s
M4 120 Go/s 15–21 tokens/s
M5 153 Go/s 19–27 tokens/s
M4 Pro 273 Go/s 31–45 tokens/s
M4 Max 546 Go/s 53–76 tokens/s
M5 Max 614 Go/s 72–104 tokens/s
GeForce RTX 4090 (24 GB) 1 008 Go/s 100+ tokens/s

4 bits ou 8 bits ?

Les modèles sont diffusés compressés. En 4 bits (Q4_K_M, ou MXFP4 pour gpt-oss), un fichier fait la moitié de sa version 8 bits pour une petite perte de qualité : c'est ce qu'installe Twoody, et le bon choix sur la plupart des ordinateurs. Le 8 bits est un peu plus fin et demande deux fois plus de mémoire.

Les tokens par seconde, en pratique

Un token est un morceau de mot : environ trois quarts de mot en anglais, un peu moins en français. Vous lisez en silence à environ 5 tokens par seconde.

moins de 5plus lent que votre lecture
5 à 10à votre vitesse de lecture
10 à 20plus rapide que votre lecture
20 à 50quasi instantané
plus de 50semble instantané

Un modèle qui réfléchit écrit d'abord 300 à 3 000 tokens de raisonnement avant sa réponse : à 10 tokens par seconde, de trente secondes à cinq minutes. Dans Twoody, les réglages Rapide, Réfléchi et Approfondi choisissent combien de temps il réfléchit.

Lire un document

Avant de répondre sur un document, le modèle le lit — et c'est là que les puces récentes gagnent le plus. Qwen3 8B qui lit un document de 20 pages, avec 16 Go :

M13 min
M476 s
M527 s

Mac ou PC ?

Un Mac partage sa mémoire entre le processeur et les graphiques : un Mac de 64 Go fait tourner des modèles qu'aucune carte graphique de 24 Go ne contient. Une carte graphique de PC a moins de mémoire mais la lit très vite : avec un modèle qui tient, une RTX 4090 écrit plus vite que n'importe quel Mac. Twoody tourne aujourd'hui sur Mac ; les versions Windows et Linux sont en préparation.

Le meilleur LLM local, par ordinateur

Méthode et sources

La vitesse de chaque machine est calculée à partir de sa vitesse mesurée sur le modèle de référence de llama.cpp (LLaMA 2 7B, 4 bits), mise à l'échelle de ce que chaque modèle lit par mot, avec les bandes passantes mémoire des fiches techniques d'Apple et de NVIDIA. Vérifiée sur 20 mesures publiées qui n'ont pas servi à la construire : écart médian de 4,5 %, le plus grand de 23 %, toutes dans les fourchettes affichées.

Chiffres revus le 26 septembre 2026.

Sources

Télécharger les données (JSON, CC BY 4.0)

Questions sur les LLM en local

Peut-on faire tourner un LLM local avec 8 Go de mémoire ?

Oui, un petit : Qwen3 4B ou Qwen3.5 4B tournent sur un Mac de 8 Go et suffisent pour les e-mails, les résumés et les questions simples. Fermez les applications lourdes pendant ce temps. Twoody installe Qwen3 4B sur ces Mac.

Quel LLM pour un Mac de 16 Go ?

Un modèle de 7 à 9 milliards de paramètres : Qwen3 8B, Qwen3.5 9B ou Llama 3.1 8B écrivent environ 15 à 25 tokens par seconde sur les Mac récents et répondent bien sur vos documents. Twoody installe Qwen3 8B.

De combien de mémoire un modèle 70B a-t-il besoin ?

Environ 48 Go pour son fichier en 4 bits et une conversation courte : un Mac de 64 Go fait tourner Llama 3.3 70B, à 7 à 13 tokens par seconde selon la puce. Les mélanges d'experts comme gpt-oss-120b demandent plus de mémoire mais écrivent bien plus vite.

Un modèle en 4 bits est-il bien moins bon qu'en 8 bits ?

Un peu. Pour rédiger, résumer et interroger des documents, la différence se remarque à peine, et le 4 bits divise la mémoire par deux et double la vitesse. Ne choisissez le 8 bits que si la mémoire est largement suffisante.

Mac ou carte graphique NVIDIA pour un LLM local ?

Une carte graphique écrit plus vite avec un modèle qui tient dans sa mémoire (8 à 32 Go) ; un Mac contient des modèles bien plus grands dans sa mémoire unifiée (jusqu'à 512 Go). Pour une personne qui travaille sur des documents, un Mac de 16 à 64 Go est le choix le plus simple.

Un LLM local fait-il trop chauffer un MacBook Air ?

Un MacBook Air n'a pas de ventilateur : après quelques minutes d'écriture continue, il ralentit pour rester frais. Pour des réponses de longueur normale, cela ne se remarque pas ; pour de longues sessions, un MacBook Pro ou un Mac mini gardent leur vitesse.

Faut-il LM Studio, Ollama ou MLX ?

Pas avec Twoody : il installe un modèle et le fait tourner avec son propre moteur, llama.cpp, en un clic. Si vous utilisez déjà LM Studio, Ollama ou mlx-lm, Twoody se sert aussi de leurs modèles.

Ces estimations sont-elles fiables ?

Sur 20 mesures publiées qui n'ont pas servi à construire la formule, l'écart médian est de 4,5 % et le plus grand de 23 % ; chacune tombe dans la fourchette affichée. Votre vitesse dépend aussi de l'application, de sa version et de ce que fait l'ordinateur en même temps.

Essayez l'IA locale sur votre Mac, gratuitement.

Version 0.12.1 · macOS 13 ou plus récent · sans compte, sans abonnement. Téléchargez, installez un modèle en un clic, et posez votre première question — même hors ligne.