Twoody

Calculateur de LLM local

Quel LLM local votre ordinateur peut-il faire tourner, et à quelle vitesse ?

Choisissez votre Mac ou votre PC. Voyez quels modèles ouverts tiennent dans sa mémoire, à quelle vitesse ils écrivent, en combien de temps ils lisent un document, et à quoi ils servent.

Quel Mac ai-je ? Menu Pomme › À propos de ce Mac indique la puce et la mémoire. Sur un PC : Gestionnaire des tâches › Performances › GPU.

Les modèles pour cet ordinateur

Sur M3 Max avec 36 Go : 30 modèles sur 36 tournent bien.

Ce que Twoody installe sur ce Mac

Qwen3 14B, en un clic, avec des conversations de 16k tokens.

Tourne confortablement · 21–30 tokens/s (quasi instantané) · 20 pages en 54 s

Télécharger pour Mac Apple Silicon

Tournent bien sur cet ordinateur

GLM-4.7-Flash

Z.ai · MIT

Via LM Studio, Ollama ou mlx-lm

19,2 sur 26 Go

Tourne confortablement

68–97 tokens/s

semble instantané

20 pages en 14 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
Qwen3 30B-A3B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

20,1 sur 26 Go

Tourne confortablement

60–87 tokens/s

semble instantané

20 pages en 15 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
Qwen3-Coder 30B-A3B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

20,1 sur 26 Go

Tourne confortablement

60–87 tokens/s

semble instantané

20 pages en 15 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Qwen3.6 35B-A3B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

22,5 sur 26 Go

Tourne confortablement

49–97 tokens/s

semble instantané

20 pages en 12 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
gpt-oss-20b

OpenAI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

12,7 sur 26 Go

Tourne confortablement

59–85 tokens/s

semble instantané

20 pages en 17 s

  • Discussion et rédaction
  • Vos documents
  • Code
  • Raisonnement
  • Agents
Gemma 4 26B-A4B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

17,7 sur 26 Go

Tourne confortablement

56–81 tokens/s

semble instantané

20 pages en 18 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Mistral Small 3.2 24B

Mistral AI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

17 sur 26 Go

Tourne confortablement

13–19 tokens/s

plus rapide que votre lecture

20 pages en 87 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Devstral Small 2 24B

Mistral AI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

17 sur 26 Go

Tourne confortablement

13–19 tokens/s

plus rapide que votre lecture

20 pages en 87 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Gemma 4 31B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

19,8 sur 26 Go

Tourne confortablement

11–15 tokens/s

plus rapide que votre lecture

20 pages en 2 min

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Agents
Qwen3.8 27B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

17,6 sur 26 Go

Tourne confortablement

8–16 tokens/s

plus rapide que votre lecture

20 pages en 2 min

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
Qwen3 32B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

23,8 sur 26 Go

Tourne confortablement

9,7–14 tokens/s

plus rapide que votre lecture

20 pages en 2 min

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Code
  • Raisonnement
  • Agents
Llama 3.1 8B

Meta · Llama 3.1 Community

Via LM Studio, Ollama ou mlx-lm

7,3 sur 26 Go

Tourne confortablement

36–52 tokens/s

quasi instantané

20 pages en 29 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
Qwen3 8B

Qwen (Alibaba) · Apache 2.0

En un clic dans Twoody

7,7 sur 26 Go

Tourne confortablement

35–51 tokens/s

quasi instantané

20 pages en 30 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Raisonnement
DeepSeek-R1-0528-Qwen3-8B

DeepSeek · MIT

Via LM Studio, Ollama ou mlx-lm

7,7 sur 26 Go

Tourne confortablement

35–51 tokens/s

quasi instantané

20 pages en 30 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Raisonnement
Ministral 3 8B

Mistral AI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

7,7 sur 26 Go

Tourne confortablement

34–49 tokens/s

quasi instantané

20 pages en 32 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
Qwen3.5 9B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

6,6 sur 26 Go

Tourne confortablement

22–45 tokens/s

quasi instantané

20 pages en 36 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Raisonnement
Gemma 4 12B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

8,1 sur 26 Go

Tourne confortablement

26–37 tokens/s

quasi instantané

20 pages en 44 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
Ministral 3 14B

Mistral AI · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

11,1 sur 26 Go

Tourne confortablement

22–32 tokens/s

quasi instantané

20 pages en 50 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
Phi-4 14B

Microsoft · MIT

Via LM Studio, Ollama ou mlx-lm

12,3 sur 26 Go

Tourne confortablement

21–30 tokens/s

quasi instantané

20 pages en 53 s

  • Discussion et rédaction
  • Vos documents
  • Raisonnement
Qwen3 14B

Qwen (Alibaba) · Apache 2.0

En un clic dans Twoody

11,8 sur 26 Go

Tourne confortablement

21–30 tokens/s

quasi instantané

20 pages en 54 s

  • Discussion et rédaction
  • Vos documents
  • Traduction
  • Raisonnement
Llama 3.2 3B

Meta · Llama 3.2 Community

Via LM Studio, Ollama ou mlx-lm

4,2 sur 26 Go

Tourne confortablement

78–112 tokens/s

semble instantané

20 pages en 12 s

  • Discussion et rédaction
  • Traduction
Phi-4-mini

Microsoft · MIT

Via LM Studio, Ollama ou mlx-lm

4,9 sur 26 Go

Tourne confortablement

64–92 tokens/s

semble instantané

20 pages en 14 s

  • Discussion et rédaction
Qwen3 4B

Qwen (Alibaba) · Apache 2.0

En un clic dans Twoody

5,2 sur 26 Go

Tourne confortablement

62–90 tokens/s

semble instantané

20 pages en 15 s

  • Discussion et rédaction
  • Traduction
Gemma 4 E4B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

5,9 sur 26 Go

Tourne confortablement

58–83 tokens/s

semble instantané

20 pages en 16 s

  • Discussion et rédaction
  • Traduction
Qwen3.5 4B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

3,7 sur 26 Go

Tourne confortablement

42–85 tokens/s

semble instantané

20 pages en 17 s

  • Discussion et rédaction
  • Traduction
Qwen3 0.6B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

2,6 sur 26 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 2 s

Qwen3 1.7B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

3,3 sur 26 Go

Tourne confortablement

75–224 tokens/s

semble instantané

20 pages en 6 s

Qwen3.5 2B

Qwen (Alibaba) · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

1,9 sur 26 Go

Tourne confortablement

83–165 tokens/s

semble instantané

20 pages en 7 s

Gemma 4 E2B

Google · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

3,8 sur 26 Go

Tourne confortablement

100+ tokens/s

semble instantané

20 pages en 8 s

MiniCPM5 2B

OpenBMB · Apache 2.0

Via LM Studio, Ollama ou mlx-lm

2,7 sur 26 Go

Tourne confortablement

88–126 tokens/s

semble instantané

20 pages en 9 s

Trop gros pour cet ordinateur (6)
  • Llama 3.3 70B · 47,1 sur 26 Go
  • Qwen3-Next 80B-A3B · 48,3 sur 26 Go
  • gpt-oss-120b · 63,1 sur 26 Go
  • Mistral Small 4 119B · 71,1 sur 26 Go
  • Qwen3.5 122B-A10B · 75,7 sur 26 Go
  • Qwen3 235B-A22B · 142,4 sur 26 Go

Des estimations, pas des mesures, calculées à partir des benchmarks publics de llama.cpp. Chiffres revus le 26 septembre 2026.

De combien de mémoire a-t-on besoin pour un LLM local ?

La mémoire décide des modèles qui tiennent : le fichier du modèle, plus la conversation qu'il garde en tête. Un Mac laisse ses graphiques utiliser environ les deux tiers de sa mémoire jusqu'à 32 Go, les trois quarts au-delà. En 4 bits, ce qui tourne confortablement :

MémoireRecommandé — tourne confortablement
8 GoLlama 3.2 3B, Phi-4-mini, Qwen3.5 4B
16 GoLlama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B
24 Gogpt-oss-20b, Llama 3.1 8B, Qwen3 8B
32 GoGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
48 GoGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
64 GoLlama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B
128 GoQwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B
256 GoQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B
512 GoQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B

Pourquoi la bande passante mémoire fait la vitesse

Pour écrire chaque mot, l'ordinateur relit en mémoire les poids actifs du modèle. La vitesse suit donc la bande passante mémoire plus que la puissance du processeur. Qwen3 8B, en 4 bits, sur quelques machines :

Ordinateur Bande passante mémoire Écrit
M1 68 Go/s 8,7–12 tokens/s
M2 100 Go/s 13–19 tokens/s
M4 120 Go/s 15–21 tokens/s
M5 153 Go/s 19–27 tokens/s
M4 Pro 273 Go/s 31–45 tokens/s
M4 Max 546 Go/s 53–76 tokens/s
M5 Max 614 Go/s 72–104 tokens/s
GeForce RTX 4090 (24 GB) 1 008 Go/s 100+ tokens/s

4 bits ou 8 bits ?

Les modèles sont diffusés compressés. En 4 bits (Q4_K_M, ou MXFP4 pour gpt-oss), un fichier fait la moitié de sa version 8 bits pour une petite perte de qualité : c'est ce qu'installe Twoody, et le bon choix sur la plupart des ordinateurs. Le 8 bits est un peu plus fin et demande deux fois plus de mémoire.

Les tokens par seconde, en pratique

Un token est un morceau de mot : environ trois quarts de mot en anglais, un peu moins en français. Vous lisez en silence à environ 5 tokens par seconde.

moins de 5plus lent que votre lecture
5 à 10à votre vitesse de lecture
10 à 20plus rapide que votre lecture
20 à 50quasi instantané
plus de 50semble instantané

Un modèle qui réfléchit écrit d'abord 300 à 3 000 tokens de raisonnement avant sa réponse : à 10 tokens par seconde, de trente secondes à cinq minutes. Dans Twoody, les réglages Rapide, Réfléchi et Approfondi choisissent combien de temps il réfléchit.

Lire un document

Avant de répondre sur un document, le modèle le lit — et c'est là que les puces récentes gagnent le plus. Qwen3 8B qui lit un document de 20 pages, avec 16 Go :

M13 min
M476 s
M527 s

Mac ou PC ?

Un Mac partage sa mémoire entre le processeur et les graphiques : un Mac de 64 Go fait tourner des modèles qu'aucune carte graphique de 24 Go ne contient. Une carte graphique de PC a moins de mémoire mais la lit très vite : avec un modèle qui tient, une RTX 4090 écrit plus vite que n'importe quel Mac. Twoody tourne aujourd'hui sur Mac ; les versions Windows et Linux sont en préparation.

Le meilleur LLM local, par ordinateur

Méthode et sources

La vitesse de chaque machine est calculée à partir de sa vitesse mesurée sur le modèle de référence de llama.cpp (LLaMA 2 7B, 4 bits), mise à l'échelle de ce que chaque modèle lit par mot, avec les bandes passantes mémoire des fiches techniques d'Apple et de NVIDIA. Vérifiée sur 20 mesures publiées qui n'ont pas servi à la construire : écart médian de 4,5 %, le plus grand de 23 %, toutes dans les fourchettes affichées.

Chiffres revus le 26 septembre 2026.

Sources

Télécharger les données (JSON, CC BY 4.0)

Questions sur les LLM en local

Peut-on faire tourner un LLM local avec 8 Go de mémoire ?

Oui, un petit : Qwen3 4B ou Qwen3.5 4B tournent sur un Mac de 8 Go et suffisent pour les e-mails, les résumés et les questions simples. Fermez les applications lourdes pendant ce temps. Twoody installe Qwen3 4B sur ces Mac.

Quel LLM pour un Mac de 16 Go ?

Un modèle de 7 à 9 milliards de paramètres : Qwen3 8B, Qwen3.5 9B ou Llama 3.1 8B écrivent environ 15 à 25 tokens par seconde sur les Mac récents et répondent bien sur vos documents. Twoody installe Qwen3 8B.

De combien de mémoire un modèle 70B a-t-il besoin ?

Environ 48 Go pour son fichier en 4 bits et une conversation courte : un Mac de 64 Go fait tourner Llama 3.3 70B, à 7 à 13 tokens par seconde selon la puce. Les mélanges d'experts comme gpt-oss-120b demandent plus de mémoire mais écrivent bien plus vite.

Un modèle en 4 bits est-il bien moins bon qu'en 8 bits ?

Un peu. Pour rédiger, résumer et interroger des documents, la différence se remarque à peine, et le 4 bits divise la mémoire par deux et double la vitesse. Ne choisissez le 8 bits que si la mémoire est largement suffisante.

Mac ou carte graphique NVIDIA pour un LLM local ?

Une carte graphique écrit plus vite avec un modèle qui tient dans sa mémoire (8 à 32 Go) ; un Mac contient des modèles bien plus grands dans sa mémoire unifiée (jusqu'à 512 Go). Pour une personne qui travaille sur des documents, un Mac de 16 à 64 Go est le choix le plus simple.

Un LLM local fait-il trop chauffer un MacBook Air ?

Un MacBook Air n'a pas de ventilateur : après quelques minutes d'écriture continue, il ralentit pour rester frais. Pour des réponses de longueur normale, cela ne se remarque pas ; pour de longues sessions, un MacBook Pro ou un Mac mini gardent leur vitesse.

Faut-il LM Studio, Ollama ou MLX ?

Pas avec Twoody : il installe un modèle et le fait tourner avec son propre moteur, llama.cpp, en un clic. Si vous utilisez déjà LM Studio, Ollama ou mlx-lm, Twoody se sert aussi de leurs modèles.

Ces estimations sont-elles fiables ?

Sur 20 mesures publiées qui n'ont pas servi à construire la formule, l'écart médian est de 4,5 % et le plus grand de 23 % ; chacune tombe dans la fourchette affichée. Votre vitesse dépend aussi de l'application, de sa version et de ce que fait l'ordinateur en même temps.

Essayez l'IA locale sur votre Mac, gratuitement.

Version 0.12.1 · macOS 13 ou plus récent · sans compte, sans abonnement. Téléchargez, installez un modèle en un clic, et posez votre première question — même hors ligne.