Ce que votre machine fait vraiment tourner : IA locale et jeu vidéo, chiffres à l'appui.

Quel modèle tient dans combien de mémoire ?

Les 24 modèles de notre sélection, avec ce qu'ils demandent réellement — poids et cache KV compris. La pastille indique si le modèle passe sur GeForce RTX 5060 Ti 16 Go, la carte 16 Go que nous prenons comme repère.

Modèles de langage21

Mémoire requise à la quantification recommandée, avec 8k de contexte. Le filtre « tient dans » répond directement à la question qui compte : ce que votre carte encaisse.

Tient dans
Taille du modèle
Éditeur

21 modèles sur 21

Meta

Llama 3.2 (3B)

Recommandé

Le petit modèle qui tourne partout, y compris sur une carte de 6 Go ou un portable sans GPU dédié.

3,9 Goen Q4_K_M

Meta

Llama 3.1 (8B)

Recommandé

Le point d'entrée sérieux de l'IA locale : généraliste, rapide, et il tient sur une carte de 8 Go.

6,8 Goen Q4_K_M

Meta

Llama 3.3 (70B)

Insuffisant

Le palier où le local commence à rivaliser avec les API. Demande 44 Go en Q4 avec 8k de contexte : aucune carte grand public seule n'y arrive, il faut du multi-GPU ou un Mac généreux.

44,0 Goen Q4_K_M

Alibaba

Qwen2.5 (7B)

Recommandé

Très bon en multilingue et en code pour sa taille. Son cache KV est deux fois plus léger que celui d'un Llama 8B.

6,0 Goen Q4_K_M

Alibaba

Qwen2.5 (14B)

Recommandé

Nettement plus fin qu'un 8B sans exiger de matériel exotique : il passe déjà sur une carte de 12 Go, et respire sur 16.

11,1 Goen Q4_K_M

Alibaba

Qwen2.5 (32B)

Insuffisant

Le palier 24 Go. Une 3090 ou une 4090 d'occasion le fait tourner confortablement en Q4.

21,9 Goen Q4_K_M

Alibaba

Qwen3 (8B)

Recommandé

Génération suivante des Qwen, avec un mode raisonnement activable. Même gabarit qu'un Llama 8B.

7,0 Goen Q4_K_M

Alibaba

Qwen3 30B-A3B (MoE)

Insuffisant

Mélange d'experts : il occupe la mémoire d'un 30B mais génère à la vitesse d'un 3B. Le cas où la capacité et la bande passante ne racontent pas la même histoire.

19,3 Goen Q4_K_M

Alibaba

Qwen3 (32B)

Insuffisant

Géométrie d'attention identique au Qwen2.5 32B, donc même budget : 21,9 Go en Q4 à 8k, soit une carte de 24 Go. C'est le Qwen3 dense, à opposer au 30B-A3B qui occupe presque autant de mémoire mais génère bien plus vite.

21,9 Goen Q4_K_M

Mistral AI

Mistral 7B (v0.3)

Recommandé

Le classique français. Léger, rapide, et toujours une bonne base pour du francophone.

6,3 Goen Q4_K_M

Mistral AI

Mistral Small 3 (24B)

Limite

Il joue dans la cour des gros modèles. En Q4 il tient sur une carte de 16 Go, mais tout juste : dès 16k de contexte, il déborde. Le vrai confort, c'est 24 Go.

15,9 Goen Q4_K_M

Google

Gemma 2 (9B)

Recommandé

Excellent en rédaction, mais sa dimension de tête de 256 lui donne un cache KV deux fois plus lourd qu'un Llama 8B, malgré son attention à fenêtre glissante : il ne rentre pas sur une carte de 8 Go, là où un Llama 8B passe.

8,4 Goen Q4_K_M

Google

Gemma 3 (4B)

Recommandé

3,9 Go en Q4 à 8k, et encore 7,8 Go en poussant le contexte à 128k : il tient dans une carte de 8 Go quoi qu'on lui demande. Il lit aussi les images.

3,9 Goen Q4_K_M

Google

Gemma 3 (12B)

Recommandé

9,0 Go en Q4 à 8k : une carte de 8 Go ne suffit plus, une 12 Go le prend à l'aise. Sa fenêtre glissante lui permet d'aller jusqu'à 128k pour 17,7 Go, quand le Gemma 2 9B, plus petit, en réclamait déjà 29,3.

9,0 Goen Q4_K_M

Google

Gemma 3 (27B)

Insuffisant

17,9 Go en Q4 à 8k : la carte de 16 Go déborde, il faut 24 Go. Le plus gros Gemma qui tienne encore sur une seule carte grand public.

17,9 Goen Q4_K_M

DeepSeek

DeepSeek-R1 Distill Qwen (7B)

Recommandé

Raisonnement pas à pas dans un format léger. Attention : il produit de longues chaînes de réflexion, donc prévoyez du contexte.

6,0 Goen Q4_K_M

DeepSeek

DeepSeek-R1 Distill Llama (8B)

Recommandé

La version R1 sur base Llama. Même empreinte mémoire qu'un Llama 3.1 8B classique.

6,8 Goen Q4_K_M

DeepSeek

DeepSeek-R1 Distill Qwen (32B)

Insuffisant

Le meilleur raisonneur qu'on puisse faire tenir sur une seule carte de 24 Go.

21,9 Goen Q4_K_M

OpenAI

gpt-oss 20B (MoE)

Recommandé

21 milliards de paramètres pour 3,6 actifs : il occupe 13,3 Go à 8k et génère à la vitesse d'un petit modèle. Son cache KV ne pèse que 0,19 Go, si bien que passer à 128k de contexte ne lui coûte que 4 Go de plus. Ses poids sont publiés directement en MXFP4, un format 4 bits.

13,3 Goen Q4_K_M

Ornith AI

Ornith-1.5 35B-A3B (MoE)

Insuffisant

Mélange d'experts de 35,9 milliards de paramètres dont 3 seulement sont actifs par token : 22,3 Go en Q4, et 129 tokens par seconde sur un Mac Mini M5 Pro. La qualité d'un gros modèle à la vitesse d'un petit, exactement ce qui reste faisable en local.

22,3 Goen Q4_K_M

Microsoft

Phi-4 (14B)

Recommandé

Dix têtes KV et aucune fenêtre glissante : son cache pèse 1,56 Go à 8k, près du double d'un Gemma 3 12B à peine plus petit. 11,1 Go au total, à la limite d'une carte de 12 Go, et un contexte plafonné à 16k.

11,1 Goen Q4_K_M

Génération d'images3

Ces modèles ne se calculent pas comme les modèles de langage : leur consommation dépend du pipeline. Ils sont traités ensemble sur une page dédiée, avec les paliers constatés pour chacun.

Vous avez déjà une carte, ou vous hésitez entre deux ? Prenez la question dans l'autre sens.

Voir par machine