Quel modèle tient dans combien de mémoire ?
Les 24 modèles de notre sélection, avec ce qu'ils demandent réellement — poids et cache KV compris. La pastille indique si le modèle passe sur GeForce RTX 5060 Ti 16 Go, la carte 16 Go que nous prenons comme repère.
Modèles de langage21
Mémoire requise à la quantification recommandée, avec 8k de contexte. Le filtre « tient dans » répond directement à la question qui compte : ce que votre carte encaisse.
21 modèles sur 21
Meta
Llama 3.2 (3B)
Le petit modèle qui tourne partout, y compris sur une carte de 6 Go ou un portable sans GPU dédié.
Meta
Llama 3.1 (8B)
Le point d'entrée sérieux de l'IA locale : généraliste, rapide, et il tient sur une carte de 8 Go.
Meta
Llama 3.3 (70B)
Le palier où le local commence à rivaliser avec les API. Demande 44 Go en Q4 avec 8k de contexte : aucune carte grand public seule n'y arrive, il faut du multi-GPU ou un Mac généreux.
Alibaba
Qwen2.5 (7B)
Très bon en multilingue et en code pour sa taille. Son cache KV est deux fois plus léger que celui d'un Llama 8B.
Alibaba
Qwen2.5 (14B)
Nettement plus fin qu'un 8B sans exiger de matériel exotique : il passe déjà sur une carte de 12 Go, et respire sur 16.
Alibaba
Qwen2.5 (32B)
Le palier 24 Go. Une 3090 ou une 4090 d'occasion le fait tourner confortablement en Q4.
Alibaba
Qwen3 (8B)
Génération suivante des Qwen, avec un mode raisonnement activable. Même gabarit qu'un Llama 8B.
Alibaba
Qwen3 30B-A3B (MoE)
Mélange d'experts : il occupe la mémoire d'un 30B mais génère à la vitesse d'un 3B. Le cas où la capacité et la bande passante ne racontent pas la même histoire.
Alibaba
Qwen3 (32B)
Géométrie d'attention identique au Qwen2.5 32B, donc même budget : 21,9 Go en Q4 à 8k, soit une carte de 24 Go. C'est le Qwen3 dense, à opposer au 30B-A3B qui occupe presque autant de mémoire mais génère bien plus vite.
Mistral AI
Mistral 7B (v0.3)
Le classique français. Léger, rapide, et toujours une bonne base pour du francophone.
Mistral AI
Mistral Small 3 (24B)
Il joue dans la cour des gros modèles. En Q4 il tient sur une carte de 16 Go, mais tout juste : dès 16k de contexte, il déborde. Le vrai confort, c'est 24 Go.
Gemma 2 (9B)
Excellent en rédaction, mais sa dimension de tête de 256 lui donne un cache KV deux fois plus lourd qu'un Llama 8B, malgré son attention à fenêtre glissante : il ne rentre pas sur une carte de 8 Go, là où un Llama 8B passe.
Gemma 3 (4B)
3,9 Go en Q4 à 8k, et encore 7,8 Go en poussant le contexte à 128k : il tient dans une carte de 8 Go quoi qu'on lui demande. Il lit aussi les images.
Gemma 3 (12B)
9,0 Go en Q4 à 8k : une carte de 8 Go ne suffit plus, une 12 Go le prend à l'aise. Sa fenêtre glissante lui permet d'aller jusqu'à 128k pour 17,7 Go, quand le Gemma 2 9B, plus petit, en réclamait déjà 29,3.
Gemma 3 (27B)
17,9 Go en Q4 à 8k : la carte de 16 Go déborde, il faut 24 Go. Le plus gros Gemma qui tienne encore sur une seule carte grand public.
DeepSeek
DeepSeek-R1 Distill Qwen (7B)
Raisonnement pas à pas dans un format léger. Attention : il produit de longues chaînes de réflexion, donc prévoyez du contexte.
DeepSeek
DeepSeek-R1 Distill Llama (8B)
La version R1 sur base Llama. Même empreinte mémoire qu'un Llama 3.1 8B classique.
DeepSeek
DeepSeek-R1 Distill Qwen (32B)
Le meilleur raisonneur qu'on puisse faire tenir sur une seule carte de 24 Go.
OpenAI
gpt-oss 20B (MoE)
21 milliards de paramètres pour 3,6 actifs : il occupe 13,3 Go à 8k et génère à la vitesse d'un petit modèle. Son cache KV ne pèse que 0,19 Go, si bien que passer à 128k de contexte ne lui coûte que 4 Go de plus. Ses poids sont publiés directement en MXFP4, un format 4 bits.
Ornith AI
Ornith-1.5 35B-A3B (MoE)
Mélange d'experts de 35,9 milliards de paramètres dont 3 seulement sont actifs par token : 22,3 Go en Q4, et 129 tokens par seconde sur un Mac Mini M5 Pro. La qualité d'un gros modèle à la vitesse d'un petit, exactement ce qui reste faisable en local.
Microsoft
Phi-4 (14B)
Dix têtes KV et aucune fenêtre glissante : son cache pèse 1,56 Go à 8k, près du double d'un Gemma 3 12B à peine plus petit. 11,1 Go au total, à la limite d'une carte de 12 Go, et un contexte plafonné à 16k.
Génération d'images3
Ces modèles ne se calculent pas comme les modèles de langage : leur consommation dépend du pipeline. Ils sont traités ensemble sur une page dédiée, avec les paliers constatés pour chacun.
Black Forest Labs
Flux.1 Schnell
Génération en 1 à 4 étapes : rapide, et licence permissive. Le modèle d'image le plus adapté au local aujourd'hui.
Black Forest Labs
Flux.1 Dev
Meilleur rendu que Schnell, plus lent, et licence non commerciale. À vérifier avant tout usage pro.
Stability AI
Stable Diffusion XL
Le cheval de bataille : écosystème de LoRA et de ControlNet incomparable, et une exigence matérielle modeste.
Vous avez déjà une carte, ou vous hésitez entre deux ? Prenez la question dans l'autre sens.
Voir par machine