Comprendre
6 min de lecture
Q4, Q5, Q8 : que perdez-vous ?
Un Q4_K_M ne pèse pas quatre bits par poids, mais 4,9. Ce que chaque palier coûte en mémoire, ce qu'il coûte en qualité, et lequel choisir selon votre carte.
Par la rédaction de LeBonPC · Publié le 8 septembre 2026
Sommaire
- 01Un Q4_K_M ne pèse pas quatre bits par poids
- 02Ce que ça change sur une machine réelle
- 03Laquelle prendre
- 04Le cache KV se quantifie aussi, et tout le monde l'oublie
- 05Un gros modèle très quantifié bat souvent un petit modèle intact
- 06Lire les noms de fichiers sans se tromper
- 07Pourquoi le FP16 ne sert presque à rien chez soi
- 08En résumé
La quantification divise le poids d'un modèle par trois environ, pour une perte que vous ne verrez pas en Q8, à peine en Q5 et rarement en Q4. Mais la vraie question n'est pas la qualité : c'est le palier de carte. C'est la quantification qui décide si un modèle tient sur 16 Go ou en réclame 24.
Un Q4_K_M ne pèse pas quatre bits par poids
Le nom le laisse croire, et c'est la source d'erreur la plus fréquente dans les estimations qu'on lit ailleurs. Les schémas en « _K » stockent les tenseurs à des précisions mélangées : les couches sensibles gardent plus de bits que les autres. Un Q4_K_M pèse en réalité environ 4,9 bits par poids, soit 22 % de plus que sa valeur nominale.
Sur un modèle de 32 milliards de paramètres, cette différence représente près de 4 Go — exactement de quoi faire basculer une recommandation de carte. Notre calculateur travaille sur les valeurs observées, pas sur les valeurs nominales.
| Quantification | Bits par poids | Ce que ça coûte |
|---|---|---|
| FP16 | 16 | Aucune perte, et deux fois le poids du Q8 pour rien |
| Q8_0 | 8,5 | Indiscernable du FP16 en pratique |
| Q6_K | 6,6 | Perte négligeable |
| Q5_K_M | 5,7 | Perte très légère |
| Q4_K_M | 4,9 | Le standard : perte faible, poids divisé par plus de trois |
| Q3_K_M | 3,9 | Dégradation visible sur le raisonnement et le code |
Ce que ça change sur une machine réelle
Prenons Gemma 3 27B, assez gros pour que l'arbitrage compte. Voici ce qu'il demande à chaque palier, avec 8k de contexte, et la carte qu'il faut derrière.
| Quantification | Mémoire totale | Ce qu'il faut |
|---|---|---|
| FP16 | 53,3 Go | Un Mac généreux, aucune carte |
| Q8_0 | 29,3 Go | 32 Go, soit une RTX 5090 |
| Q6_K | 23,3 Go | 24 Go |
| Q5_K_M | 20,4 Go | 24 Go |
| Q4_K_M | 17,9 Go | 24 Go |
| Q3_K_M | 14,7 Go | 16 Go, soit une RTX 5060 Ti 16 Go |
Le saut intéressant est le dernier. Passer de Q4_K_M à Q3_K_M fait descendre ce modèle de 17,9 à 14,7 Go, c'est-à-dire d'une carte à 24 Go vers une carte à 16 Go — plusieurs centaines d'euros d'écart. En contrepartie, le Q3 dégrade visiblement le raisonnement et le code. C'est un choix, pas une optimisation gratuite.
À noter au passage : chez NVIDIA, la génération actuelle passe directement de 16 à 32 Go. Les cartes de 24 Go, RTX 3090 et 4090, ne se trouvent plus qu'en fin de vie ou d'occasion. La ligne « 24 Go » du tableau est donc plus difficile à atteindre qu'elle n'en a l'air.
Laquelle prendre
- Q4_K_M par défaut. C'est le point d'équilibre, et celui que recommandent les fiches modèles du site.
- Q5_K_M ou Q6_K si votre carte a de la marge : le gain de qualité est réel mais faible, autant le prendre s'il est gratuit.
- Q8_0 si la mémoire ne manque pas. Au-delà, le FP16 double le poids pour un gain imperceptible.
- Q3_K_M uniquement pour faire entrer un gros modèle qui ne rentrerait pas autrement, en sachant ce que vous sacrifiez.
Un dernier réflexe utile : un modèle plus gros fortement quantifié bat souvent un petit modèle en Q8. Un 27B en Q4 tient dans la mémoire d'un 14B en Q8, et raisonne mieux. Le comparatif 5060 Ti contre 5070 montre la même logique appliquée au choix de la carte.
Le cache KV se quantifie aussi, et tout le monde l'oublie
La quantification dont tout le monde parle porte sur les poids. Mais le cache KV, qui retient la conversation en cours, se quantifie séparément — c'est l'option `--cache-type-k` et `--cache-type-v` de llama.cpp — et sur un contexte long, il pèse parfois plus lourd que ce qu'on gagne sur les poids.
Qwen3 32B avec 32k de contexte demande 28,1 Go avec un cache en 16 bits, et 24,4 Go avec un cache en 8 bits. C'est très exactement la différence entre « il faut une carte de 32 Go » et « une carte de 24 Go suffit ». Le calculateur expose ce réglage : il ne s'agit pas d'un détail d'expert.
Même prudence que pour les poids : nous mesurons la mémoire, pas la dégradation. Le consensus veut qu'un cache en 8 bits soit sans effet perceptible, et c'est aujourd'hui un réglage courant. Nous n'avons pas de banc d'essai pour le confirmer nous-mêmes.
Un gros modèle très quantifié bat souvent un petit modèle intact
C'est l'arbitrage le plus utile de tout ce sujet, et le plus contre-intuitif. Comparez à mémoire équivalente plutôt qu'à quantification équivalente.
| Modèle et quantification | Mémoire à 8k |
|---|---|
| Gemma 3 27B en Q3_K_M | 14,7 Go |
| Gemma 3 12B en Q8_0 | 14,1 Go |
| Phi-4 14B en Q8_0 | 17,3 Go |
Un modèle de 27 milliards de paramètres en Q3 tient dans moins de mémoire qu'un modèle de 14 milliards en Q8. Et sur la plupart des tâches, le gros modèle dégradé reste meilleur que le petit modèle intact : la quantité de connaissances encodées pèse plus lourd que la précision avec laquelle elle est stockée.
Ce n'est pas une loi. Sur le code et le raisonnement en plusieurs étapes, le Q3 mord suffisamment pour que l'avantage s'inverse parfois. Mais si vous hésitez entre deux modèles à budget mémoire fixé, commencez par essayer le plus gros.
Lire les noms de fichiers sans se tromper
Sur Hugging Face, un même modèle est publié en une dizaine de fichiers dont les noms se ressemblent. Trois éléments suffisent à s'y retrouver : le chiffre donne les bits nominaux, le K signale un schéma à précisions mélangées — celui que vous voulez — et la lettre finale indique la variante.
Un Q4_K_S est un peu plus léger qu'un Q4_K_M, pour une qualité légèrement inférieure. Le M, pour *medium*, est la variante de référence, celle que nos fiches modèles retiennent et celle que proposent Ollama et LM Studio par défaut. Les anciens formats sans K — Q4_0, Q4_1 — existent encore sur des dépôts anciens : ils sont dépassés, et à qualité égale ils pèsent plus lourd.
Pourquoi le FP16 ne sert presque à rien chez soi
Le FP16 est la précision dans laquelle les modèles sont publiés, et beaucoup en concluent qu'elle est la référence à atteindre. En pratique, elle double le poids par rapport au Q8_0 pour un gain que personne ne détecte à l'usage. Sur Gemma 3 27B, c'est 53,3 Go contre 29,3 : la différence entre une machine à plusieurs milliers d'euros et une carte de 32 Go.
La seule raison valable de garder du FP16 en local est de vouloir entraîner ou affiner un modèle, pas de le faire tourner. Pour de l'inférence, la question ne se pose pas.
En résumé
- Un Q4_K_M pèse 4,9 bits par poids, pas 4. L'écart atteint 4 Go sur un modèle de 32 milliards.
- La quantification décide du palier de carte bien plus que de la qualité perçue.
- Q4_K_M est le standard, et le bon point de départ dans presque tous les cas.
- Le Q3 est un compromis assumé, pas une optimisation : le raisonnement et le code en souffrent.
Chaque palier, sur votre modèle et votre carte, avec le cache KV compris dans le calcul.
Comparer les quantifications