Guide d'achat
6 min de lecture
Quelle carte pour générer des images ?
Stable Diffusion XL tourne sur 8 Go, Flux en réclame 12 en FP8 et 24 en FP16. Les paliers réels, et pourquoi la génération d'images ne se calcule pas.
Par la rédaction de LeBonPC · Publié le 29 septembre 2026
Sommaire
- 01Les paliers, modèle par modèle
- 02Pourquoi nous ne calculons pas la génération d'images
- 03Quelle carte selon ce que vous visez
- 04La vitesse compte moins qu'en texte
- 05Les LoRA et les ControlNet s'ajoutent par-dessus
- 06Le temps par image ne dépend pas de la mémoire
- 07Et sur un Mac ?
- 08Schnell ou Dev : trancher avant d'acheter
- 09Par quel modèle commencer
- 10En résumé
Pour générer des images en local, une carte de 8 Go suffit à démarrer : Stable Diffusion XL y tourne sans contorsion. Flux, plus récent et nettement meilleur, demande 12 Go dans sa version FP8 et 24 Go en FP16. Les paliers sont plus bas que pour les modèles de texte, mais ils sont plus rigides.
Les paliers, modèle par modèle
| Modèle | Variante | Mémoire | Ce que ça implique |
|---|---|---|---|
| Stable Diffusion XL | FP16 | 8 Go | Le format standard, supporté partout |
| Stable Diffusion XL | FP16 + déchargement | 5 Go | Passe sur une carte de 6 Go |
| Flux.1 Schnell | GGUF Q4 | 7 Go | Tient sur 8 Go, un peu de détail en moins |
| Flux.1 Schnell | FP8 | 12 Go | Le réglage par défaut raisonnable |
| Flux.1 Schnell | FP16 | 24 Go | Pipeline complet en mémoire |
| Flux.1 Dev | FP8 | 12 Go | Le compromis courant sur une carte de 16 Go |
Pourquoi nous ne calculons pas la génération d'images
Pour un modèle de texte, la mémoire se déduit d'une formule : des poids, un cache KV, des tampons. Pour un modèle d'image, elle dépend surtout du pipeline — l'encodeur de texte est-il déchargé après usage, le VAE travaille-t-il en tuiles, les composants sont-ils chargés séquentiellement. Deux personnes qui font tourner le même modèle sur la même carte peuvent constater un écart du simple au double.
C'est pour cette raison que nos fiches de génération d'images donnent des paliers constatés plutôt qu'un résultat calculé. Publier un chiffre à la décimale près serait plus élégant, et faux.
Quelle carte selon ce que vous visez
Une RTX 5060 8 Go à 390 € fait tourner SDXL et Flux en Q4. C'est le vrai ticket d'entrée, et il est bas — nettement plus bas que pour les modèles de texte, où 8 Go plafonnent vite.
Une RTX 5060 Ti 16 Go à 660 € vous met à l'aise sur Flux en FP8, avec la marge nécessaire aux LoRA et aux ControlNet, qui s'ajoutent au modèle. C'est le palier que je conseillerais à quelqu'un qui veut faire de l'image sérieusement sans y consacrer un budget déraisonnable.
Au-delà, le FP16 de Flux réclame 24 Go, une capacité qui a presque disparu du neuf : la génération actuelle passe de 16 à 32 Go. On y revient dans le comparatif 5060 Ti contre 5070.
La vitesse compte moins qu'en texte
Pour un modèle de langage, la bande passante fixe le débit et se ressent immédiatement. Pour l'image, ce qui compte est le temps par image, et l'écart entre une carte moyenne et une carte haut de gamme se mesure en secondes d'attente, pas en confort d'usage. Une génération de dix secondes au lieu de quatre reste parfaitement supportable ; un modèle de texte qui produit cinq tokens par seconde, non.
Autrement dit, en image, privilégiez la capacité mémoire sur la vitesse. C'est la même conclusion que pour le texte, mais pour une raison différente.
Les LoRA et les ControlNet s'ajoutent par-dessus
C'est l'oubli classique du calcul de mémoire en génération d'images. Un modèle de base seul ne correspond à l'usage de personne : on y empile des LoRA pour un style, un ControlNet pour contraindre la composition, parfois un modèle d'agrandissement en fin de chaîne. Chacun occupe sa place en mémoire, en même temps que le modèle.
C'est la raison pour laquelle je ne conseille pas de viser le palier au ras du minimum. Flux en FP8 tient dans 12 Go, mais une carte de 12 Go vous laissera sans marge dès le premier ControlNet. Les 16 Go ne sont pas du luxe : ils sont la condition d'un usage réel.
Le temps par image ne dépend pas de la mémoire
Une fois le modèle chargé, la durée d'une génération dépend de la puissance de calcul et du nombre d'étapes de débruitage, pas de la bande passante mémoire. C'est une différence de fond avec les modèles de texte, où le débit se déduit presque entièrement de la bande passante.
Conséquence directe sur l'achat : les hiérarchies ne sont pas les mêmes. Une carte qui brille en IA textuelle parce qu'elle lit vite sa mémoire n'a pas nécessairement le même avantage en image. Et Flux.1 Schnell génère en une à quatre étapes là où Dev en demande vingt à trente : le choix du modèle pèse bien plus lourd sur le temps d'attente que le choix de la carte.
Et sur un Mac ?
La mémoire unifiée joue en faveur d'Apple sur ce terrain : un Mac Mini M6 24 Go dispose de 16,1 Go allouables, de quoi accueillir Flux en FP8 avec ses accessoires. Mais la génération d'images est un travail de calcul intensif, exactement là où les puces Apple sont le plus en retrait face à une carte dédiée.
En clair : sur Mac, vos images sortiront, avec une latitude confortable côté mémoire, mais plus lentement. Pour de l'image en volume, une carte reste le bon outil.
Schnell ou Dev : trancher avant d'acheter
Les deux ont exactement les mêmes exigences mémoire, palier par palier. Le choix se fait donc ailleurs. Flux.1 Dev rend mieux, prend plus de temps, et sa licence interdit l'usage commercial. Schnell est plus rapide, à peine en retrait, et librement utilisable.
Autrement dit, la question du matériel est la même dans les deux cas : c'est celle de la licence qui devrait décider en premier, et elle ne coûte rien à trancher avant d'avoir commandé quoi que ce soit.
Par quel modèle commencer
Si vous démarrez, commencez par Stable Diffusion XL, même si Flux rend mieux. La raison n'est pas technique mais pratique : son écosystème de LoRA, de ControlNet et d'outils est sans commune mesure, et l'essentiel de ce que vous trouverez comme tutoriels, réglages et modèles dérivés a été produit autour de lui.
Il a aussi le mérite d'être modeste : 8 Go en FP16, et 5 Go avec déchargement séquentiel, ce qui le fait passer sur une carte de 6 Go. Autrement dit, il tourne sur presque tout ce qui traîne dans une tour de jeu récente, et vous saurez si le sujet vous intéresse avant d'avoir dépensé un euro de matériel.
Passez à Flux quand vous butez sur la qualité de rendu, pas avant. C'est un meilleur modèle, mais il vous coûtera le doublement de votre budget mémoire pour un gain que vous n'exploiterez qu'une fois les bases acquises.
En résumé
- 8 Go suffisent pour démarrer : SDXL en FP16, Flux en Q4.
- 12 Go ouvrent Flux en FP8, le vrai palier confortable, LoRA compris à 16 Go.
- La mémoire dépend du pipeline, pas d'une formule : nos chiffres sont des paliers constatés.
- Flux.1 Dev est non commercial. Vérifiez la licence avant tout usage professionnel.
Les trois modèles d'image, leurs variantes et la mémoire que chacune demande.
Voir les modèles d'image