Ce que votre machine fait vraiment tourner : IA locale et jeu vidéo, chiffres à l'appui.

NVIDIA · Carte graphique

GeForce RTX 5090 32 Go et IA locale

Les modèles qui tournent dessus, et à quelle vitesse.

La seule carte grand public à dépasser 24 Go, et de loin la plus rapide. Son prix a doublé depuis son lancement : c'est un achat de passionné, pas un choix rationnel.

Notre verdict

32,0 Go
Modèles20/21

20 des 21 modèles de notre sélection tournent correctement sur cette machine, en quantification recommandée avec 8k de contexte. Le plus gros est Ornith-1.5 35B-A3B (MoE). Au-delà, ce n'est pas la vitesse qui bloque mais la mémoire : 32,0 Go utilisables.

Caractéristiques

VRAM
32 Go
Allouable au modèle
32,0 Go
Bande passante
1792 Go/s
Disponibilité
En vente

Caractéristiques vérifiées le 2026-09-01 · Fiche technique NVIDIA

Où l'acheter

GeForce RTX 5090 32 Go

5 000 € constaté le 2026-09-01

Voir sur Amazon

Modèle par modèle

En quantification recommandée, avec 8k de contexte. Une vitesse n'est affichée que si le modèle tient réellement en mémoire.

ModèleQuantificationRequisTok/sVerdict
Ornith-1.5 35B-A3B (MoE)Q4_K_M22,3 Go754Recommandé
Qwen2.5 (32B)Q4_K_M21,9 Go69Recommandé
Qwen3 (32B)Q4_K_M21,9 Go69Recommandé
DeepSeek-R1 Distill Qwen (32B)Q4_K_M21,9 Go69Recommandé
Qwen3 30B-A3B (MoE)Q4_K_M19,3 Go685Recommandé
Gemma 3 (27B)Q4_K_M17,9 Go83Recommandé
Mistral Small 3 (24B)Q4_K_M15,9 Go96Recommandé
gpt-oss 20B (MoE)Q4_K_M13,3 Go628Recommandé
Qwen2.5 (14B)Q4_K_M11,1 Go153Recommandé
Phi-4 (14B)Q4_K_M11,1 Go154Recommandé
Gemma 3 (12B)Q4_K_M9,0 Go185Recommandé
Gemma 2 (9B)Q4_K_M8,4 Go245Recommandé
Qwen3 (8B)Q4_K_M7,0 Go276Recommandé
Llama 3.1 (8B)Q4_K_M6,8 Go282Recommandé
DeepSeek-R1 Distill Llama (8B)Q4_K_M6,8 Go282Recommandé
Qwen2.5 (7B)Q4_K_M6,0 Go297Recommandé
DeepSeek-R1 Distill Qwen (7B)Q4_K_M6,0 Go297Recommandé
Mistral 7B (v0.3)Q4_K_M6,3 Go312Recommandé
Gemma 3 (4B)Q4_K_M3,9 Go526Recommandé
Llama 3.2 (3B)Q4_K_M3,9 Go705Recommandé
Llama 3.3 (70B)Q4_K_M44,0 GoInsuffisant

Génération d'images

Questions fréquentes

Les réponses courtes

Quels modèles d'IA tournent sur GeForce RTX 5090 32 Go ?
20 des 21 modèles de notre sélection, en quantification recommandée avec 8k de contexte. Le plus gros est Ornith-1.5 35B-A3B (MoE), à environ 754 tokens par seconde.
Combien de mémoire de GeForce RTX 5090 32 Go est réellement utilisable ?
Les 32 Go sont adressables, mais l'affichage en consomme déjà près de 0,8 Go — il reste donc environ 31,2 Go pour le modèle. Notre calcul ajoute cette réserve au besoin du modèle plutôt que de la retrancher de la carte, ce qui revient au même.
GeForce RTX 5090 32 Go suffit-elle pour un modèle d'environ 30 milliards de paramètres ?
Oui. Qwen3 30B-A3B (MoE) (30,5 Md) y tourne avec 12,7 Go de marge, à environ 685 tokens par seconde.

À comparer