Ce que votre machine fait vraiment tourner : IA locale et jeu vidéo, chiffres à l'appui.

NVIDIA · Carte graphique

Fin de vie

GeForce RTX 4090 24 Go et IA locale

Les modèles qui tournent dessus, et à quelle vitesse.

24 Go et 1 To/s : elle reste une excellente machine. Mais elle n'est plus produite, et son prix sur le marché résiduel n'a plus grand rapport avec sa valeur.

Notre verdict

24,0 Go
Modèles20/21

20 des 21 modèles de notre sélection tournent correctement sur cette machine, en quantification recommandée avec 8k de contexte. Le plus gros est Ornith-1.5 35B-A3B (MoE). Au-delà, ce n'est pas la vitesse qui bloque mais la mémoire : 24,0 Go utilisables.

Caractéristiques

VRAM
24 Go
Allouable au modèle
24,0 Go
Bande passante
1008 Go/s
Disponibilité
Fin de vie

Caractéristiques vérifiées le 2026-09-01 · Fiche technique NVIDIA

Cette configuration se commande chez le constructeur, pas chez nos partenaires.

Modèle par modèle

En quantification recommandée, avec 8k de contexte. Une vitesse n'est affichée que si le modèle tient réellement en mémoire.

ModèleQuantificationRequisTok/sVerdict
Ornith-1.5 35B-A3B (MoE)Q4_K_M22,3 Go424Recommandé
Qwen2.5 (32B)Q4_K_M21,9 Go39Recommandé
Qwen3 (32B)Q4_K_M21,9 Go39Recommandé
DeepSeek-R1 Distill Qwen (32B)Q4_K_M21,9 Go39Recommandé
Qwen3 30B-A3B (MoE)Q4_K_M19,3 Go386Recommandé
Gemma 3 (27B)Q4_K_M17,9 Go46Recommandé
Mistral Small 3 (24B)Q4_K_M15,9 Go54Recommandé
gpt-oss 20B (MoE)Q4_K_M13,3 Go353Recommandé
Qwen2.5 (14B)Q4_K_M11,1 Go86Recommandé
Phi-4 (14B)Q4_K_M11,1 Go87Recommandé
Gemma 3 (12B)Q4_K_M9,0 Go104Recommandé
Gemma 2 (9B)Q4_K_M8,4 Go138Recommandé
Qwen3 (8B)Q4_K_M7,0 Go155Recommandé
Llama 3.1 (8B)Q4_K_M6,8 Go158Recommandé
DeepSeek-R1 Distill Llama (8B)Q4_K_M6,8 Go158Recommandé
Qwen2.5 (7B)Q4_K_M6,0 Go167Recommandé
DeepSeek-R1 Distill Qwen (7B)Q4_K_M6,0 Go167Recommandé
Mistral 7B (v0.3)Q4_K_M6,3 Go175Recommandé
Gemma 3 (4B)Q4_K_M3,9 Go296Recommandé
Llama 3.2 (3B)Q4_K_M3,9 Go396Recommandé
Llama 3.3 (70B)Q4_K_M44,0 GoInsuffisant

Génération d'images

Questions fréquentes

Les réponses courtes

Quels modèles d'IA tournent sur GeForce RTX 4090 24 Go ?
20 des 21 modèles de notre sélection, en quantification recommandée avec 8k de contexte. Le plus gros est Ornith-1.5 35B-A3B (MoE), à environ 424 tokens par seconde.
Combien de mémoire de GeForce RTX 4090 24 Go est réellement utilisable ?
Les 24 Go sont adressables, mais l'affichage en consomme déjà près de 0,8 Go — il reste donc environ 23,2 Go pour le modèle. Notre calcul ajoute cette réserve au besoin du modèle plutôt que de la retrancher de la carte, ce qui revient au même.
GeForce RTX 4090 24 Go suffit-elle pour un modèle d'environ 30 milliards de paramètres ?
Oui. Qwen3 30B-A3B (MoE) (30,5 Md) y tourne avec 4,7 Go de marge, à environ 386 tokens par seconde.

À comparer