NVIDIA · Carte graphique
GeForce RTX 5060 8 Go et IA locale
Les modèles qui tournent dessus, et à quelle vitesse.
Rapide pour son prix, mais 8 Go seulement. C'est la carte qui déçoit en IA locale : elle plafonne aux modèles de 8 milliards de paramètres et bute sur tout ce qui a un cache KV généreux.
Notre verdict
8,0 Go8 des 21 modèles de notre sélection tournent correctement sur cette machine, en quantification recommandée avec 8k de contexte. Le plus gros est Qwen3 (8B). Au-delà, ce n'est pas la vitesse qui bloque mais la mémoire : 8,0 Go utilisables.
Caractéristiques
- VRAM
- 8 Go
- Allouable au modèle
- 8,0 Go
- Bande passante
- 448 Go/s
- Disponibilité
- En vente
Caractéristiques vérifiées le 2026-09-01 · Fiche technique NVIDIA
Où l'acheter
GeForce RTX 5060 8 Go
390 € constaté le 2026-09-01
Modèle par modèle
En quantification recommandée, avec 8k de contexte. Une vitesse n'est affichée que si le modèle tient réellement en mémoire.
| Modèle | Quantification | Requis | Tok/s | Verdict |
|---|---|---|---|---|
| Qwen3 (8B) | Q4_K_M | 7,0 Go | 69 | Recommandé |
| Llama 3.1 (8B) | Q4_K_M | 6,8 Go | 70 | Recommandé |
| DeepSeek-R1 Distill Llama (8B) | Q4_K_M | 6,8 Go | 70 | Recommandé |
| Qwen2.5 (7B) | Q4_K_M | 6,0 Go | 74 | Recommandé |
| DeepSeek-R1 Distill Qwen (7B) | Q4_K_M | 6,0 Go | 74 | Recommandé |
| Mistral 7B (v0.3) | Q4_K_M | 6,3 Go | 78 | Recommandé |
| Gemma 3 (4B) | Q4_K_M | 3,9 Go | 132 | Recommandé |
| Llama 3.2 (3B) | Q4_K_M | 3,9 Go | 176 | Recommandé |
| Llama 3.3 (70B) | Q4_K_M | 44,0 Go | — | Insuffisant |
| Ornith-1.5 35B-A3B (MoE) | Q4_K_M | 22,3 Go | — | Insuffisant |
| Qwen2.5 (32B) | Q4_K_M | 21,9 Go | — | Insuffisant |
| Qwen3 (32B) | Q4_K_M | 21,9 Go | — | Insuffisant |
| DeepSeek-R1 Distill Qwen (32B) | Q4_K_M | 21,9 Go | — | Insuffisant |
| Qwen3 30B-A3B (MoE) | Q4_K_M | 19,3 Go | — | Insuffisant |
| Gemma 3 (27B) | Q4_K_M | 17,9 Go | — | Insuffisant |
| Mistral Small 3 (24B) | Q4_K_M | 15,9 Go | — | Insuffisant |
| gpt-oss 20B (MoE) | Q4_K_M | 13,3 Go | — | Insuffisant |
| Qwen2.5 (14B) | Q4_K_M | 11,1 Go | — | Insuffisant |
| Phi-4 (14B) | Q4_K_M | 11,1 Go | — | Insuffisant |
| Gemma 3 (12B) | Q4_K_M | 9,0 Go | — | Insuffisant |
| Gemma 2 (9B) | Q4_K_M | 8,4 Go | — | Insuffisant |
Génération d'images
- Flux.1 Schnell
Passe en GGUF Q4.
- Flux.1 Dev
Passe en GGUF Q4.
- Stable Diffusion XL
Passe en FP16, FP16 + offload.
Questions fréquentes
Les réponses courtes
- Quels modèles d'IA tournent sur GeForce RTX 5060 8 Go ?
- 8 des 21 modèles de notre sélection, en quantification recommandée avec 8k de contexte. Le plus gros est Qwen3 (8B), à environ 69 tokens par seconde.
- Combien de mémoire de GeForce RTX 5060 8 Go est réellement utilisable ?
- Les 8 Go sont adressables, mais l'affichage en consomme déjà près de 0,8 Go — il reste donc environ 7,2 Go pour le modèle. Notre calcul ajoute cette réserve au besoin du modèle plutôt que de la retrancher de la carte, ce qui revient au même.
- GeForce RTX 5060 8 Go suffit-elle pour un modèle d'environ 30 milliards de paramètres ?
- Non, pas confortablement : Qwen3 30B-A3B (MoE) (30,5 Md) demande 19,3 Go en quantification recommandée, soit 11,3 Go de trop. Il faudrait descendre en Q3 ou raccourcir le contexte.
À comparer