Google · Modèle de langage
Faire tourner Gemma 3 (4B) en local
Quel GPU, quel Mac, et à quelle vitesse.
3,9 Go en Q4 à 8k, et encore 7,8 Go en poussant le contexte à 128k : il tient dans une carte de 8 Go quoi qu'on lui demande. Il lit aussi les images.
Notre verdict
3,9 GoEn Q4_K_M avec 8k de contexte, Gemma 3 (4B) demande 3,9 Go. La machine la moins chère qui le fait tourner correctement est GeForce RTX 5060 8 Go, à environ 132 tokens par seconde.
Ajustez et comparez
La quantification et la taille du contexte changent complètement le résultat. Le cache KV, en particulier, est proportionnel au contexte : passer de 8k à 32k sur un gros modèle peut coûter plus cher en mémoire qu'un modèle entier de 8 milliards de paramètres.
Chargement du calculateur…
Pourquoi cette machine
Rapide pour son prix, mais 8 Go seulement. C'est la carte qui déçoit en IA locale : elle plafonne aux modèles de 8 milliards de paramètres et bute sur tout ce qui a un cache KV généreux. Avec Gemma 3 (4B), elle laisse 4,1 Go de marge et génère environ 132 tokens par seconde — de quoi produire du texte plus vite que vous ne le lisez.
La machine que nous conseillons
GeForce RTX 5060 8 Go
390 € constaté le 2026-09-01
Caractéristiques du modèle
- Paramètres
- 4,3 Md
- Actifs par token
- Tous (dense)
- Couches
- 34
- Têtes KV
- 4 × 256
Contexte maximal 128k tokens · caractéristiques vérifiées le 2026-09-01 · source primaire
Questions fréquentes
Les réponses courtes
- Combien de VRAM faut-il pour faire tourner Gemma 3 (4B) en local ?
- 3,9 Go en Q4_K_M avec 8k de contexte : 2,5 Go pour les poids du modèle, 0,3 Go pour le cache KV, le reste en tampons de calcul et en réserve d'affichage.
- Gemma 3 (4B) tourne-t-il sur une carte de 8 Go ?
- Oui. Sur GeForce RTX 5060 8 Go, il reste 4,1 Go de marge, pour environ 132 tokens par seconde.
- Quelle est la machine la moins chère pour Gemma 3 (4B) ?
- GeForce RTX 5060 8 Go, autour de 390 €, à environ 132 tokens par seconde en Q4_K_M.
Modèles voisins
Statut donné pour GeForce RTX 5060 Ti 16 Go, notre machine de référence.