Ce que votre machine fait vraiment tourner : IA locale et jeu vidéo, chiffres à l'appui.

Meta · Modèle de langage

Faire tourner Llama 3.2 (3B) en local

Quel GPU, quel Mac, et à quelle vitesse.

Le petit modèle qui tourne partout, y compris sur une carte de 6 Go ou un portable sans GPU dédié.

Notre verdict

3,9 Go
Poids1,8 Go
Cache KV0,9 Go

En Q4_K_M avec 8k de contexte, Llama 3.2 (3B) demande 3,9 Go. La machine la moins chère qui le fait tourner correctement est GeForce RTX 5060 8 Go, à environ 176 tokens par seconde.

Ajustez et comparez

La quantification et la taille du contexte changent complètement le résultat. Le cache KV, en particulier, est proportionnel au contexte : passer de 8k à 32k sur un gros modèle peut coûter plus cher en mémoire qu'un modèle entier de 8 milliards de paramètres.

Modèle
Quantification
Contexte

Chargement du calculateur…

Pourquoi cette machine

Rapide pour son prix, mais 8 Go seulement. C'est la carte qui déçoit en IA locale : elle plafonne aux modèles de 8 milliards de paramètres et bute sur tout ce qui a un cache KV généreux. Avec Llama 3.2 (3B), elle laisse 4,1 Go de marge et génère environ 176 tokens par seconde — de quoi produire du texte plus vite que vous ne le lisez.

La machine que nous conseillons

GeForce RTX 5060 8 Go

390 € constaté le 2026-09-01

Voir sur Amazon

Caractéristiques du modèle

Paramètres
3,2 Md
Actifs par token
Tous (dense)
Couches
28
Têtes KV
8 × 128

Contexte maximal 128k tokens · caractéristiques vérifiées le 2026-09-01 · source primaire

Questions fréquentes

Les réponses courtes

Combien de VRAM faut-il pour faire tourner Llama 3.2 (3B) en local ?
3,9 Go en Q4_K_M avec 8k de contexte : 1,8 Go pour les poids du modèle, 0,9 Go pour le cache KV, le reste en tampons de calcul et en réserve d'affichage.
Llama 3.2 (3B) tourne-t-il sur une carte de 8 Go ?
Oui. Sur GeForce RTX 5060 8 Go, il reste 4,1 Go de marge, pour environ 176 tokens par seconde.
Quelle est la machine la moins chère pour Llama 3.2 (3B) ?
GeForce RTX 5060 8 Go, autour de 390 €, à environ 176 tokens par seconde en Q4_K_M.

Modèles voisins

Statut donné pour GeForce RTX 5060 Ti 16 Go, notre machine de référence.