Ce que votre machine fait vraiment tourner : IA locale et jeu vidéo, chiffres à l'appui.

Meta · Modèle de langage

Faire tourner Llama 3.3 (70B) en local

Quel GPU, quel Mac, et à quelle vitesse.

Le palier où le local commence à rivaliser avec les API. Demande 44 Go en Q4 avec 8k de contexte : aucune carte grand public seule n'y arrive, il faut du multi-GPU ou un Mac généreux.

Notre verdict

44,0 Go
Poids40,3 Go
Cache KV2,5 Go

En Q4_K_M avec 8k de contexte, Llama 3.3 (70B) demande 44,0 Go. La machine la moins chère qui le fait tourner correctement est Mac Studio M5 Max (128 Go), à environ 11 tokens par seconde.

Ajustez et comparez

La quantification et la taille du contexte changent complètement le résultat. Le cache KV, en particulier, est proportionnel au contexte : passer de 8k à 32k sur un gros modèle peut coûter plus cher en mémoire qu'un modèle entier de 8 milliards de paramètres.

Modèle
Quantification
Contexte

Chargement du calculateur…

Pourquoi cette machine

96 Go allouables et 614 Go/s : la machine qui fait tourner un 70B à une vitesse lisible, ce qu'aucune carte grand public seule ne permet. Se commande chez Apple, pas sur Amazon. Avec Llama 3.3 (70B), elle laisse 52,8 Go de marge et génère environ 11 tokens par seconde — de quoi suivre confortablement la génération à l'écran.

Cette configuration se commande chez le constructeur, pas chez nos partenaires.

Caractéristiques du modèle

Paramètres
70,6 Md
Actifs par token
Tous (dense)
Couches
80
Têtes KV
8 × 128

Contexte maximal 128k tokens · caractéristiques vérifiées le 2026-09-01 · source primaire

Questions fréquentes

Les réponses courtes

Combien de VRAM faut-il pour faire tourner Llama 3.3 (70B) en local ?
44,0 Go en Q4_K_M avec 8k de contexte : 40,3 Go pour les poids du modèle, 2,5 Go pour le cache KV, le reste en tampons de calcul et en réserve d'affichage.
Llama 3.3 (70B) tourne-t-il sur une carte de 8 Go ?
Non, pas en Q4_K_M avec 8k de contexte : il faudrait 44,0 Go alors qu'une carte de 8 Go n'en offre que 8,0 Go. Une quantification plus agressive ou un contexte plus court peut changer la réponse.
Quelle est la machine la moins chère pour Llama 3.3 (70B) ?
Mac Studio M5 Max (128 Go), autour de 5860 €, à environ 11 tokens par seconde en Q4_K_M.

Modèles voisins

Statut donné pour GeForce RTX 5060 Ti 16 Go, notre machine de référence.