Meta · Modèle de langage
Faire tourner Llama 3.3 (70B) en local
Quel GPU, quel Mac, et à quelle vitesse.
Le palier où le local commence à rivaliser avec les API. Demande 44 Go en Q4 avec 8k de contexte : aucune carte grand public seule n'y arrive, il faut du multi-GPU ou un Mac généreux.
Notre verdict
44,0 GoEn Q4_K_M avec 8k de contexte, Llama 3.3 (70B) demande 44,0 Go. La machine la moins chère qui le fait tourner correctement est Mac Studio M5 Max (128 Go), à environ 11 tokens par seconde.
Ajustez et comparez
La quantification et la taille du contexte changent complètement le résultat. Le cache KV, en particulier, est proportionnel au contexte : passer de 8k à 32k sur un gros modèle peut coûter plus cher en mémoire qu'un modèle entier de 8 milliards de paramètres.
Chargement du calculateur…
Pourquoi cette machine
96 Go allouables et 614 Go/s : la machine qui fait tourner un 70B à une vitesse lisible, ce qu'aucune carte grand public seule ne permet. Se commande chez Apple, pas sur Amazon. Avec Llama 3.3 (70B), elle laisse 52,8 Go de marge et génère environ 11 tokens par seconde — de quoi suivre confortablement la génération à l'écran.
Cette configuration se commande chez le constructeur, pas chez nos partenaires.
Caractéristiques du modèle
- Paramètres
- 70,6 Md
- Actifs par token
- Tous (dense)
- Couches
- 80
- Têtes KV
- 8 × 128
Contexte maximal 128k tokens · caractéristiques vérifiées le 2026-09-01 · source primaire
Questions fréquentes
Les réponses courtes
- Combien de VRAM faut-il pour faire tourner Llama 3.3 (70B) en local ?
- 44,0 Go en Q4_K_M avec 8k de contexte : 40,3 Go pour les poids du modèle, 2,5 Go pour le cache KV, le reste en tampons de calcul et en réserve d'affichage.
- Llama 3.3 (70B) tourne-t-il sur une carte de 8 Go ?
- Non, pas en Q4_K_M avec 8k de contexte : il faudrait 44,0 Go alors qu'une carte de 8 Go n'en offre que 8,0 Go. Une quantification plus agressive ou un contexte plus court peut changer la réponse.
- Quelle est la machine la moins chère pour Llama 3.3 (70B) ?
- Mac Studio M5 Max (128 Go), autour de 5860 €, à environ 11 tokens par seconde en Q4_K_M.
Modèles voisins
Statut donné pour GeForce RTX 5060 Ti 16 Go, notre machine de référence.