Alibaba · Modèle de langage
Faire tourner Qwen3 30B-A3B (MoE) en local
Quel GPU, quel Mac, et à quelle vitesse.
Mélange d'experts : il occupe la mémoire d'un 30B mais génère à la vitesse d'un 3B. Le cas où la capacité et la bande passante ne racontent pas la même histoire.
Notre verdict
19,3 GoEn Q4_K_M avec 8k de contexte, Qwen3 30B-A3B (MoE) demande 19,3 Go. La machine la moins chère qui le fait tourner correctement est Mac Mini M5 Pro (64 Go), à environ 117 tokens par seconde.
Ajustez et comparez
La quantification et la taille du contexte changent complètement le résultat. Le cache KV, en particulier, est proportionnel au contexte : passer de 8k à 32k sur un gros modèle peut coûter plus cher en mémoire qu'un modèle entier de 8 milliards de paramètres.
Chargement du calculateur…
Pourquoi cette machine
48 Go allouables au modèle : il avale un 70B qu'aucune carte grand public ne charge, et tient les modèles de 32 milliards de paramètres avec de la marge sur le contexte. 307 Go/s, soit une vitesse de lecture tranquille plutôt qu'un débit de carte dédiée. Cette configuration mémoire se commande chez Apple, pas sur Amazon. Avec Qwen3 30B-A3B (MoE), elle laisse 29,5 Go de marge et génère environ 117 tokens par seconde — de quoi produire du texte plus vite que vous ne le lisez.
Cette configuration se commande chez le constructeur, pas chez nos partenaires.
Caractéristiques du modèle
- Paramètres
- 30,5 Md
- Actifs par token
- 3,3 Md
- Couches
- 48
- Têtes KV
- 4 × 128
Contexte maximal 40k tokens · caractéristiques vérifiées le 2026-09-01 · source primaire
Questions fréquentes
Les réponses courtes
- Combien de VRAM faut-il pour faire tourner Qwen3 30B-A3B (MoE) en local ?
- 19,3 Go en Q4_K_M avec 8k de contexte : 17,4 Go pour les poids du modèle, 0,8 Go pour le cache KV, le reste en tampons de calcul et en réserve d'affichage.
- Qwen3 30B-A3B (MoE) tourne-t-il sur une carte de 8 Go ?
- Non, pas en Q4_K_M avec 8k de contexte : il faudrait 19,3 Go alors qu'une carte de 8 Go n'en offre que 8,0 Go. Une quantification plus agressive ou un contexte plus court peut changer la réponse.
- Quelle est la machine la moins chère pour Qwen3 30B-A3B (MoE) ?
- Mac Mini M5 Pro (64 Go), autour de 3100 €, à environ 117 tokens par seconde en Q4_K_M.
Modèles voisins
Statut donné pour GeForce RTX 5060 Ti 16 Go, notre machine de référence.