Ce que votre machine fait vraiment tourner : IA locale et jeu vidéo, chiffres à l'appui.

Alibaba · Modèle de langage

Faire tourner Qwen3 30B-A3B (MoE) en local

Quel GPU, quel Mac, et à quelle vitesse.

Mélange d'experts : il occupe la mémoire d'un 30B mais génère à la vitesse d'un 3B. Le cas où la capacité et la bande passante ne racontent pas la même histoire.

Notre verdict

19,3 Go
Poids17,4 Go
Cache KV0,8 Go

En Q4_K_M avec 8k de contexte, Qwen3 30B-A3B (MoE) demande 19,3 Go. La machine la moins chère qui le fait tourner correctement est Mac Mini M5 Pro (64 Go), à environ 117 tokens par seconde.

Ajustez et comparez

La quantification et la taille du contexte changent complètement le résultat. Le cache KV, en particulier, est proportionnel au contexte : passer de 8k à 32k sur un gros modèle peut coûter plus cher en mémoire qu'un modèle entier de 8 milliards de paramètres.

Modèle
Quantification
Contexte

Chargement du calculateur…

Pourquoi cette machine

48 Go allouables au modèle : il avale un 70B qu'aucune carte grand public ne charge, et tient les modèles de 32 milliards de paramètres avec de la marge sur le contexte. 307 Go/s, soit une vitesse de lecture tranquille plutôt qu'un débit de carte dédiée. Cette configuration mémoire se commande chez Apple, pas sur Amazon. Avec Qwen3 30B-A3B (MoE), elle laisse 29,5 Go de marge et génère environ 117 tokens par seconde — de quoi produire du texte plus vite que vous ne le lisez.

Cette configuration se commande chez le constructeur, pas chez nos partenaires.

Caractéristiques du modèle

Paramètres
30,5 Md
Actifs par token
3,3 Md
Couches
48
Têtes KV
4 × 128

Contexte maximal 40k tokens · caractéristiques vérifiées le 2026-09-01 · source primaire

Questions fréquentes

Les réponses courtes

Combien de VRAM faut-il pour faire tourner Qwen3 30B-A3B (MoE) en local ?
19,3 Go en Q4_K_M avec 8k de contexte : 17,4 Go pour les poids du modèle, 0,8 Go pour le cache KV, le reste en tampons de calcul et en réserve d'affichage.
Qwen3 30B-A3B (MoE) tourne-t-il sur une carte de 8 Go ?
Non, pas en Q4_K_M avec 8k de contexte : il faudrait 19,3 Go alors qu'une carte de 8 Go n'en offre que 8,0 Go. Une quantification plus agressive ou un contexte plus court peut changer la réponse.
Quelle est la machine la moins chère pour Qwen3 30B-A3B (MoE) ?
Mac Mini M5 Pro (64 Go), autour de 3100 €, à environ 117 tokens par seconde en Q4_K_M.

Modèles voisins

Statut donné pour GeForce RTX 5060 Ti 16 Go, notre machine de référence.