Ce que votre machine fait vraiment tourner : IA locale et jeu vidéo, chiffres à l'appui.

Apple · Mémoire unifiée

Fin de vie

Mac Studio M4 Max (128 Go) et IA locale

Les modèles qui tournent dessus, et à quelle vitesse.

96 Go allouables et 546 Go/s : elle faisait tourner un 70B dans un boîtier de 2 litres. Génération précédente, remplacée par le Mac Studio M5 Max.

Notre verdict

96,0 Go
Modèles21/21

21 des 21 modèles de notre sélection tournent correctement sur cette machine, en quantification recommandée avec 8k de contexte. Le plus gros est Llama 3.3 (70B). Au-delà, ce n'est pas la vitesse qui bloque mais la mémoire : 96,0 Go utilisables.

Caractéristiques

Mémoire unifiée
128 Go
Allouable au modèle
96,0 Go
Bande passante
546 Go/s
Disponibilité
Fin de vie

Sur Mac, la mémoire est partagée entre le processeur et le GPU, et macOS n'en laisse qu'une partie au modèle — 96,0 Go ici. C'est plus souple qu'une carte graphique, mais la bande passante, elle, plafonne la vitesse de génération bien plus tôt.

Caractéristiques vérifiées le 2026-09-01 · Caractéristiques Apple du Mac Studio

Cette configuration se commande chez le constructeur, pas chez nos partenaires.

Modèle par modèle

En quantification recommandée, avec 8k de contexte. Une vitesse n'est affichée que si le modèle tient réellement en mémoire.

ModèleQuantificationRequisTok/sVerdict
Llama 3.3 (70B)Q4_K_M43,2 Go10Recommandé
Ornith-1.5 35B-A3B (MoE)Q4_K_M21,5 Go230Recommandé
Qwen2.5 (32B)Q4_K_M21,1 Go21Recommandé
Qwen3 (32B)Q4_K_M21,1 Go21Recommandé
DeepSeek-R1 Distill Qwen (32B)Q4_K_M21,1 Go21Recommandé
Qwen3 30B-A3B (MoE)Q4_K_M18,5 Go209Recommandé
Gemma 3 (27B)Q4_K_M17,1 Go25Recommandé
Mistral Small 3 (24B)Q4_K_M15,1 Go29Recommandé
gpt-oss 20B (MoE)Q4_K_M12,5 Go191Recommandé
Qwen2.5 (14B)Q4_K_M10,3 Go47Recommandé
Phi-4 (14B)Q4_K_M10,3 Go47Recommandé
Gemma 3 (12B)Q4_K_M8,2 Go56Recommandé
Gemma 2 (9B)Q4_K_M7,6 Go75Recommandé
Qwen3 (8B)Q4_K_M6,2 Go84Recommandé
Llama 3.1 (8B)Q4_K_M6,0 Go86Recommandé
DeepSeek-R1 Distill Llama (8B)Q4_K_M6,0 Go86Recommandé
Qwen2.5 (7B)Q4_K_M5,2 Go90Recommandé
DeepSeek-R1 Distill Qwen (7B)Q4_K_M5,2 Go90Recommandé
Mistral 7B (v0.3)Q4_K_M5,5 Go95Recommandé
Gemma 3 (4B)Q4_K_M3,1 Go160Recommandé
Llama 3.2 (3B)Q4_K_M3,1 Go215Recommandé

Génération d'images

Questions fréquentes

Les réponses courtes

Quels modèles d'IA tournent sur Mac Studio M4 Max (128 Go) ?
21 des 21 modèles de notre sélection, en quantification recommandée avec 8k de contexte. Le plus gros est Llama 3.3 (70B), à environ 10 tokens par seconde.
Combien de mémoire de Mac Studio M4 Max (128 Go) est réellement utilisable ?
96,0 Go sur 128 Go : sur Mac, la mémoire est partagée avec le processeur et macOS n'en laisse qu'une partie au modèle.
Mac Studio M4 Max (128 Go) suffit-elle pour un modèle d'environ 30 milliards de paramètres ?
Oui. Qwen3 30B-A3B (MoE) (30,5 Md) y tourne avec 77,5 Go de marge, à environ 209 tokens par seconde.

À comparer