Ce que votre machine fait vraiment tourner : IA locale et jeu vidéo, chiffres à l'appui.

OpenAI · Modèle de langage

Faire tourner gpt-oss 20B (MoE) en local

Quel GPU, quel Mac, et à quelle vitesse.

21 milliards de paramètres pour 3,6 actifs : il occupe 13,3 Go à 8k et génère à la vitesse d'un petit modèle. Son cache KV ne pèse que 0,19 Go, si bien que passer à 128k de contexte ne lui coûte que 4 Go de plus. Ses poids sont publiés directement en MXFP4, un format 4 bits.

Notre verdict

13,3 Go
Poids12,0 Go
Cache KV0,2 Go

En Q4_K_M avec 8k de contexte, gpt-oss 20B (MoE) demande 13,3 Go. La machine la moins chère qui le fait tourner correctement est GeForce RTX 5060 Ti 16 Go, à environ 157 tokens par seconde.

Ajustez et comparez

La quantification et la taille du contexte changent complètement le résultat. Le cache KV, en particulier, est proportionnel au contexte : passer de 8k à 32k sur un gros modèle peut coûter plus cher en mémoire qu'un modèle entier de 8 milliards de paramètres.

Modèle
Quantification
Contexte

Chargement du calculateur…

Pourquoi cette machine

Même puce que la 5060, mais le double de mémoire pour 270 € de plus. Pour l'IA locale, c'est le meilleur euro dépensé de toute la gamme : les 16 Go débloquent les modèles de 14 milliards de paramètres. Avec gpt-oss 20B (MoE), elle laisse 2,7 Go de marge et génère environ 157 tokens par seconde — de quoi produire du texte plus vite que vous ne le lisez.

La machine que nous conseillons

GeForce RTX 5060 Ti 16 Go

660 € constaté le 2026-09-01

Voir sur Amazon

Caractéristiques du modèle

Paramètres
21 Md
Actifs par token
3,6 Md
Couches
24
Têtes KV
8 × 64

Contexte maximal 128k tokens · caractéristiques vérifiées le 2026-09-01 · source primaire

Questions fréquentes

Les réponses courtes

Combien de VRAM faut-il pour faire tourner gpt-oss 20B (MoE) en local ?
13,3 Go en Q4_K_M avec 8k de contexte : 12,0 Go pour les poids du modèle, 0,2 Go pour le cache KV, le reste en tampons de calcul et en réserve d'affichage.
gpt-oss 20B (MoE) tourne-t-il sur une carte de 8 Go ?
Non, pas en Q4_K_M avec 8k de contexte : il faudrait 13,3 Go alors qu'une carte de 8 Go n'en offre que 8,0 Go. Une quantification plus agressive ou un contexte plus court peut changer la réponse.
Quelle est la machine la moins chère pour gpt-oss 20B (MoE) ?
GeForce RTX 5060 Ti 16 Go, autour de 660 €, à environ 157 tokens par seconde en Q4_K_M.

Modèles voisins

Statut donné pour GeForce RTX 5060 Ti 16 Go, notre machine de référence.