Ce que votre machine fait vraiment tourner : IA locale et jeu vidéo, chiffres à l'appui.

Alibaba · Modèle de langage

Faire tourner Qwen2.5 (7B) en local

Quel GPU, quel Mac, et à quelle vitesse.

Très bon en multilingue et en code pour sa taille. Son cache KV est deux fois plus léger que celui d'un Llama 8B.

Notre verdict

6,0 Go
Poids4,3 Go
Cache KV0,4 Go

En Q4_K_M avec 8k de contexte, Qwen2.5 (7B) demande 6,0 Go. La machine la moins chère qui le fait tourner correctement est GeForce RTX 5060 8 Go, à environ 74 tokens par seconde.

Ajustez et comparez

La quantification et la taille du contexte changent complètement le résultat. Le cache KV, en particulier, est proportionnel au contexte : passer de 8k à 32k sur un gros modèle peut coûter plus cher en mémoire qu'un modèle entier de 8 milliards de paramètres.

Modèle
Quantification
Contexte

Chargement du calculateur…

Pourquoi cette machine

Rapide pour son prix, mais 8 Go seulement. C'est la carte qui déçoit en IA locale : elle plafonne aux modèles de 8 milliards de paramètres et bute sur tout ce qui a un cache KV généreux. Avec Qwen2.5 (7B), elle laisse 2,0 Go de marge et génère environ 74 tokens par seconde — de quoi produire du texte plus vite que vous ne le lisez.

La machine que nous conseillons

GeForce RTX 5060 8 Go

390 € constaté le 2026-09-01

Voir sur Amazon

Caractéristiques du modèle

Paramètres
7,6 Md
Actifs par token
Tous (dense)
Couches
28
Têtes KV
4 × 128

Contexte maximal 32k tokens · caractéristiques vérifiées le 2026-09-01 · source primaire

Questions fréquentes

Les réponses courtes

Combien de VRAM faut-il pour faire tourner Qwen2.5 (7B) en local ?
6,0 Go en Q4_K_M avec 8k de contexte : 4,3 Go pour les poids du modèle, 0,4 Go pour le cache KV, le reste en tampons de calcul et en réserve d'affichage.
Qwen2.5 (7B) tourne-t-il sur une carte de 8 Go ?
Oui. Sur GeForce RTX 5060 8 Go, il reste 2,0 Go de marge, pour environ 74 tokens par seconde.
Quelle est la machine la moins chère pour Qwen2.5 (7B) ?
GeForce RTX 5060 8 Go, autour de 390 €, à environ 74 tokens par seconde en Q4_K_M.

Modèles voisins

Statut donné pour GeForce RTX 5060 Ti 16 Go, notre machine de référence.