Alibaba · Modèle de langage
Faire tourner Qwen2.5 (14B) en local
Quel GPU, quel Mac, et à quelle vitesse.
Nettement plus fin qu'un 8B sans exiger de matériel exotique : il passe déjà sur une carte de 12 Go, et respire sur 16.
Notre verdict
11,1 GoEn Q4_K_M avec 8k de contexte, Qwen2.5 (14B) demande 11,1 Go. La machine la moins chère qui le fait tourner correctement est GeForce RTX 5060 Ti 16 Go, à environ 38 tokens par seconde.
Ajustez et comparez
La quantification et la taille du contexte changent complètement le résultat. Le cache KV, en particulier, est proportionnel au contexte : passer de 8k à 32k sur un gros modèle peut coûter plus cher en mémoire qu'un modèle entier de 8 milliards de paramètres.
Chargement du calculateur…
Pourquoi cette machine
Même puce que la 5060, mais le double de mémoire pour 270 € de plus. Pour l'IA locale, c'est le meilleur euro dépensé de toute la gamme : les 16 Go débloquent les modèles de 14 milliards de paramètres. Avec Qwen2.5 (14B), elle laisse 4,9 Go de marge et génère environ 38 tokens par seconde — de quoi produire du texte plus vite que vous ne le lisez.
La machine que nous conseillons
GeForce RTX 5060 Ti 16 Go
660 € constaté le 2026-09-01
Caractéristiques du modèle
- Paramètres
- 14,8 Md
- Actifs par token
- Tous (dense)
- Couches
- 48
- Têtes KV
- 8 × 128
Contexte maximal 32k tokens · caractéristiques vérifiées le 2026-09-01 · source primaire
Questions fréquentes
Les réponses courtes
- Combien de VRAM faut-il pour faire tourner Qwen2.5 (14B) en local ?
- 11,1 Go en Q4_K_M avec 8k de contexte : 8,4 Go pour les poids du modèle, 1,5 Go pour le cache KV, le reste en tampons de calcul et en réserve d'affichage.
- Qwen2.5 (14B) tourne-t-il sur une carte de 8 Go ?
- Non, pas en Q4_K_M avec 8k de contexte : il faudrait 11,1 Go alors qu'une carte de 8 Go n'en offre que 8,0 Go. Une quantification plus agressive ou un contexte plus court peut changer la réponse.
- Quelle est la machine la moins chère pour Qwen2.5 (14B) ?
- GeForce RTX 5060 Ti 16 Go, autour de 660 €, à environ 38 tokens par seconde en Q4_K_M.
Modèles voisins
Statut donné pour GeForce RTX 5060 Ti 16 Go, notre machine de référence.