Ce que votre machine fait vraiment tourner : IA locale et jeu vidéo, chiffres à l'appui.

Guide d'achat

6 min de lecture

16 Go ou plus de vitesse ?

La 5070 est 50 % plus rapide, la 5060 Ti a 4 Go de plus et coûte 140 € de moins. Pour l'IA locale, la mémoire gagne — voici sur quels modèles exactement.

Par la rédaction de LeBonPC · Publié le 1 septembre 2026

Pour l'IA locale, prenez la RTX 5060 Ti 16 Go. Elle coûte 140 € de moins que la RTX 5070 12 Go et fait tourner deux modèles que celle-ci refuse de charger. La 5070 est bien plus rapide — environ 50 % — mais sur des modèles qui dépassent déjà tous la vitesse à laquelle vous lisez.

La 5070 est plus rapide, et ce n'est pas discutable

La génération de texte est limitée par la bande passante mémoire : à chaque token produit, la carte relit l'intégralité des poids actifs du modèle. La 5070 monte à 672 Go/s contre 448 Go/s pour la 5060 Ti, soit la moitié en plus. Cet écart se retrouve tel quel dans les débits, sur tout ce que les deux cartes savent charger.

Un Phi-4 passe ainsi de 38 à 58 tokens par seconde, un Gemma 3 12B de 46 à 70. Il n'y a aucune ambiguïté : à modèle égal, la 5070 est devant.

Mais au-dessus de 12 Go, elle ne joue plus du tout

Le problème n'est pas la vitesse, c'est le plafond. Un modèle qui ne tient pas en mémoire ne tourne pas plus lentement : il déborde sur le processeur, avec une chute de vitesse d'un facteur cinq à dix, quand il démarre.

Deux modèles du catalogue tombent précisément dans l'intervalle entre 12 et 16 Go. Le gpt-oss 20B d'OpenAI demande 13,3 Go et tourne à 157 tokens par seconde sur la 5060 Ti — c'est un mélange d'experts, donc rapide malgré sa taille. Le Mistral Small 3 en réclame 15,9. Sur la 5070, ni l'un ni l'autre ne démarre.

ModèleMémoire requiseRTX 5060 Ti 16 GoRTX 5070 12 Go
Gemma 3 (4B)3,9 Go132 tokens/s197 tokens/s
Llama 3.1 (8B)6,8 Go70 tokens/s106 tokens/s
Gemma 3 (12B)9,0 Go46 tokens/s70 tokens/s
Phi-4 (14B)11,1 Go38 tokens/s58 tokens/s
gpt-oss 20B13,3 Go157 tokens/sne tient pas
Mistral Small 3 (24B)15,9 Go24 tokens/s, sans margene tient pas

Mémoire requise en Q4_K_M avec 8k de contexte. Les débits sont des ordres de grandeur dérivés de la bande passante, pas des relevés de banc d'essai — la méthode détaille le calcul.

Au-delà de trente tokens par seconde, l'écart ne se voit plus

C'est le point que les comparatifs de fréquences oublient. Le texte arrive déjà plus vite que vous ne le lisez bien avant que la carte n'atteigne ses limites : notre calculateur cesse de valoriser la vitesse au-delà de trente tokens par seconde, parce qu'au-delà, payer plus cher n'améliore plus rien d'observable.

Reprenez le tableau avec ce seuil en tête. Sur Phi-4, l'écart entre 38 et 58 tokens par seconde vous coûte 140 € et n'achète rien que vous puissiez percevoir. Les 24 tokens par seconde de Mistral Small 3 sur la 5060 Ti, en revanche, se sentent vraiment. Mais l'alternative sur la 5070 n'est pas « plus rapide » : c'est « pas du tout ».

Les 4 Go servent aussi à autre chose qu'aux gros modèles

La mémoire n'accueille pas que les poids. Le cache KV, qui retient la conversation en cours, grandit avec le contexte et vient s'ajouter. Un Gemma 3 12B demande 9,0 Go à 8k de contexte, et 10,7 Go à 32k. Sur la 5070, la marge tombe alors à 1,3 Go ; sur la 5060 Ti, il en reste 5,3.

L'option qui bat les deux : une 3090 d'occasion

Il faut la mentionner, parce qu'elle rend la question presque théorique. Une RTX 3090 24 Go se trouve autour de 700 € d'occasion, soit moins cher que les deux cartes neuves, avec 24 Go de mémoire et 936 Go/s de bande passante. Plus de mémoire et plus de vitesse, pour moins d'argent.

Concrètement, elle fait tourner Gemma 3 27B à 43 tokens par seconde et Qwen3 32B à 36 — deux modèles qu'aucune des deux cartes neuves ne charge, à aucune vitesse.

Ce que ça coûte en contrepartie : aucune garantie constructeur, une consommation nettement supérieure, et une carte de 2020 dont vous ignorez le passé — beaucoup ont miné. C'est pour cette raison que nous ne la recommandons jamais dans nos verdicts d'achat : nous ne pouvons pas garantir un prix ni un état. Mais si vous savez ce que vous achetez et à qui, c'est le meilleur rapport capacité-prix du marché pour l'IA locale, et de loin.

Un dernier levier avant de trancher

Si votre choix se joue à un giga-octet près, sachez que le cache KV se quantifie lui aussi, indépendamment du modèle. Un Gemma 3 12B à 32k de contexte passe de 10,7 à 9,6 Go en cache 8 bits. Sur la 5070, cette bascule fait passer la marge de 1,3 à 2,4 Go — assez pour rendre la configuration confortable au lieu de tendue.

Ce levier ne rattrape pas 4 Go d'écart, mais il déplace la frontière. Le détail de ce que coûte chaque quantification mérite une lecture avant de commander quoi que ce soit.

Et si la machine sert aussi à jouer

Le raisonnement s'inverse. En jeu, la mémoire vidéo ne fonctionne pas du tout comme en IA : quand elle manque, on baisse les textures d'un cran et l'image reste bonne, alors qu'un modèle qui déborde ne tourne tout simplement plus. La 5070 et sa bande passante supérieure reprennent donc l'avantage sur un usage mixte à dominante jeu.

Le seuil à partir duquel les 8 ou 12 Go deviennent limitants en jeu dépend surtout de votre résolution : nous l'avons détaillé dans 8 Go de VRAM, est-ce encore suffisant ? et dans le choix de la résolution. Si votre machine joue trois soirs sur quatre et fait tourner un modèle le quatrième, prenez la 5070 sans hésiter.

Comment vérifier avant de commander

Ne vous fiez pas à la taille annoncée d'un modèle : un « 14B » ne pèse pas 14 Go, et le cache KV s'ajoute par-dessus selon le contexte que vous utilisez réellement. Deux réflexes suffisent à éviter l'erreur d'achat.

  • Partez du modèle, pas de la carte. Listez les deux ou trois modèles que vous voulez faire tourner, entrez-les dans le calculateur, et regardez laquelle des deux cartes les encaisse.
  • Prenez le contexte que vous utilisez vraiment. Beaucoup restent à 4k ou 8k. Si vous comptez donner des documents entiers à lire au modèle, montez à 32k dans le calculateur : le verdict change souvent.

En résumé

  • La 5070 est 50 % plus rapide sur tout ce qui tient dans ses 12 Go, sans exception.
  • La 5060 Ti coûte 140 € de moins et charge deux modèles de plus, dont gpt-oss 20B.
  • Au-delà de trente tokens par seconde, l'avance de la 5070 ne se perçoit plus.
  • Pour l'IA, prenez les 16 Go. Pour jouer uniquement, la 5070 reste devant.

Le verdict dépend du modèle que vous visez. Entrez le vôtre et comparez les deux cartes sur vos propres chiffres.

Ouvrir le calculateur