Faire tourner l'IA chez vous
Ce qu'il faut comprendre avant d'acheter quoi que ce soit.
Un modèle de langage qui tourne sur votre machine ne facture rien, ne limite rien et n'envoie rien nulle part. Reste à savoir ce que votre matériel encaisse — et c'est là que la plupart des réponses disponibles en ligne se trompent, parce qu'elles ne comptent que le poids du modèle.
Pourquoi en local
Trois raisons, et une seule suffit
- Rien ne sort de chez vous
- Vos documents, votre code, vos brouillons restent sur votre machine. Pour tout ce qui touche à des données professionnelles ou personnelles, c'est souvent la seule raison qui compte.
- Aucun compteur
- Pas d'abonnement, pas de facturation au token, pas de limite quotidienne. Le coût est celui du matériel, une fois, plus l'électricité.
- Ça marche hors ligne
- Dans un train, sur un site sans réseau, ou le jour où le service que vous utilisiez change ses conditions. Un modèle téléchargé ne disparaît pas.
En échange, vous renoncez aux plus gros modèles. Un modèle de 8 à 30 milliards de paramètres tournant chez vous ne remplace pas les services en ligne sur les tâches les plus difficiles. Sur la rédaction, la reformulation, le résumé, la traduction et l'assistance au code courant, l'écart est bien plus faible qu'on ne l'imagine.
Avant d'acheter
Trois notions décident de tout le reste
Vous n'avez pas besoin de comprendre comment un modèle fonctionne. Vous avez besoin de comprendre ces trois-là, parce que ce sont elles qui déterminent ce que vous devez acheter.
- La quantification
- Compresser les poids du modèle pour qu'il tienne en mémoire. Q4_K_M divise le poids par près de quatre par rapport au format d'origine, pour une perte que la plupart des usages ne voient pas. C'est le premier levier, et de loin le plus efficace.
- Le cache KV
- La mémoire que le modèle garde pour se souvenir de la conversation. Elle grandit avec la taille du contexte, pas avec celle du modèle — et c'est elle qui fait dérailler les estimations qu'on trouve en ligne. Sur un gros modèle, passer de 8k à 32k de contexte peut coûter plus cher qu'un modèle entier de 8 milliards de paramètres.
- La bande passante
- Ce qui détermine la vitesse, et non la puissance de calcul. Un modèle qui tient tout juste en mémoire tourne ; un modèle qui déborde sur la mémoire système ralentit d'un facteur dix. C'est pourquoi une carte de 16 Go bat régulièrement une carte plus puissante de 12 Go.
Le minimum
À partir de quoi ça devient utilisable
8 Go de VRAM: de quoi faire tourner un modèle de 7 ou 8 milliards de paramètres en quantification Q4, avec un contexte court. C'est le ticket d'entrée, et c'est déjà utile.
16 Go: le vrai palier de confort. Des modèles de 14 milliards de paramètres, des contextes longs, et la génération d'images sans acrobaties.
24 Go et plus: les modèles de 30 milliards de paramètres, et les gros contextes sans y penser. Au-delà, on entre dans le domaine des machines à mémoire unifiée, où la capacité cesse d'être le problème et où c'est la bande passante qui limite.
Ces paliers sont des ordres de grandeur. Le nombre qui compte pour votre cas dépend du modèle, de la quantification et du contexte — c'est exactement ce que calcule notre outil.
L'outil
Chiffrer votre cas précis
Le calculateur additionne les quatre postes de mémoire et rend une réponse, pas une fourchette.
Par modèle
Les 24 modèles et ce qu'ils demandent.
OuvrirPar machine
Ce que chacune des 21 machines encaisse.
OuvrirLa formule
Le détail du calcul, poste par poste, à découvert.
Ouvrir