Outil gratuit · sans inscription
IA locale ou abonnement : à partir de quand est-ce rentable ?
Cochez vos abonnements réels, votre volume d'automatisation et la machine envisagée. Le graphique montre le mois où l'installation devient moins chère que la location — et vous dit franchement quand ce moment n'arrive jamais.
Précision honnête
Les performances des cartes graphiques affichées ici sont des extrapolations théoriques, pas des mesures sur banc : elles donnent un ordre de grandeur fiable, pas un chiffre garanti. Les prix des composants sont mis à jour régulièrement, mais un marché sous tension comme celui des cartes professionnelles peut les faire varier du jour au lendemain.
Abonnements, par siège
API à l'usage, au token
L'entrée et la sortie ne sont pas au même tarif : la sortie coûte cinq à six fois plus cher.
Le modèle sélectionné alimente la courbe. Le tableau chiffre le même volume chez chacun, pour comparer.
1Modèle à faire tourner
2Carte graphique et nombre
3Plateforme PC
Au-delà d'une machine, la capacité s'additionne mais la mise en service n'est facturée qu'une fois.
Choisissez un modèle, une carte et une plateforme.
Coût cumulé dans le temps
Cochez au moins un abonnement et composez une machine pour voir le point d'amortissement.
| Échéance | Cloud | Local | Écart |
|---|
Hypothèses et paramètres — tout est modifiable
Le moteur de capacité reprend le modèle physique du classeur : un LLM relit ses poids à chaque token, donc tok/s = bande passante effective ÷ (poids lus + cache KV du lot). On agrandit le lot tant que le débit par utilisateur reste au-dessus du seuil et que le cache KV tient en VRAM — le plus contraignant des deux fixe le nombre d'utilisateurs.
Dense contre MoE : un modèle dense relit tous ses paramètres, un MoE seulement les paramètres actifs — d'où un débit bien supérieur. En revanche l'empreinte VRAM reste celle de tous les paramètres, experts compris.
Multi-cartes : VRAM et bande passante s'additionnent, avec un rendement de 1 / 0,92 / 0,87 / 0,82 pour 1 à 4 cartes (surcoût du tensor-parallel sur PCIe, sans NVLink). L'empreinte des poids n'est pas dupliquée : le modèle est réparti sur le pool.
Quantization : Q4 ≈ 0,55 octet par paramètre, FP8 = 1, FP16 = 2. Cache KV par session = (KV_Go/1k ÷ 1000) × contexte × (précision ÷ 2).
Prix HT, septembre 2026, très volatils sous la pénurie GDDR7. Le bloc CONFIG en tête du script regroupe cartes, modèles, plateformes et abonnements.
Comment ce comparateur calcule la capacité
La plupart des calculateurs de coût vous demandent d'entrer un nombre d'utilisateurs. Celui-ci le calcule, à partir de la physique de l'inférence — et c'est ce qui change tout, parce que ce nombre dépend autant du modèle et de la longueur du contexte que de la carte graphique.
Un modèle relit ses poids à chaque token
Pour produire un mot, un grand modèle de langage doit relire ses paramètres depuis la mémoire vidéo. Le facteur limitant n'est donc pas la puissance de calcul mais la bande passante mémoire de la carte. D'où la formule qui pilote tout le comparateur :
tokens par seconde = bande passante effective ÷ (poids lus + cache KV du lot)
On agrandit le lot d'utilisateurs simultanés tant que deux conditions tiennent : le débit par personne reste au-dessus du seuil garanti, et le cache KV tient encore dans la mémoire vidéo. La plus contraignante des deux fixe le nombre d'utilisateurs — et le comparateur affiche laquelle, sous chaque case de la matrice.
Dense ou MoE : le levier le moins connu
Un modèle dense relit l'intégralité de ses paramètres à chaque token. Un modèle MoE (mélange d'experts) n'en active qu'une fraction — trois milliards sur trente, par exemple. À carte identique, le second sert deux à trois fois plus de monde.
En revanche son empreinte mémoire reste celle de tous ses paramètres, experts inactifs compris. Un MoE de 30 milliards occupe autant de mémoire qu'un dense de 30 milliards, mais tourne aussi vite qu'un modèle de 3 milliards. C'est le meilleur rapport capacité-prix du moment, et c'est invisible sur une fiche technique de carte graphique.
Ce que le calcul ne dit pas
Les débits sont des estimations dérivées de bancs publics, pondérées par un rendement réel de 0,75 — modifiable dans les hypothèses. Elles ne remplacent pas une mesure sur votre matériel avec vos documents. Le comparateur sert à savoir si l'idée mérite un devis, pas à signer un bon de commande.
Trois situations, trois réponses
Six personnes, du chat et rien d'autre
Six comptes à 25 € font 150 € par mois. Une machine à 9 000 € met plus de cinq ans à s'amortir, et l'entretien plus l'électricité mangent une bonne part de l'écart. L'abonnement est le bon choix, et le comparateur le dit sans détour.
Vingt personnes, dont huit en même temps
Vingt comptes font 500 € par mois, payés que les gens s'en servent ou non — c'est le point que personne ne mentionne. Une seule carte suffit pour tenir huit utilisateurs simultanés sur un modèle MoE. L'amortissement tombe généralement entre deux et trois ans, et l'écart se creuse ensuite.
Automatisation lourde, peu d'utilisateurs interactifs
C'est le cas où l'écart devient spectaculaire. Traiter des documents en masse coûte cher au token et ne coûte rien de plus sur une machine déjà payée. Poussez le curseur d'automatisation : la courbe des abonnements se redresse à chaque million de tokens, celle de l'installation ne bouge pas — jusqu'au palier où il faut ajouter une carte, que le comparateur affiche aussi.
Questions fréquentes
Combien coûte une IA installée en local ?
Entre 5 000 et 20 000 € HT pour une machine capable de servir une PME, selon la carte graphique et le nombre d'utilisateurs simultanés visés. S'ajoutent la mise en service, l'entretien annuel et l'électricité — tous les trois comptés dans ce comparateur. Le modèle lui-même ne coûte rien : les modèles à poids ouverts sont gratuits.
Combien d'utilisateurs une carte graphique peut-elle servir ?
Cela dépend surtout du modèle et de la longueur de contexte, pas seulement de la carte. Une même carte peut tenir trente personnes sur un modèle MoE en contexte court et deux sur un modèle dense de 70 milliards en contexte long. La matrice de cette page donne le chiffre pour chaque combinaison.
L'IA locale est-elle vraiment moins chère que ChatGPT ou Claude ?
Au-delà d'une quinzaine de comptes, ou dès qu'il y a de l'automatisation en volume, presque toujours. En dessous, presque jamais. Le seuil dépend de votre situation, et c'est précisément ce que cette page calcule. L'argument « moins cher » n'est d'ailleurs pas toujours le principal : la souveraineté des données pèse souvent davantage.
Mes données restent-elles vraiment chez moi ?
Avec une installation locale, les documents traités ne quittent pas votre réseau. C'est une différence de nature avec un abonnement, où chaque requête part sur des serveurs tiers, parfois hors d'Europe. Attention toutefois : une installation locale peut très bien appeler une API externe pour certaines tâches. C'est un choix d'architecture, pas une propriété automatique.
Quel matériel choisir pour faire tourner un modèle en local ?
La mémoire vidéo décide de ce qui rentre, la bande passante décide de la vitesse. Une carte avec beaucoup de mémoire mais peu de bande passante fera tourner de gros modèles lentement ; l'inverse fera tourner vite de petits modèles. Le comparateur indique, pour chaque configuration, laquelle des deux vous limite — c'est ce qui dit quoi acheter ensuite.
Les prix affichés sont-ils à jour ?
La date des relevés est indiquée en haut de la page. Les tarifs des cartes professionnelles sont très volatils. Toutes les valeurs sont modifiables dans les hypothèses si les vôtres diffèrent : le calcul se refait immédiatement.
Ce comparateur vous a donné une piste ?
Je suis Fabien Coët, et j'installe ces configurations chez des TPE et PME de l'Hérault et du Gard. Un audit précède toujours le devis : il n'y a pas d'installation type, et un chiffre sorti d'un tableau ne remplace pas une mesure sur vos documents et vos usages réels.
Vous êtes ailleurs en France ? Cette page reste libre d'usage, et les données du comparateur sont publiques : comparateur.json. Servez-vous.