Les jetons de sortie constituent la facture. La génération exécute une passe avant complète par jeton ; Le pré-remplissage traite l'intégralité de votre invite en parallèle pour environ un dixième de l'énergie par jeton. Une invite courte avec une réponse longue coûte bien plus qu'une invite longue avec une réponse courte - et la trace cachée d'un modèle de raisonnement compte comme sortie.
—kg CO2e / mois
—par demande
—coût de compensation / an à 85 $/t
Même charge de travail, chaque classe de modèle
Volume de requêtes et forme de jeton identiques, acheminés vers différents niveaux. Le passage au niveau de raisonnement n’est pas progressif : il s’agit du facteur contrôlable le plus important dans un budget carbone d’inférence.
| Classe modèle | Tok de sortie Wh / 1k | kWh/mois | kg CO2e / mois | Coût d'énergie / mois |
|---|
Même charge de travail, chaque région
Calcul identique, énergie identique – seule la grille change. Il s’agit de la réduction d’émissions la moins chère disponible pour toute personne dont le fournisseur lui permet de choisir une région.
| Région | g CO2e / kWh | kg CO2e / mois | t CO2e / an | par rapport à votre région |
|---|
⚠️ Estimation modélisée, pas une mesure. L'énergie par jeton n'est publiée par aucun fournisseur d'API majeur, les chiffres de classe ici sont donc des valeurs de référence d'un ordre de grandeur cohérentes avec les divulgations des opérateurs et la recherche publique sur l'énergie d'inférence ; la consommation réelle varie en fonction de la taille du lot, de la longueur de la séquence, de la quantification, de la génération et de l'utilisation du matériel. Les jetons d'entrée sont facturés à 10 % du taux de sortie pour refléter le pré-remplissage parallèle. Les intensités du réseau sont des facteurs de production moyens nationaux et ignorent les instruments basés sur le marché tels que les PPA et les REC, c'est pourquoi le chiffre déclaré par un opérateur sera généralement inférieur à cela. À utiliser à des fins d'échelle et de comparaison, et non à des fins de divulgation réglementaire. ·
Suggérer un meilleur facteur →
Pourquoi la répartition entrée/sortie est plus importante que le total des jetons
Presque toutes les tentatives d’estimation de l’énergie de l’IA multiplient le nombre total de jetons par un seul nombre par jeton, et c’est faux d’une manière qui compte. L'inférence du transformateur comporte deux phases avec des profils de coûts complètement différents. Prefill lit l'intégralité de votre invite en une seule passe fortement parallèle, donc une invite de 1 500 jetons coûte à peine plus qu'une invite de 150 jetons sur les piles de services modernes. Decode génère un jeton à la fois, chacun nécessitant un passage complet sur les poids du modèle, de sorte que la longueur de sortie met à l'échelle l'énergie de manière presque linéaire. La conséquence pratique est qu'ajouter plus de contexte dans une invite est relativement bon marché et laisser un modèle se promener coûte cher - exactement le contraire de l'intuition avec laquelle la plupart des équipes commencent, et le contraire de la façon dont la grille de prix est façonnée, puisque les fournisseurs facturent également les entrées à un prix réduit, mais loin d'être proche d'un 10×.
Le niveau de raisonnement est celui où les empreintes de pas vont mourir
La trace de pensée d'un modèle de raisonnement est générée. Il traverse le décodeur exactement comme le fait la réponse visible, mais il n'atteint jamais l'utilisateur. Une requête qui produit 200 jetons visibles après 2 000 jetons de délibération a généré 2 200 jetons, et si ce modèle est également d'un ordre de grandeur plus grand par jeton que l'alternative de niveau intermédiaire, l'énergie par requête peut être cinquante fois supérieure à celle de la même tâche répondue directement. Exécutez le tableau de classes de modèles ci-dessus avec votre propre volume et l'arithmétique est simple. Il s’agit également du levier le plus efficace : acheminer les demandes simples vers un niveau plus petit et réserver le raisonnement aux cas qui en ont besoin réduit à la fois la facture et l’empreinte. Taille qui commerce avec le calculateur d'économies de routage modèle, et vérifiez ce que vous coûtent les jetons de réflexion en dollars avec le calculateur de coût de jeton de raisonnement.
L’énergie est une erreur d’arrondi par rapport à ce que vous payez – et c’est là le point
L'exécution des numéros par défaut et l'électricité derrière deux millions de requêtes de niveau intermédiaire coûtent des dizaines de dollars, contre une facture API de plusieurs milliers. Personne ne change de fournisseur pour sauvegarder cela. La raison pour laquelle il faut le calculer est que le nombre de carbone, contrairement au coût de l’énergie, se retrouve dans une déclaration CSRD ou dans un questionnaire client où il doit être défendable, et de plus en plus dans les conversations d’approvisionnement où l’on demande à un fournisseur des émissions par unité de service. La ligne de région est celle sur laquelle agir : un calcul identique dans un réseau à faible émission de carbone émet un quinzième de ce qu'il émet dans un réseau à forte teneur en charbon, ce qu'aucune optimisation de modèle ne peut égaler. Si c’est l’obligation de divulgation elle-même qui vous a amené ici, évaluez le programme de gouvernance qui l’entoure en tenant compte des Calculateur des coûts de conformité à la loi européenne sur l’IA.
Coût de conformité à la loi européenne sur l’IAÉconomies de routage du modèleCoût d'inférence GPULLM auto-hébergé vs APILLM VRAM et concurrence
Comment fonctionne cette calculatrice
Ce calculateur estime le empreinte énergétique et carbone de votre charge de travail d'inférence d'IA plutôt que la facture API elle-même. Vous entrez vos demandes par mois, la classe de modèle et les jetons d'entrée et de sortie par demande pour établir le volume mensuel total de jetons, qu'il convertit en kilowattheures consommés et kilogrammes de CO2e émis. Les principaux facteurs déterminants sont la classe du modèle (les modèles plus grands consomment plus d'énergie par jeton), le volume de sortie (le raisonnement et les réponses longues multiplient l'empreinte), la région du centre de données et l'intensité carbone de son réseau, et le PUE, ce qui représente le refroidissement et les frais généraux au-delà des puces. Le tarif de l’électricité industrielle lui permet de fixer le prix de l’électricité sous-jacente, et votre facture mensuelle fournit un point de référence pour la comparaison.
Le compromis qui mérite d’être surveillé est jetons de sortie par rapport à la région: un modèle bavard ou un raisonnement lourd peuvent dominer la consommation d'énergie, de sorte que la réduction de la production inutile réduit souvent plus que n'importe quel changement d'infrastructure. Dans le même temps, la même charge de travail s'exécute dans un région à faibles émissions de carbone peut émettre une fraction de l’équivalent CO2 d’un réseau à forte consommation de charbon, même à kWh identique. Traitez les chiffres comme des estimations directionnelles, car le PUE réel, le mix réseau et l'énergie par jeton varient selon le fournisseur et l'heure, et utilisez-les pour comparer les options plutôt que comme mesures exactes.
Questions fréquemment posées
Quelle quantité d’énergie un appel d’API LLM consomme-t-il ?
Pour un modèle de taille moyenne produisant quelques centaines de jetons de sortie, les estimations publiées par les opérateurs situent une seule demande courte de l'ordre de quelques dixièmes de wattheure, soit à peu près ce qu'un ordinateur portable consomme en vingt secondes. Le nombre est dominé par les jetons de sortie, car la génération exécute l'ensemble du modèle une fois par jeton tandis que le pré-remplissage traite l'entrée en parallèle pour une petite fraction du coût par jeton. C'est pourquoi ce calculateur évalue les jetons d'entrée à environ un dixième du taux de sortie, et pourquoi une invite longue avec une réponse courte est beaucoup moins chère en énergie qu'une invite courte avec une réponse longue.
Pourquoi les modèles de raisonnement ont-ils une empreinte carbone si importante ?
Parce que la trace de raisonnement cachée est sortie. Un modèle de raisonnement qui réfléchit pour deux mille jetons avant d'écrire une réponse de deux cents jetons a généré 2 200 jetons de sortie, et non 200, et chacun d'entre eux coûte un passage complet dans un grand modèle. Le passage d'une charge de travail d'un modèle de taille moyenne à un modèle à longue chaîne de pensée avec le même volume de requête multiplie généralement l'énergie d'un ordre de grandeur, ce qui est visible immédiatement dans le tableau de comparaison des classes de modèles sur cette page. C'est également la raison pour laquelle la réduction de carbone la moins chère disponible pour la plupart des équipes consiste à éloigner les requêtes faciles du niveau de raisonnement plutôt que de modifier quoi que ce soit dans l'infrastructure.
La région du centre de données modifie-t-elle vraiment l’empreinte carbone de mon IA ?
Plus que tout autre levier unique. L’intensité carbone du réseau s’étend d’environ 40 grammes d’équivalent CO2 par kilowattheure dans les réseaux à forte composante nucléaire et hydroélectrique, comme en France et en Suède, à plus de 600 grammes dans les réseaux à forte composante charbon, soit un facteur quinze pour un calcul identique. Exécuter la même charge de travail dans une région à faibles émissions de carbone réduit les émissions de plus de 90 % sans toucher à une seule ligne de code, alors que le travail d'efficacité sur le modèle lui-même fournit rarement plus d'un facteur de deux ou trois. Le PUE est également important, mais sa répartition est beaucoup plus étroite, puisque les sites hyperscale modernes se regroupent entre 1,1 et 1,2 tandis que les salles d'entreprise plus anciennes se situent plus près de 1,6.