Les jetons de sortie constituent la facture. La génération exécute une passe avant complète par jeton ; Le pré-remplissage traite l'intégralité de votre invite en parallèle pour environ un dixième de l'énergie par jeton. Une invite courte avec une réponse longue coûte bien plus qu'une invite longue avec une réponse courte - et la trace cachée d'un modèle de raisonnement compte comme sortie.
Même charge de travail, chaque classe de modèle
Volume de requêtes et forme de jeton identiques, acheminés vers différents niveaux. Le passage au niveau de raisonnement n’est pas progressif : il s’agit du facteur contrôlable le plus important dans un budget carbone d’inférence.
| Classe modèle | Tok de sortie Wh / 1k | kWh/mois | kg CO2e / mois | Coût d'énergie / mois |
|---|
Même charge de travail, chaque région
Calcul identique, énergie identique – seule la grille change. Il s’agit de la réduction d’émissions la moins chère disponible pour toute personne dont le fournisseur lui permet de choisir une région.
| Région | g CO2e / kWh | kg CO2e / mois | t CO2e / an | par rapport à votre région |
|---|
Pourquoi la répartition entrée/sortie est plus importante que le total des jetons
Presque toutes les tentatives d’estimation de l’énergie de l’IA multiplient le nombre total de jetons par un seul nombre par jeton, et c’est faux d’une manière qui compte. L'inférence du transformateur comporte deux phases avec des profils de coûts complètement différents. Prefill lit l'intégralité de votre invite en une seule passe fortement parallèle, donc une invite de 1 500 jetons coûte à peine plus qu'une invite de 150 jetons sur les piles de services modernes. Decode génère un jeton à la fois, chacun nécessitant un passage complet sur les poids du modèle, de sorte que la longueur de sortie met à l'échelle l'énergie de manière presque linéaire. La conséquence pratique est qu'ajouter plus de contexte dans une invite est relativement bon marché et laisser un modèle se promener coûte cher - exactement le contraire de l'intuition avec laquelle la plupart des équipes commencent, et le contraire de la façon dont la grille de prix est façonnée, puisque les fournisseurs facturent également les entrées à un prix réduit, mais loin d'être proche d'un 10×.
Le niveau de raisonnement est celui où les empreintes de pas vont mourir
La trace de pensée d'un modèle de raisonnement est générée. Il traverse le décodeur exactement comme le fait la réponse visible, mais il n'atteint jamais l'utilisateur. Une requête qui produit 200 jetons visibles après 2 000 jetons de délibération a généré 2 200 jetons, et si ce modèle est également d'un ordre de grandeur plus grand par jeton que l'alternative de niveau intermédiaire, l'énergie par requête peut être cinquante fois supérieure à celle de la même tâche répondue directement. Exécutez le tableau de classes de modèles ci-dessus avec votre propre volume et l'arithmétique est simple. Il s’agit également du levier le plus efficace : acheminer les demandes simples vers un niveau plus petit et réserver le raisonnement aux cas qui en ont besoin réduit à la fois la facture et l’empreinte. Taille qui commerce avec le calculateur d'économies de routage modèle, et vérifiez ce que vous coûtent les jetons de réflexion en dollars avec le calculateur de coût de jeton de raisonnement.
L’énergie est une erreur d’arrondi par rapport à ce que vous payez – et c’est là le point
L'exécution des numéros par défaut et l'électricité derrière deux millions de requêtes de niveau intermédiaire coûtent des dizaines de dollars, contre une facture API de plusieurs milliers. Personne ne change de fournisseur pour sauvegarder cela. La raison pour laquelle il faut le calculer est que le nombre de carbone, contrairement au coût de l’énergie, se retrouve dans une déclaration CSRD ou dans un questionnaire client où il doit être défendable, et de plus en plus dans les conversations d’approvisionnement où l’on demande à un fournisseur des émissions par unité de service. La ligne de région est celle sur laquelle agir : un calcul identique dans un réseau à faible émission de carbone émet un quinzième de ce qu'il émet dans un réseau à forte teneur en charbon, ce qu'aucune optimisation de modèle ne peut égaler. Si c’est l’obligation de divulgation elle-même qui vous a amené ici, évaluez le programme de gouvernance qui l’entoure en tenant compte des Calculateur des coûts de conformité à la loi européenne sur l’IA.