Comment utiliser ce glossaire
Les pages de tarification des API et de l'IA regorgent de jargon qui cache ce que vous paierez réellement. Vous trouverez ci-dessous 40 des termes les plus courants, regroupés en Tarifs et jetons LLM, infrastructure et auto-hébergement, et modèles de facturation. Chaque définition est indépendante du fournisseur et axée sur l’aspect coût. Vous débutez avec la facturation LLM ? Commencez par notre comment fonctionne la tarification de l'API LLM guide, puis estimez un nombre réel avec le calculateur de coût symbolique.
Calculateur du coût des jetons →Tous les guides d'apprentissage →Tarifs et jetons LLM
- Jeton
- La petite unité de texte qu'un LLM lit et écrit – en anglais, environ ¾ de mot, soit environ 4 caractères. La facturation s'effectue par jeton, donc le nombre de jetons (et non le nombre de requêtes) détermine votre facture LLM.
- Jetons d'entrée
- The tokens you send to the model: your prompt, system instructions, conversation history and any attached context. Ils sont généralement les moins chers des deux tarifs, mais se multiplient rapidement lorsque vous renvoyez du contexte à chaque appel.
- Jetons de sortie
- Les jetons que le modèle génère dans sa réponse. Le prix de la sortie est presque toujours plus élevé que celui de l'entrée - généralement 3 à 5 fois - car la génération de texte coûte plus cher en calcul que sa lecture.
- Fenêtre contextuelle
- Le nombre maximum de jetons qu'un modèle peut prendre en compte à la fois (par exemple 128 Ko ou 1 M). Il s'agit d'un plafond de capacité, pas d'espace libre : chaque token que vous placez dans la fenêtre est facturé à chaque appel.
- Coût par million de jetons
- Les prix unitaires standard LLM sont indiqués en jetons ($/1M), répertoriés séparément pour l'entrée et la sortie. Multiplier votre volume mensuel de jetons par ces taux est le moyen le plus rapide d'estimer vos dépenses.
- Mise en cache rapide
- Stockage d'un préfixe d'invite répété (un long message système ou un document) afin qu'il ne soit pas retraité à chaque appel. Les entrées mises en cache sont facturées avec une remise importante (souvent de 75 à 90 %), ce qui réduit le coût des charges de travail répétitives.
- Jetons de raisonnement
- Les jetons de « réflexion » cachés que certains modèles génèrent avant leur réponse visible. Vous ne les voyez pas, mais ils sont facturés comme résultat – un facteur de coût majeur et facilement négligé dans les modèles de raisonnement.
- Jetons multimodaux
- Les images, l'audio et la vidéo sont convertis en équivalents de jetons pour la facturation. Une seule image haute résolution peut coûter des centaines, voire des milliers de jetons d'entrée, de sorte que les invites multimodales s'additionnent plus rapidement que le texte seul.
- Taux mixte
- Un prix moyen unique par jeton qui combine les taux d'entrée et de sortie en fonction de votre mix typique. Utile pour des estimations rapides, même si cela cache que la production représente la moitié la plus chère de la facture.
- API par lots
- Un point de terminaison asynchrone qui traite les tâches volumineuses dans un délai (souvent jusqu'à 24 heures) en échange d'une remise, généralement d'environ 50 %. Idéal pour les travaux non urgents comme la classification en vrac ou les intégrations.
- Intégrations
- Vecteurs numériques qui représentent la signification du texte, des images ou d'autres données afin qu'ils puissent être recherchés par similarité. Ils sont peu coûteux à générer par jeton et soutiennent la recherche sémantique et RAG.
- Réglage fin
- Formation continue d'un modèle de base sur vos propres exemples pour spécialiser son comportement. Cela ajoute un coût de formation initial et, sur les modèles hébergés, un taux d'inférence par jeton souvent plus élevé que le modèle de base.
- RAG (génération augmentée par récupération)
- Un modèle qui récupère uniquement les extraits pertinents d'une base de connaissances et les ajoute à l'invite, au lieu de placer des documents entiers dans leur contexte. Il supprime les jetons d'entrée tout en gardant les réponses ancrées dans vos données.
- Niveau de modèle (phare / intermédiaire / nano)
- Les fournisseurs proposent des familles de modèles avec différents niveaux de capacités et de prix : phare (le plus performant, le plus cher), milieu de gamme (équilibré) et nano/petit (le moins cher, le plus rapide). Faire correspondre le niveau à la difficulté de la tâche est le plus grand levier de coût.
- Température
- Un paramètre compris entre 0 et environ 2 qui contrôle le caractère aléatoire de la sortie. Cela affecte le style de réponse, pas directement le prix, mais des valeurs plus élevées peuvent produire des réponses plus longues ou plus variées qui modifient le coût du jeton de sortie.
- Appel de fonction/outil
- Laisser le modèle renvoyer une requête structurée pour exécuter l'un de vos outils ou API définis. Les définitions d'outils sont envoyées sous forme de jetons d'entrée à chaque appel, et les boucles d'outils en plusieurs étapes multiplient l'utilisation totale des jetons.
- Streaming
- Fournir le jeton de sortie du modèle par jeton au fur et à mesure de sa génération plutôt qu'en un seul bloc. Cela améliore la vitesse perçue et réduit le délai d’obtention du premier jeton, mais ne modifie pas le prix total du jeton.
- Distillation
- Former un modèle « étudiant » plus petit pour imiter un modèle « enseignant » plus grand. Le résultat est beaucoup moins cher par jeton tout en conservant une grande partie de la qualité sur un ensemble ciblé de tâches.
- Quantification
- Réduire la précision numérique des poids d'un modèle (par exemple de 16 bits à 4 bits) afin qu'il nécessite moins de mémoire et s'exécute plus rapidement. Pour les auto-hébergeurs, cela réduit le coût du GPU, généralement avec un petit compromis sur la qualité.
- Inférence
- Exécuter un modèle entraîné pour produire un résultat : l'acte pour lequel vous payez à chaque appel d'API. Le coût d'inférence évolue avec les jetons sur les API hébergées et avec le temps de calcul sur les GPU auto-hébergés.
Infrastructure et auto-hébergement
- Limite de débit (RPM / TPM)
- Les plafonds qu'un fournisseur applique par compte : RPM correspond aux requêtes par minute, TPM correspond aux jetons par minute. Le dépassement de l'un ou l'autre renvoie une erreur 429, la mise à l'échelle nécessite donc un traitement par lots, une mise en file d'attente ou un niveau supérieur.
- Limite de concurrence
- Le nombre maximum de demandes autorisées en vol en même temps. Il limite le nombre de tâches parallèles que vous pouvez exécuter et, sur les configurations auto-hébergées ou provisionnées, dimensionne directement le matériel pour lequel vous devez payer.
- TTFT / latence
- TTFT (time-to-first-token) correspond au temps écoulé avant l'arrivée du premier jeton de sortie ; la latence est le temps de réponse total. Ils façonnent l’expérience utilisateur et, sur les GPU loués, une latence plus longue signifie un calcul plus facturé par requête.
- Débit
- Combien de jetons ou de requêtes un système traite par seconde. Un débit plus élevé dessert davantage d'utilisateurs sur le même matériel, réduisant ainsi le coût par requête lorsque vous auto-hébergez ou réservez de la capacité.
- Base de données vectorielles
- Un magasin optimisé pour contenir des intégrations et les rechercher par similarité. Il alimente la recherche RAG et sémantique, et est généralement tarifé par vecteurs, dimensions et requêtes stockés plutôt que par jeton.
- GPU/VRAM
- Le processeur graphique et sa mémoire vidéo qui exécutent l'inférence de modèle. Un modèle doit tenir dans la VRAM pour être chargé, de sorte que les modèles plus grands nécessitent des GPU plus chers et avec plus de mémoire – le coût principal de l'auto-hébergement.
- Auto-hébergement
- Exécuter un modèle ouvert sur votre propre matériel ou sur du matériel loué au lieu d'appeler une API hébergée. Il supprime les frais par jeton mais ajoute des coûts fixes de GPU, d'ingénierie et de capacité d'inactivité qui ne sont rentables qu'en cas de volume élevé.
- Sortie/bande passante
- Les frais pour les données quittant le réseau d'un fournisseur de cloud. Faciles à oublier dans les budgets d’IA, les frais de sortie peuvent être importants lors du déplacement de grands ensembles de données, de médias ou de pondérations de modèles entre services ou régions.
- Démarrage à froid (sans serveur)
- Délai pendant lequel une fonction sans serveur ou un conteneur de modèle démarre à partir du mode veille avant de pouvoir répondre. Cela ajoute de la latence et, pour les grands modèles avec des temps de chargement longs, peut vous pousser vers une capacité toujours chaude qui coûte plus cher.
- Débit provisionné
- Réserver une quantité fixe et garantie de capacité de modèle moyennant un forfait horaire ou mensuel au lieu de payer par jeton. Il stabilise les coûts et la latence pour un trafic constant à volume élevé, mais gaspille de l'argent en cas d'inactivité.
- Spot ou à la demande
- Les instances à la demande sont disponibles à tout moment au prix fort ; Les instances ponctuelles (préemptives) utilisent la capacité disponible à un prix très réduit, mais peuvent être récupérées sans préavis. Spot convient aux tâches par lots interrompues et non aux services à latence critique.
- Utilisation engagée / capacité réservée
- Une remise en échange d'un engagement sur une dépense minimale ou sur du matériel spécifique sur un à trois ans. Cela réduit le taux effectif pour les charges de travail prévisibles, mais vous enferme.
- SLA (disponibilité)
- Un accord de niveau de service est la promesse contractuelle du fournisseur de disponibilité (par exemple 99,9 %) et des crédits dus s'il ne la respecte pas. Les niveaux SLA plus élevés coûtent généralement plus cher, mais sont importants pour la fiabilité de la production.
Modèles de facturation et de tarification
- Tarification par siège ou tarification basée sur l'utilisation
- Le tarif par siège facture un montant forfaitaire pour chaque utilisateur, quelle que soit son activité ; frais basés sur l'utilisation pour ce que vous consommez réellement (jetons, appels, calcul). Les sièges sont prévisibles ; l’utilisation évolue avec la demande et peut augmenter de manière inattendue.
- Crédits
- Solde prépayé que vous achetez et retirez lorsque vous utilisez un service. Les crédits facilitent la facturation mais peuvent expirer, et leur valeur unitaire masque parfois le prix réel par jeton ou par appel.
- Excédent
- Utilisation au-delà de l'allocation incluse dans votre forfait, facturée à un tarif distinct, souvent plus élevé. Les frais de dépassement sont une source courante de factures surprises lorsque le trafic dépasse le niveau auquel vous vous êtes inscrit.
- Niveau gratuit
- Une allocation gratuite (un crédit mensuel, des appels limités ou une fenêtre d'essai) pour vous permettre d'évaluer un service. C'est utile pour les tests mais rarement suffisant pour la production, et des limites ou des dates d'expiration s'appliquent.
- TCO (coût total de possession)
- Le coût total de fonctionnement d'une solution : pas seulement les frais d'API ou de GPU, mais également l'ingénierie, la surveillance, le stockage, la sortie et les frais généraux. La comparaison des hébergements hébergés et auto-hébergés n'a de sens que sur le coût total de possession, et non sur les tarifs globaux.
- Coût par utilisateur
- Vos dépenses totales en IA ou API divisées par les utilisateurs actifs. Il transforme l'utilisation brute en une unité économique que vous pouvez comparer aux revenus ou au prix de l'abonnement pour vérifier si une fonctionnalité est rentable.
- Balisage de la passerelle/du routeur
- Les frais qu'une passerelle IA ou un modèle de routeur ajoute au prix du fournisseur sous-jacent pour le routage, le repli, l'analyse ou la facturation unifiée. Pratique, mais la majoration peut augmenter considérablement votre coût effectif par jeton.
Questions fréquemment posées
Qu'est-ce qu'un jeton ?
Un jeton est le petit morceau de texte qu'un LLM lit et génère – en anglais, environ ¾ de mot, soit environ 4 caractères. Les fournisseurs facturent par jeton à la fois pour le texte que vous envoyez (entrée) et pour le texte produit par le modèle (sortie). C'est pourquoi le nombre de jetons, et non le nombre de demandes, détermine une facture LLM.
Qu’est-ce que la mise en cache rapide ?
La mise en cache des invites permet à un fournisseur de stocker un préfixe répété, tel qu'une longue invite système ou un document, afin qu'il ne soit pas retraité à chaque appel. Les jetons d'entrée mis en cache sont facturés avec une remise importante (souvent de 75 à 90 %), ce qui réduit les coûts pour les charges de travail qui renvoient le même contexte.
Que signifient TPM et RPM dans une limite de débit ?
Le RPM correspond aux requêtes par minute et le TPM aux jetons par minute – les deux plafonds qu'un fournisseur impose à votre compte. Appuyer sur l'un ou l'autre renvoie une erreur 429, de sorte que les applications à volume élevé doivent regrouper, mettre en file d'attente ou demander un niveau supérieur plutôt que d'assumer un débit illimité.
Référence éducative uniquement : les conditions de tarification et les remises varient selon le fournisseur ; confirmez les détails actuels sur la page de tarification de chaque fournisseur.