Comment fonctionne la tarification de l'API LLM

Jetons, entrée/sortie, fenêtres contextuelles : pourquoi la même tâche peut coûter 50 fois plus sur un modèle que sur un autre, expliquée simplement.

MaisonApprendre › Qu'est-ce qu'un jeton ? (Et pourquoi vous êtes facturé par cela)

Qu'est-ce qu'un jeton ? (Et pourquoi vous êtes facturé par cela)

Chaque fois que vous appelez un modèle IA, vous n'êtes pas facturé au mot, au personnage ou à la requête. Vous êtes facturé au jeton. Comprendre ce qu'est réellement un jeton est la chose la plus utile que vous puissiez apprendre avant d'essayer de contrôler les coûts de votre API.

Un jeton est un morceau de texte, pas un mot

Un jeton est l’unité qu’un modèle de langage lit et écrit. Il s’agit généralement d’un fragment de mot plutôt que d’un mot entier. Mots courts courants comme the ou and sont un seul jeton, mais les mots plus longs ou plus rares sont divisés en plusieurs morceaux. Par exemple, le mot tokenization pourrait être cambriolé token + ization, deux jetons.

Une règle générale largement utilisée pour l’anglais est la suivante : 1 jeton contient environ 4 caractères, soit environ 0,75 mot. Cela signifie que 1 000 jetons représentent environ 750 mots, et qu’une seule page de texte (environ 500 mots) représente environ 650 à 700 jetons. Ce sont des approximations, pas des garanties, car la répartition exacte dépend du tokenizer du modèle.

Les espaces, la ponctuation et les sauts de ligne comptent également. Même la structure invisible de votre invite consomme des jetons.

Pourquoi les modèles utilisent des jetons plutôt que des mots

Les modèles linguistiques ne comprennent pas directement les lettres ou les mots. Ils convertissent le texte en nombres et le jeton est le pont. Chaque jeton correspond à une entrée dans le vocabulaire du modèle, et le modèle effectue tous ses calculs sur ces pièces numérotées.

Cette conception permet à un modèle de gérer n'importe quelle langue, code, emoji ou mot inventé sans dictionnaire fixe de mots complets. Un terme technique rare que le modèle n'a jamais vu dans son ensemble peut encore être représenté comme une séquence de sous-pièces familières. Le compromis est que les textes, codes ou langues non anglaises inhabituels utilisent souvent plus de jetons par mot que la prose anglaise simple.

Les jetons d'entrée et les jetons de sortie ont un prix différent

Presque tous les fournisseurs facturent deux tarifs distincts : un pour jetons d'entrée (tout ce que vous envoyez, y compris votre invite, les instructions système et tout historique de conversation) et un pour jetons de sortie (tout ce que le modèle génère). Les jetons de sortie sont généralement plusieurs fois plus chers que les jetons d’entrée.

Voici un exemple illustratif pour montrer le mécanisme (chiffres inventés pour plus de clarté, pas de prix réels) : si l'entrée coûte 1 $ par million de jetons et la sortie coûte 5 $ par million de jetons, alors un appel envoyant 2 000 jetons d'entrée et recevant 500 jetons de sortie coûterait (2 000/1 000 000 x 1 $) + (500/1 000 000 x 5 $) = 0,002 $ + 0,0025 $ = 0,0045 $. Petit par appel, mais multiplié par des centaines de milliers d'appels et c'est important.

Pour voir côte à côte les tarifs réels par modèle, la comparaison des modèles et les pages /models répertorient les prix d'entrée et de sortie actuels pour chaque fournisseur afin que vous ne deviniez pas.

L'historique des conversations est facturé à chaque tour

La surprise la plus courante en matière de facturation est que les modèles de chat sont apatrides. Le modèle ne se souvient pas de vos messages précédents entre les appels. Pour garder le contexte, votre application renvoie l'intégralité de l'historique des conversations à chaque nouveau tour.

Cela signifie qu'une longue conversation devient plus coûteuse à chaque message, car la transcription croissante est renvoyée sous forme de jetons d'entrée à chaque fois. Une conversation de 20 messages peut envoyer silencieusement des dizaines de milliers de jetons d'entrée lors de son dernier tour. Si vos coûts grimpent lors de longues sessions, c'est généralement pour cela. La mise en cache rapide (couverte dans son propre guide) est un moyen d'atténuer ce problème.

Comment estimer votre facture avant de construire

Vous pouvez obtenir une estimation réalisable avec trois nombres : jetons d'entrée moyens par appel, jetons de sortie moyens par appel et nombre d'appels que vous attendez par jour ou par mois. Multipliez chaque nombre de jetons par son taux par jeton et additionnez-les.

  • Estimer le nombre de jetons en prenant un échantillon réaliste d'invite et de réponse, puis en divisant le nombre de caractères par 4, ou en utilisant un outil de tokenisation pour plus de précision.
  • Multiplier par le volume pour obtenir un chiffre quotidien ou mensuel.
  • Ajouter un tampon de 20 à 30 % pour les tentatives, les sorties plus longues que prévu et l'historique de discussion croissant.

Le calculateur de coût LLM fait ce calcul pour vous : branchez le nombre de jetons et le volume d'appels, choisissez un modèle et il renvoie un coût mensuel estimé afin que vous puissiez comparer les options avant d'écrire un code.

Des moyens pratiques pour utiliser moins de jetons

Une fois que vous pensez en jetons, les économies deviennent évidentes. Les invites du système Trim répètent textuellement les mêmes instructions à chaque appel. Résumez les anciennes conversations au lieu de les renvoyer dans leur intégralité. Demandez un résultat concis lorsque vous n’avez pas besoin de réponses longues, car les jetons de sortie coûtent le plus cher.

Choisir un modèle plus petit pour des tâches simples est souvent le plus grand levier, car la différence de prix par jeton entre un modèle phare et un modèle léger peut être 10 fois supérieure ou supérieure. Adaptez le modèle à la difficulté du travail plutôt que de choisir par défaut le modèle le plus puissant.

Questions fréquemment posées

Combien de jetons représente une phrase typique ?

Une courte phrase anglaise de 15 à 20 mots compte généralement entre 20 et 30 jetons. En règle générale, attendez-vous à environ 0,75 mot par jeton, le nombre de jetons est donc un peu supérieur au nombre de mots.

Dois-je payer pour les jetons dans la réponse du modèle ?

Oui. Les jetons de sortie sont facturés séparément des jetons d'entrée et sont généralement les plus chers des deux, de sorte que les réponses plus longues coûtent nettement plus cher.

Pourquoi les textes dans une autre langue que l'anglais coûtent-ils plus cher ?

La plupart des tokeniseurs sont optimisés pour l'anglais, de sorte que les autres langues et codes sont souvent divisés en plus de jetons par mot. La même signification peut coûter 1,5 à 2 fois plus de jetons dans certaines langues.

Uniquement éducatif – pas de conseils financiers.