Tout est tarifé par jeton
Les fournisseurs LLM ne facturent pas par requête ou par mot : ils facturent par jeton. Un jeton est un morceau de texte, environ ¾ de mot en anglais (environ 4 caractères). "APICostCalc est utile" représente environ 5 jetons. Le texte que vous envoyez (saisir) et le texte généré par le modèle (sortir) sont comptés et leur prix est généralement fixé différemment.
Calculateur du coût des jetons →Entrée vs sortie – la sortie est la plus chère
Sur presque tous les modèles, les jetons de sortie coûtent plus cher que les jetons d'entrée – souvent 3 à 5 fois plus – car la génération de texte nécessite plus de calcul que sa lecture. C’est pourquoi un chatbot qui écrit de longues réponses coûte bien plus cher qu’un chatbot qui classe le texte en un seul mot, même pour le même volume de requêtes.
| Inducteur de coûts | Effet sur la facture |
|---|---|
| Longue invite système envoyée à chaque appel | Les jetons d'entrée se multiplient par le nombre de requêtes |
| Réponses détaillées du modèle | Jetons de sortie – le type le plus cher |
| Contexte étendu (morceaux RAG, historique) | Les jetons d'entrée ballonnent rapidement |
| Modèles de raisonnement/« penser » | Jetons de raisonnement cachés facturés en sortie |
La fenêtre contextuelle est un plafond de coût, pas un espace libre
Un modèle fenêtre contextuelle (par exemple, 128 000 ou 1 million de jetons) est le maximum qu'il peut lire en même temps, mais chaque jeton que vous y insérez est facturé chaque appel. Placer un document entier dans son contexte pour chaque demande est pratique et coûteux ; c'est le problème que RAG et la mise en cache résolvent.
Coût de la fenêtre contextuelle →Coût du jeton de raisonnement →Pourquoi la même tâche varie 50 × entre les modèles
Les modèles Frontier peuvent coûter des dizaines de dollars par million de jetons ; modèles petits ou ouverts quelques centimes. Si un modèle bon marché gère la tâche avec une qualité acceptable, vous pouvez réduire les coûts d'un ordre de grandeur avec une seule ligne de configuration. La compétence fait correspondre la force du modèle à la difficulté de la tâche - voir le guide de réduction des coûts.
Comparez les prix des modèles →Questions fréquemment posées
Qu'est-ce qu'un jeton dans une API LLM ?
Un jeton est un petit morceau de texte traité par le modèle – en anglais, environ ¾ de mot ou environ 4 caractères. Les fournisseurs facturent par jeton à la fois le texte que vous envoyez (entrée) et le texte généré par le modèle (sortie).
Pourquoi les jetons de sortie coûtent-ils plus cher que les jetons d’entrée ?
La génération de texte nécessite plus de calculs que sa lecture, c'est pourquoi les fournisseurs facturent des jetons de sortie plus élevés, généralement 3 à 5 fois le taux d'entrée. Cela fait des réponses détaillées des modèles un facteur de coût majeur.
Une fenêtre contextuelle plus grande coûte-t-elle plus cher ?
Uniquement pour les jetons que vous utilisez réellement. La fenêtre a une capacité maximale, mais chaque jeton que vous placez dans le contexte est facturé pour chaque appel, donc l'envoi répété d'invites volumineuses devient rapidement coûteux.
Comment la même tâche peut-elle coûter 50 fois plus cher sur un seul modèle ?
Les prix des modèles par million de jetons varient énormément entre les modèles frontières et les modèles petits/ouverts. Si un modèle moins cher répond à votre barre de qualité pour une tâche donnée, le passage à ce modèle peut réduire les coûts d'un ordre de grandeur.
Référence éducative uniquement : les prix sont des estimations ; confirmer les tarifs actuels sur la page de tarification de chaque fournisseur.