Tout est tarifé par jeton
Les fournisseurs LLM ne facturent pas par requête ou par mot : ils facturent par jeton. Un jeton est un morceau de texte, environ ¾ de mot en anglais (environ 4 caractères). "APICostCalc est utile" représente environ 5 jetons. Le texte que vous envoyez (saisir) et le texte généré par le modèle (sortir) sont comptés et leur prix est généralement fixé différemment.
Calculateur du coût des jetons →Entrée vs sortie – la sortie est la plus chère
Sur presque tous les modèles, les jetons de sortie coûtent plus cher que les jetons d'entrée – souvent 3 à 5 fois plus – car la génération de texte nécessite plus de calcul que sa lecture. C’est pourquoi un chatbot qui écrit de longues réponses coûte bien plus cher qu’un chatbot qui classe le texte en un seul mot, même pour le même volume de requêtes.
| Inducteur de coûts | Effet sur la facture |
|---|---|
| Longue invite système envoyée à chaque appel | Les jetons d'entrée se multiplient par le nombre de requêtes |
| Réponses détaillées du modèle | Jetons de sortie – le type le plus cher |
| Contexte étendu (morceaux RAG, historique) | Les jetons d'entrée ballonnent rapidement |
| Modèles de raisonnement/« penser » | Jetons de raisonnement cachés facturés en sortie |
La fenêtre contextuelle est un plafond de coût, pas un espace libre
Un modèle fenêtre contextuelle (par exemple, 128 000 ou 1 million de jetons) est le maximum qu'il peut lire en même temps, mais chaque jeton que vous y insérez est facturé chaque appel. Placer un document entier dans son contexte pour chaque demande est pratique et coûteux ; c'est le problème que RAG et la mise en cache résolvent.
Coût de la fenêtre contextuelle →Coût du jeton de raisonnement →Pourquoi la même tâche varie 50 × entre les modèles
Les modèles Frontier peuvent coûter des dizaines de dollars par million de jetons ; modèles petits ou ouverts quelques centimes. Si un modèle bon marché gère la tâche avec une qualité acceptable, vous pouvez réduire les coûts d'un ordre de grandeur avec une seule ligne de configuration. La compétence fait correspondre la force du modèle à la difficulté de la tâche - voir le guide de réduction des coûts.
Comparez les prix des modèles →Exemple concret : nano vs flagship sur la même tâche
Dis que tu classifies 100 000 tickets d'assistance par mois. Chaque appel envoie environ 2 000 jetons d'entrée (texte du ticket + quelques invites de tir) et renvoie environ 500 jetons de sortie (étiquette + brève explication) - 200 millions de jetons d'entrée et 50 millions de jetons de sortie au total.
| Modèle | Coût des intrants | Coût de sortie | Total/mois |
|---|---|---|---|
| GPT-5 nano (0,10 $ / 0,40 $ par 1 million) | 200 millions × 0,10 $ = 20 $ | 50 millions × 0,40 $ = 20 $ | $40 |
| GPT-5.5 (5,00 $ / 30,00 $ par 1 million) | 200 millions × 5,00 $ = 1 000 $ | 50 millions × 30,00 $ = 1 500 $ | $2,500 |
Même tâche, même volume : le modèle phare coûte 62× plus que le modèle nano, uniquement à partir du prix par jeton. Pour une tâche limitée telle que la classification, tester si la précision d'un modèle bon marché efface votre barre vaut généralement plus que toute autre optimisation des coûts.
Calculateur de coûts GPT-5 →Erreurs courantes lors de l'estimation des coûts LLM
- Faire la moyenne des entrées et des sorties en un seul nombre de jetons. Étant donné que le prix de sortie est 3 à 5 fois plus élevé, leur mélange masque le coût réel d'un style de réponse verbeux.
- L'oubli de l'invite système est facturé à chaque appel. Une longue invite système ou un historique de conversation compte comme jeton d'entrée sur chaque demande, pas une fois par session.
- Analyse comparative par rapport à la mauvaise version intermédiaire. "GPT-5" et "GPT-5.5" peuvent avoir des prix plusieurs fois différents : vérifiez toujours l'ID exact du modèle que vous appellerez réellement, et non le nom de famille.
- Ignorer les jetons de raisonnement cachés. Les modèles de « réflexion » considèrent le raisonnement interne comme des jetons de sortie même s'il n'apparaît jamais dans la réponse visible — voir le calculateur de jetons de raisonnement.
Continuer à apprendre
Comment réduire votre facture LLM →Jetons vs requêtes →Comment choisir un LLM →Questions fréquemment posées
Qu'est-ce qu'un jeton dans une API LLM ?
Un jeton est un petit morceau de texte traité par le modèle – en anglais, environ ¾ de mot ou environ 4 caractères. Les fournisseurs facturent par jeton à la fois le texte que vous envoyez (entrée) et le texte généré par le modèle (sortie).
Pourquoi les jetons de sortie coûtent-ils plus cher que les jetons d’entrée ?
La génération de texte nécessite plus de calculs que sa lecture, c'est pourquoi les fournisseurs facturent des jetons de sortie plus élevés, généralement 3 à 5 fois le taux d'entrée. Cela fait des réponses détaillées des modèles un facteur de coût majeur.
Une fenêtre contextuelle plus grande coûte-t-elle plus cher ?
Uniquement pour les jetons que vous utilisez réellement. La fenêtre a une capacité maximale, mais chaque jeton que vous placez dans le contexte est facturé pour chaque appel, donc l'envoi répété d'invites volumineuses devient rapidement coûteux.
Comment la même tâche peut-elle coûter 50 fois plus cher sur un seul modèle ?
Les prix des modèles par million de jetons varient énormément entre les modèles frontières et les modèles petits/ouverts. Si un modèle moins cher répond à votre barre de qualité pour une tâche donnée, le passage à ce modèle peut réduire les coûts d'un ordre de grandeur.
Référence éducative uniquement : les prix sont des estimations ; confirmer les tarifs actuels sur la page de tarification de chaque fournisseur.