Publié le 30 juillet 2026 · prix de référence, vérifier avant de budgétiser
Ouvrez la feuille de prix et o3 et GPT-4.1 semblent identiques : tous deux 2,00 $ d'entrée, 8,00 $ de sortie par million de jetons. J'ai donc exécuté le même travail d'extraction sur les deux, m'attendant à la même facture. o3 est revenu 4,3× plus cher. Même entrée, même réponse visible, même tarif par jeton. L'écart est un élément de campagne que la plupart des gens ne voient jamais sur la page de tarification : les jetons de raisonnement.
Les modèles de raisonnement (o1, o3, o4-mini d'OpenAI et les modes de raisonnement de GPT-5) ne permettent pas d'accéder directement à une réponse. Ils génèrent d’abord une chaîne de pensée privée, puis une courte réponse visible. Vous ne voyez jamais la chaîne, mais vous en payez chaque jeton, au prix le plus bas. sortir taux. Lors d'une tâche où le modèle renvoie 400 jetons visibles, il peut graver discrètement 2 000 jetons de raisonnement supplémentaires en coulisses. Votre facture est calculée sur 2 400 jetons de sortie et non sur 400.
C'est tout le truc. Le prix de la vignette est honnête ; il décrit simplement le prix des jetons, et les modèles de raisonnement émettent beaucoup plus de jetons coûteux.
| Modèle | Saisir | Sortir | Taper |
|---|---|---|---|
| GPT-4.1 | $2.00 | $8.00 | Standard |
| o3 | $2.00 | $8.00 | Raisonnement |
| o4-mini moins cher | $1.10 | $4.40 | Raisonnement |
| o1 | $15.00 | $60.00 | Raisonnement |
| GPT-5 | $1.25 | $10.00 | Hybride |
Prenez une charge de travail réelle : 1 000 demandes/jour, chacun 800 jetons d'entrée et 400 jetons de sortie visibles. Exécutez-le pendant un mois (30 000 requêtes, 24 millions de jetons d'entrée, 12 millions de jetons de sortie visibles). Ajoutez maintenant la partie cachée. Dans mes propres courses de la série O, une tâche moyennement difficile se pose 1 500 à 2 500 jetons de raisonnement; J'en utiliserai 2 000 ici, ce qui ajoute 60 millions de jetons de sortie facturés en plus des 12 millions visibles.
| Modèle | Jetons de raisonnement/requête | Coût / mois |
|---|---|---|
| GPT-4.1 (pas de raisonnement) | 0 | $144 |
| o4-mini | ~2 000 | $343 |
| o3 | ~2 000 | $624 |
GPT-4.1 et o3 partagent une grille de prix, mais o3 facture 624 $ contre 144 $ - parce que 72 millions de jetons de sortie (12 millions visibles + 60 millions de raisonnement) parcourent le compteur de 8 $ au lieu de 12 millions. o4-mini est le juste milieu : moins cher par jeton, tout en payant la taxe de raisonnement, il atterrit donc à 343 $, soit plus du double d'un modèle sans raisonnement faisant le même travail visible.
OpenAI expose un reasoning_effort paramètre (minimal / faible / moyen / élevé). C'est le plus gros bouton de cette facture, et la plupart du code le laisse par défaut. Faites passer o3 d'environ 2 000 jetons de raisonnement à environ 400 et le même mois passe de 624 $ à 240 $. Même modèle, même tâche, un paramètre : une réduction de 62 %. Pour tout ce qui n'est pas véritablement un problème difficile en plusieurs étapes, un effort faible ou minimal réussit généralement l'évaluation et supprime discrètement la majeure partie de la taxe.
1. Ne cherchez pas un modèle de raisonnement par réflexe. L'extraction, la classification, le marquage, le routage et les résumés courts ne nécessitent pas de chaîne de réflexion. Un modèle standard au même prix coûte un quart de plus car il n’émet aucun jeton de raisonnement.
2. Si j'ai besoin de raisonnement, je définis reasoning_effort explicitement et commencez bas, en augmentant uniquement lorsqu'une évaluation prouve que la qualité de la réponse diminue.
3. J'ai lu le completion_tokens_details champ. La réponse de l'API se divise reasoning_tokens separately — that's where the money leaks, and it's invisible in a per-request "it returned 400 tokens" mental model.
4. Je parcours. Tâche bon marché → petit modèle standard. Tâche difficile → modèle de raisonnement à effort mesuré. Un simple routeur s'amortit en quelques jours ; voir les chiffres dans le Calculateur d'économies en cascade LLM.
Vous voulez le nombre exact de votre mélange de jetons ? Mettez votre entrée, sortie visible et une estimation réaliste basée sur un raisonnement dans le Calculateur de coût de l'API IA →, ou comparer les fournisseurs face à face dans le calculateur de coût de chatbot. Vous êtes nouveau dans la tarification des jetons ? Commencez à Découvrez : comment fonctionne la tarification des API.
Estimations de référence, juillet 2026. Le nombre de jetons de raisonnement dépend de la charge de travail et est tiré de nos propres exécutions, et non des chiffres du fournisseur – mesurez le vôtre. Non affilié à OpenAI.