HomeAI APIs › Coût du jeton de raisonnement
coût mensuel réel
coût par demande
pensée cachée / mo
si tu as ignoré le raisonnement

Ce que coûte chaque effort de raisonnement

Même invite et même volume sur le modèle sélectionné — le multiplicateur de raisonnement fait toute la différence.

EffortJetons de raisonnementPar demandeMensuel
⚠️ Estimation de référence. Le nombre de jetons de raisonnement varie en fonction de la difficulté d'invite et des paramètres d'effort du fournisseur : lisez le nombre réel à partir de l'API. usage.reasoning_tokens (ou équivalent) pour votre propre trafic. Les taux ci-dessous sont des prix représentatifs des sorties/entrées de 2026 ; confirmer les prix actuels auprès de chaque fournisseur. · Signaler un prix obsolète →

Pourquoi la facture de votre modèle de raisonnement est plus importante qu'il n'y paraît

Un modèle de chat normal vous facture les jetons que vous envoyez (entrée) et les jetons qu'il réécrit (sortie). Un modèle de raisonnement ajoute une troisième catégorie invisible : jetons de réflexion il génère en interne pour résoudre un problème avant de composer la réponse que vous voyez. Vous ne recevez jamais ce travail, mais vous le payez : les fournisseurs le mesurent au taux de sortie, le niveau le plus cher. Le résultat est une facture qui peut être plusieurs fois supérieure à ce que prédit une estimation naïve « entrée + sortie visible », car sur une invite concrète, le modèle pourrait brûler 5 000 jetons de raisonnement pour produire une réponse de 400 jetons.

Cette calculatrice rend visible la moitié cachée. Entrez l'entrée et la sortie visible que vous attendez, choisissez un effort de raisonnement (ou saisissez le nombre exact de jetons de raisonnement dans le champ d'utilisation de l'API), et le prix des trois flux est calculé. Le « véritable coût mensuel » inclut la réflexion ; le chiffre « si vous avez ignoré le raisonnement » est le piège : le nombre que vous obtiendriez d'un compteur de jetons qui ne voit que l'invite et la réponse. L'écart qui les sépare est ce qui surprend les équipes à la fin du mois.

Les trois leviers du coût du raisonnement

1. Effort. La plupart des API de raisonnement exposent un contrôle faible/moyen/élevé (ou un budget symbolique). Passer de élevé à moyen pour des invites qui ne nécessitent pas de réflexion approfondie peut réduire de moitié la facture sans changement visible dans la qualité des réponses – le tableau ci-dessus montre la différence exacte pour votre charge de travail. 2. Routage. Le raisonnement vaut la peine d’être payé pour des tâches véritablement difficiles et un pur gaspillage pour les tâches faciles ; envoyez des requêtes simples à un modèle non raisonnant moins cher et réservez la réflexion aux durs. Dimensionnez la division avec le calculateur d'économies de routage modèle. 3. Conception rapide. Des invites plus claires et plus contraintes nécessitent moins d’exploration, elles génèrent donc moins de jetons de raisonnement – ​​un cas rare où de meilleures invites sont également des invites moins chères.

Comment l'utiliser

1. Choisissez un modèle de raisonnement et saisissez votre volume de demandes mensuel.
2. Entrez les jetons d’entrée typiques et de sortie visibles par demande.
3. Choisissez un effort de raisonnement ou sélectionnez « Manuel » et saisissez les jetons de raisonnement que vous avez mesurés.
4. Lisez le coût réel, voyez combien est la réflexion cachée et utilisez le tableau pour trouver le niveau d'effort qui correspond à votre budget.

Erreurs courantes

Budgétisation sur la production visible uniquement. Les jetons de réflexion sont généralement la moitié la plus grande – ignorez-les et votre prévision est erronée par multiples. Laissant l’effort en haut partout. Un effort élevé est un défaut, pas une exigence ; la plupart des invites n'en ont pas besoin. Comparaison d'un modèle de raisonnement à un modèle de chat sur le prix global. Même taux par jeton, nombre de jetons très différent : comparez le coût réel par demande et non par million. En supposant que la mise en cache facilite le raisonnement. Remises de mise en cache rapides répétées saisir; il ne fait rien pour les jetons de raisonnement fraîchement générés.

FAQ

Est-ce que je suis facturé pour des jetons que je ne peux même pas lire ?

Oui. Les modèles de raisonnement cachent les jetons de réflexion de la réponse mais les facturent néanmoins, au taux de sortie. L'API renvoie le décompte dans un champ d'utilisation afin que vous puissiez l'auditer.

Combien de jetons de raisonnement sont « normaux » ?

Il évolue avec effort et difficulté : environ 2 × la sortie visible avec un faible effort, ~ 5 × avec un effort moyen et 10–15 × + avec un effort élevé pour les problèmes difficiles. Mesurez votre propre trafic pour obtenir un multiplicateur exact.

Un modèle de raisonnement est-il toujours moins cher qu’un modèle de chat ?

Rarement sur le seul coût : le résultat est moins cher lorsqu'une tâche difficile nécessiterait autrement un modèle plus gros ou plusieurs tentatives. Pour les tâches faciles, un modèle sans raisonnement gagne à chaque fois en termes de prix.

Puis-je plafonner les dépenses de raisonnement ?

Sur de nombreuses API, oui – via le paramètre d'effort de raisonnement ou un budget explicite de jetons de réflexion. Le réduire est le principal levier de ce projet de loi; le tableau montre l'économie.

Estimation seulement. L'utilisation des jetons de raisonnement dépend de vos invites et du contrôle des efforts du fournisseur : vérifiez par rapport aux données réelles d'utilisation de l'API avant de budgétiser.

Hébergez votre projet :DigitalOcean — 200 $ gratuits ↗VPS Hostinger
Cloud et développementComparez plus de 300 prix de modèles d’IACalculateur de latence et de temps de réponse LLMCalculateur de coût de stockage de base de données vectorielleCalculatrice de mots en jetons