Les jetons de réflexion sont facturés au tarif de sortie et masqués de la réponse. Un appel p50 (typique) et un appel p99 (dur) sur le même modèle exécutent un code identique mais atterrissent très éloignés sur la facture. C’est l’écart – et non la moyenne – qui détruit un budget mensuel.

taxe de raisonnement (part de la pensée cachée)
coût / appel (typique)
mensuel (typique p50)
mensuel (queue p99)

Estimation naïve vs typique vs queue

La ligne « naïve » est ce que vous dit une simple calculatrice de jetons : elle ignore complètement la pensée cachée. L'écart par rapport à la ligne typique correspond à la prime de réflexion que vous paierez réellement ; l’écart par rapport à la rangée de queue constitue le risque budgétaire.

ScénarioJetons de réflexionCoût / appelCoût / moiscontre naïf

Bande budgétaire par gravité de la queue

L'ampleur de votre facture mensuelle peut varier en fonction du poids de la queue d'invite dure. Choisissez le multiple de queue qui correspond à la variabilité réelle de vos invites.

Queue multiplep99 jetons de réflexionCoût / appelCoût / mois
⚠️ Modèle de référence, juillet 2026. Les tokens de réflexion (raisonnement) sont facturés chez chaque fournisseur sortir taux de jeton et ne sont pas renvoyés dans la réponse. Le nombre de réflexions p50 et le multiple de queue sont vos estimations : extrayez les chiffres réels du tableau de bord d'utilisation de votre fournisseur, qui rapporte les jetons de raisonnement séparément. Les prix indiqués sont des tarifs de référence modifiables ; confirmez les tarifs en direct sur la page de tarification du fournisseur. · Signaler un prix obsolète →

Pourquoi un numéro unique au coût par appel repose sur des modèles de raisonnement

Un modèle non-raisonnement est proche du déterministe sur le coût : vous envoyez N jetons d'entrée, vous récupérez M jetons de sortie, vous multipliez par les taux et le tour est joué. Les modèles de raisonnement brisent cela. Entre l'invite et la réponse, le modèle gère une chaîne de pensée privée - le jetons de réflexion - et vous êtes facturé pour chacun d'entre eux au tarif de sortie même s'ils n'apparaissent jamais dans la réponse. Surtout, le décompte est dépendant des données: une classification simple pourrait en dépenser quelques centaines, une preuve complexe en plusieurs étapes ou un tour de planification d'outils agent pourrait en dépenser des dizaines de milliers. Ainsi, le véritable coût par appel n'est pas un nombre, c'est une distribution, et ne citer que sa médiane (p50) masque la partie de la distribution qui fait réellement exploser les budgets : la queue.

Le spread p50/p99 et la taxe de raisonnement

Le coût par appel est input×input_price + (visible_output + réflexion)×output_price. Gardez tout fixe, sauf la réflexion, et tout pivote sur cette seule variable. Au décompte typique, vous obtenez votre coût p50 ; multipliez la réflexion par un facteur de queue pour le cas d'invite difficile et vous obtenez p99. Avec un raisonnement approfondi, les deux peuvent être espacés de 3 à 5 fois, ce qui signifie que le même volume mensuel peut être facturé n'importe où sur cette bande en fonction uniquement de la difficulté des invites du mois. Le taxe de raisonnement - la fraction de la facture qui réfléchit plutôt que les commentaires que vous avez envoyés ou la réponse que vous avez reçue - efface régulièrement 70 à 80 % des charges de travail difficiles. Vous payez principalement pour du travail à domicile. Voir ce partage est généralement le moment où les équipes ajoutent une capacité de réflexion.

Comment rétrécir le groupe

Trois leviers le déplacent. Limitez l'effort de raisonnement ou les jetons de réflexion maximum afin que la queue ne puisse physiquement pas s'enfuir - cela échange un peu de qualité de réponse sur les invites les plus difficiles contre un plafond strict de coût. Itinéraire par difficulté : envoyez la majorité facile vers un modèle non-raisonnement bon marché et réservez le modèle de raisonnement aux invites qui en ont réellement besoin. Et surveillez le p99, pas la moyenne, car un lot d'invites dures soulève la queue bien avant qu'elle ne déplace la moyenne. Noter que mise en cache rapide coupe le côté entrée mais pas le côté réflexion, donc sur un trafic à fort raisonnement, le plafond de réflexion est le levier qui compte - associez-le au calculateur de jetons de raisonnement plat pour l'estimation ponctuelle et le calculateur de budget de boucle d'agent pour le cas en plusieurs étapes.

Hébergez votre projet :DigitalOcean — 200 $ gratuits ↗VPS Hostinger
Coût du jeton de raisonnementBudget de boucle d'agentCoût du jeton LLMComparez les prix des modèles d’IA

Échanges

BybitBinanceOKXKuCoinBitgetPorte.ioMEXIQUE

Outils et hébergement

📈TradingView🔒NordVPN💳 RévolutionHébergeur

Comment fonctionne cette calculatrice

Il évalue un appel de raisonnement comme input×input_price + (visible_output + thinking)×output_price par million de jetons, en calculant trois points : une estimation naïve qui ignore la réflexion, un appel typique (p50) à votre nombre de pensées typique et un appel de queue (p99) à p50 en pensant × votre multiple de queue. Il indique la taxe de raisonnement (la part de la réflexion sur la facture p50), les totaux mensuels typiques et extrêmes en fonction de votre volume d'appels, ainsi qu'un tableau de sensibilité sur les multiples extrêmes afin que vous puissiez voir la tranche budgétaire complète.

Questions fréquemment posées

Pourquoi les modèles de raisonnement sont-ils si imprévisibles en matière de budgétisation ?

Ils émettent des jetons de pensée cachés facturés comme sortie, et le nombre varie de quelques centaines sur une invite facile à des dizaines de milliers sur une invite difficile. Dimensionnez le budget pour un appel typique et la queue peut facturer 3 à 5 fois plus par appel.

Comment calculer le coût du jeton de raisonnement ?

Coût par appel = input×input_price + (visible_output + thinking)×output_price, par million de jetons. La réflexion est facturée au taux de production et est invisible et variable – estimez une valeur typique et un multiple extrême et évaluez les deux.

Qu'est-ce que la taxe de raisonnement ?

La part de votre facture qui est une réflexion cachée plutôt que la contribution ou la réponse. Lors d'appels lourds de raisonnement, il dépasse régulièrement 70 à 80 % : vous payez plus pour un travail de grattage que pour une conversation visible.