—estimation forfaitaire naïve
—exposition aux surtaxes cachées
—économies si les requêtes longues sont supprimées
Exposition au supplément
—
Répartition des coûts selon votre charge de travail
Le prix des demandes courtes est normalement au taux de base ; les demandes longues évaluent la totalité de leur appel – entrée et sortie – au taux de falaise le plus élevé. La ligne naïve montre ce que supposerait une estimation forfaitaire, et la ligne tronquée montre le scénario dans lequel les demandes longues sont compressées juste en dessous du seuil.
| Rangée | Demandes | Coût/demande | Total |
|---|
Coût mixte par part de requêtes longues
Tout le reste est maintenu aux valeurs ci-dessus, balayé par la part des demandes qui dépassent le seuil. La ligne en surbrillance est la plus proche de votre paramètre actuel.
| Part hors seuil | Coût réel | Estimation naïve | Surtaxe |
|---|
Comment cela se connecte à d'autres outils
Ce calculateur évalue un mécanisme spécifique : un seuil de longueur fixe où le franchir retarifie l'intégralité d'une demande, pas seulement les jetons sur la ligne. C'est différent de notre calculateur de coût de fenêtre contextuelle, qui modélise un coût par jeton fluide et plat en fonction de la taille du contexte et n'a aucune logique de falaise ou de seuil - utilisez cet outil si le modèle que vous évaluez facture le même tarif quelle que soit la longueur de la demande. C'est également différent du Calculateur de prix de niveau LLM et Calculateur de niveau de service LLM, qui fixe le prix des niveaux de service Batch/Flex/Priorité basés sur la latence – un choix que vous faites par demande concernant la rapidité avec laquelle vous avez besoin d'une réponse, et non une conséquence de la durée de votre invite. Si vous souhaitez des tarifs Gemini généraux pour toutes les tailles de modèles sans que le mécanisme de falaise soit isolé, consultez le Calculateur de coût de l'API Gemini. Cette page existe car une vue plate par jeton du taux global de 1,25 $ de Gemini 2.5 Pro ne tient pas compte du coût réel une fois qu'une part d'une charge de travail dépasse 200 000 jetons d'entrée.
Comment fonctionne cette calculatrice
Le Calculateur de tarification échelonnée à contexte long (« Cliff ») divise votre volume de demandes mensuel en deux groupes à l'aide du part des demandes dépassant le seuil: demandes courtes, tarifées normalement au taux de base pour leurs jetons d'entrée et de sortie, et les requêtes longues, dont l'entrée dépasse le seuil de contexte et qui évaluent donc TOUT leur appel – chaque jeton d’entrée et de sortie – au plus haut taux long. Aux valeurs par défaut (10 000 requêtes/mois, 20 % au-dessus du seuil de 200 000 jetons, short = 60 000 entrées/2 000 sorties, long = 350 000 entrées/5 000 sorties, base 1,25 $/10 $, longue 2,50 $/15 $), cela fait 8 000 requêtes courtes à 0,095 $ chacune. (sous-total de 760 $) et 2 000 requêtes longues à 0,95 $ chacune (sous-total de 1 900 $), pour un coût mensuel réel mixte de $2,660.
Pour montrer ce qu'un calculateur forfaitaire normal manquerait, l'outil calcule également un estimation naïve qui applique le tarif de base à chaque demande, quelle que soit sa taille – avec une valeur par défaut de 1 735 $, ce qui signifie que le coût réel comporte un coût caché. exposition au supplément de 925 $, soit environ 53,3 % de plus que ce que le chiffre naïf suggère. Enfin, l'outil modélise un scénario de coupe: combien coûteraient les requêtes longues si elles étaient compressées juste en dessous du seuil (1 000 jetons en dessous) tout en conservant la même taille de sortie – aux valeurs par défaut qui réduisent suffisamment le coût des requêtes longues pour économiser $1,302.50 par mois, ce qui est le véritable avantage de maintenir les invites sous une falaise de prix plutôt que de simplement les réduire un peu.
Questions fréquemment posées
Qu’est-ce qu’une « falaise » de tarification à long terme ?
Une falaise de prix est différente de la tarification marginale ou échelonnée ordinaire, où seuls les jetons au-dessus d'un seuil coûtent plus cher tandis que tout ce qui est en dessous reste au taux de base. Avec une falaise, le franchissement du seuil retarifie la requête ENTIÈRE – chaque jeton d’entrée et de sortie de cet appel – et pas seulement les jetons sur la ligne. Cela signifie qu'une demande de 200 001 jetons d'entrée peut coûter beaucoup plus cher qu'une demande de 200 000 jetons exactement, et pas seulement une fraction de centime de plus pour ce jeton supplémentaire. Cette calculatrice modélise ce mécanisme spécifique, puisqu'une estimation plate normale par jeton le manque complètement.
Gemini 2.5 Pro retarifie-t-il vraiment l'ensemble de la demande ?
Oui. Tout appel d'API unique à Gemini 2.5 Pro dont l'entrée dépasse 200 000 jetons est facturé au taux le plus élevé de 2,50 $ par 1 million d'entrées / 15 $ par 1 million de sortie sur l'appel ENTIER - à la fois les jetons d'entrée et de sortie - et non un taux mixte ou marginal appliqué uniquement à l'excédent. Ceci est documenté dans les tarifs publiés par Gemini, mais il est facile de l'oublier lorsque vous estimez les coûts à partir du chiffre principal « 1,25 $ par million de jetons d'entrée », qui s'applique uniquement aux demandes égales ou inférieures au seuil de 200 000 jetons.
Pourquoi ma facture réelle est-elle supérieure à une simple estimation du nombre de jetons ?
Ce calculateur calcule ce qu'il appelle « l'exposition au supplément » : l'écart entre votre coût global réel et une estimation naïve qui applique le taux de base uniformément à chaque demande, quelle que soit sa taille. Cette estimation naïve sous-estime le coût réel chaque fois qu'une part réelle de vos requêtes dépasse le seuil de longueur, car elle n'a aucun moyen de savoir que ces requêtes longues seront entièrement retarifiées au niveau supérieur plutôt qu'aux jetons sur la ligne. Plus votre charge de travail dépasse le seuil, plus cet écart caché s’agrandit.
Comment puis-je réduire les coûts de cliff-pricing ?
Coupez vos invites pour rester juste en dessous du seuil. Une meilleure gestion du contexte (récupération au lieu de remplir des documents complets dans l'invite, résumer l'historique des conversations, supprimer le contexte obsolète) peut maintenir une demande sous la falaise et éviter complètement la retarification de l'ensemble de la demande. Étant donné que la falaise réévalue la demande complète plutôt que seulement les jetons excédentaires, une réduction assez faible de la taille de l'invite peut produire une économie beaucoup plus importante que ne le suggère le nombre de jetons à lui seul, précisément parce qu'elle évite de franchir la ligne plutôt que de simplement réduire ce qui se trouve d'un côté.