empilé / mois
prix catalogue / mois
économies totales
mixte $/1M

Cascade d'épargne - chaque levier agit sur ce que le dernier a laissé

Commencez au prix catalogue, appliquez la mise en cache rapide du côté entrée, puis l'API Batch au partage par lots, puis la remise engagée sur la totalité de la facture restante. La colonne de marche est ce que ce levier seul a supprimé ; la colonne en cours d'exécution est ce qui reste.

ScèneJ'ai enregistré cette étapeExécution mensuelle

Additif vs multiplicatif – le piège

L’ajout des trois remises globales surestime les économies, parfois au-delà de 100 %. La vraie pile multiplie ce que vous conservez à chaque étape. Cela montre l’écart entre vos chiffres.

MéthodeÉconomies réclaméesMensuel

Trois réductions le rendent rarement gratuit

Chaque guide de réduction des coûts LLM répertorie les mêmes leviers : mettez en cache vos invites, regroupez ce qui peut attendre, engagez-vous à dépenser pour une remise sur le volume – et chacun d'entre eux cite un pourcentage global. L’erreur est d’empiler ces pourcentages en les additionnant. Les réductions ne s’ajoutent pas, elles s’additionnent : chacun ne travaille qu’avec l’argent que le précédent a laissé derrière lui. Une remise de cache de 90 % qui ne touche que le côté entrée, une remise par lots de 50 % sur la part de trafic qui tolère la latence et une remise engagée de 15 % sur la facture ne totalisent pas 155 % de réduction : elles se multiplient en un nombre réel toujours moins impressionnant que la somme et toujours supérieur à zéro. Ce calculateur les applique dans l'ordre dans lequel ils se produisent (mise en cache au moment de la demande, lot à la soumission, engagement à la facturation) et fait descendre la facture en cascade afin que vous puissiez voir ce que chaque levier a réellement supprimé plutôt que ce que sa brochure promettait. Il expose également les pièges que cachent les gros titres : la mise en cache ne réduit que les jetons d'entrée, de sorte qu'une charge de travail lourde en sortie le ressent à peine ; Le lot ne s'applique qu'au trafic qui peut attendre, donc un produit interactif n'y achemine qu'une petite partie de son volume ; et certains fournisseurs ne vous permettront pas du tout de mettre en cache et de regrouper la même demande. Évaluez chaque levier individuellement avec le calculateur de mise en cache rapide, le calculateur d'API par lots et le calculateur de dépenses engagées - puis venez ici pour voir ce qu'ils font réellement ensemble et comparez le résultat avec l'ensemble calculateur d'optimisation des coûts.

Hébergez votre projet :DigitalOcean — 200 $ gratuits ↗VPS Hostinger
Mise en cache des invitesAPI par lotsDépenses engagéesOptimisation des coûts