Calculateur du coût de stockage du cache contextuel
✓ Dernière vérification : 2026-07-28· Mise en cache explicite Gemini/OpenAI· signaler un problème →
La mise en cache contextuelle explicite facture un frais de stockage par heure tant que le contenu mis en cache est actif – en plus des lectures moins chères – une taxe que les calculateurs de mise en cache habituels ignorent. Cela coûte le frais de stockage, le compare au lire les économies, et vous indique le lectures minimales et le durée de vie maximale au repos avant le stockage, tout le bénéfice est consommé.
—
économies nettes vs pas de cache
—frais de stockage
—lectures à l'équilibre
—durée de vie maximale au repos
Économies nettes en gardant le cache actif plus longtemps
Les économies de lecture sont fixées par le nombre de lectures que vous diffusez ; seuls les frais de stockage augmentent avec la durée de vie. Chaque ligne conserve les mêmes lectures mais une durée de vie plus longue : observez le net passer du vert au rouge une fois que le stockage dépasse les économies. La vie que vous avez choisie est marquée ; la dernière ligne rentable est le sweet spot.
Durée de vie
Frais de stockage
Lire les économies
Filet
La taxe laissée de côté par les calculateurs de mise en cache
Chaque guide de mise en cache des invites vous vend le même titre : les lectures en cache coûtent un dixième du prix normal, donc la mise en cache réduit votre facture de 90 %. C'est vrai pour les lectures. Ce n'est pas tout le projet de loi. La mise en cache de contexte explicite – celle dans laquelle vous téléchargez délibérément un gros contexte et récupérez une poignée à réutiliser – s'accompagne de frais de stockage qui s'exécutent sur une horloge et non sur l'utilisation. Gemini facture environ 4,50 dollars par million de jetons et par heure pour conserver le contenu 2.5 Pro en cache, donc un contexte de 100 000 jetons laissé en vie pendant une journée coûte environ 10,80 dollars en stockage avant que quiconque ne le lise. Sur un cache bien utilisé, c'est bien, car les économies en lecture l'éclipsent. Sur un cache qui reste pour la plupart inactif – un document sur lequel quelqu'un pourrait poser des questions, un contexte lié à une durée de vie généreuse « juste au cas où » – la ligne de stockage devient discrètement le plus grand chiffre sur la facture, et le cache perd de l'argent même si chaque lecture ressemble à une bonne affaire. Les deux questions qui déterminent réellement le nombre de lectures dont vous avez besoin avant que les économies ne couvrent le stockage et combien de temps vous pouvez laisser le cache actif avant que le compteur ne dépasse ces économies. Cette calculatrice répond aux deux. Si votre contexte se répète à chaque appel plutôt que de vivre dans un cache explicite, évaluez le cas implicite avec le calculateur d'économies de mise en cache rapide; pour évaluer la durée de vie courte ou longue par rapport à votre taux de réussite, utilisez le cache TTL et calculateur de taux de réussite; et pour voir si la prime d'écriture est un jour rentable, exécutez le calculateur de seuil de rentabilité en écriture de cache.
Il divise le coût en trois lignes. Stockage est des jetons mis en cache (en millions) multipliés par la durée de vie en heures multipliée par le taux de stockage - il fonctionne sur l'horloge, que vous lisiez ou non. Le chemin sans cache C'est ce que vous paieriez sans mise en cache : chaque lecture paie le prix d'entrée total pour l'ensemble du contexte. Le chemin du cache correspond à une écriture au prix d'entrée total, plus chaque lecture au prix mis en cache le moins cher, plus les frais de stockage. Les économies nettes correspondent au chemin sans cache moins le chemin du cache. Le lectures à l'équilibre est le plus petit nombre de lectures pour lequel les économies de lecture couvrent les frais de stockage ; le durée de vie maximale au repos est la durée maximale pendant laquelle vous pouvez conserver le cache en vie selon votre nombre de lectures avant que le stockage ne dépasse les économies réalisées. Il suppose une écriture du cache sur la fenêtre et ignore les jetons de sortie de requête, qui sont les mêmes sur les deux chemins ; Les prix réels du cache explicite et les planchers minimum de jetons varient selon le fournisseur, alors confirmez-les sur la page de tarification officielle.
Questions fréquemment posées
Quel est le coût du stockage du cache contextuel et pourquoi existe-t-il ?
La mise en cache explicite vous permet de télécharger une seule fois un contexte volumineux et stable et de le réutiliser à un prix de lecture bon marché au lieu de le renvoyer à chaque appel. Mais vous payez également des frais de stockage par heure aussi longtemps que le cache dure, utilisé ou non. Gemini facture environ 4,50 $ par million de jetons par heure sur 2.5 Pro, donc un cache de 100 000 jetons actif par jour coûte environ 10,80 $ en stockage avant toute lecture. Cette ligne de stockage est la taxe que les calculateurs de mise en cache ordinaires oublient.
Quel est le prix du stockage en cache contextuel ?
Taux en dollars par million de jetons par heure, multiplié par les jetons mis en cache (en millions), multiplié par les heures de vie. Gemini 2.5 Pro coûte ~ 4,50 $/M/heure, Flash ~ 1,00 $. Un cache de 100 000 jetons (0,1 M) pendant 24 heures sur Pro équivaut à 0,1 × 24 × 4,50 = 10,80 $. Cela dépend du temps et de la taille, et non de l'utilisation : un cache inactif continue de faire fonctionner le compteur, à l'opposé des lectures, qui ne coûtent que lorsqu'elles sont utilisées.
Combien de lectures avant de mettre en cache un contexte volumineux est rentable ?
Il suffit que les économies par lecture (prix total d'entrée moins prix mis en cache) dépassent les frais de stockage fixes. Pour un contexte Gemini Pro de 100 000 jetons vivant par jour, cela représente environ 117 lectures avant que les économies ne couvrent les 10,80 $ de stockage – en dessous, la mise en cache coûte plus cher que le prix fort de chaque appel. Le calculateur résout ce minimum en fonction de votre propre taille, de vos prix et de votre durée de vie.
Quand un cache de contexte inactif commence-t-il à perdre de l’argent ?
Une fois que ses frais de stockage dépassent les économies lues déjà mises en banque. Le stockage s'accumule toutes les heures, donc pour un nombre de lectures donné, il existe une durée de vie maximale au-delà de laquelle le cache passe de l'enregistrement à la gravure. À 200 lectures sur un cache Gemini Pro de 100 000, les économies absorbent environ 41 heures de stockage ; gardez-le en vie plus longtemps et vous payez pour stocker le contenu dont vous avez déjà collecté les avantages. Faites correspondre la durée de vie du cache au trafic réel, et non à la prudence.