Taux de réussite = part des requêtes qui trouvent l'invite déjà mise en cache. Les applications de longue durée et à volume élevé se situent entre 85 et 98 %.
coût d'entrée / mois (pas de mise en cache)
avec mise en cache
vous économisez / mois
réduction des coûts

Chaque modèle, classé par coût avec mise en cache

Même charge de travail, tous les modèles côte à côte. « Lecture en cache » est le prix d'un jeton réutilisé ; "écrire" est le coût unique pour le stocker.

ModèleSaisirLecture en cachePas de cache /moisAvec cache /moisEnregistré
⚠️ Estimation à partir des taux de référence par million de jetons (juin 2026). Les prix réels changent souvent et varient selon le modèle exact, le niveau et la région. Anthropic facture une prime d'écriture d'environ 25 % sur la création de cache, mais des lectures environ 90 % moins chères ; La mise en cache OpenAI est automatique, sans supplément d'écriture ; Gemini ajoute de petits frais de stockage par heure non modélisés ici. Confirmez toujours sur la page de tarification officielle de chaque fournisseur. · Signaler un prix obsolète →

Qu'est-ce que la mise en cache rapide

La plupart des applications LLM envoient le le même gros morceau de texte à chaque appel - une longue invite système, des définitions d'outils, un guide de style ou des documents récupérés dans un pipeline RAG. Normalement, vous payez le prix total d’entrée pour ces jetons à chaque fois. Mise en cache rapide permet au fournisseur de stocker ce préfixe fixe après le premier appel et de facturer un tarif fortement réduit pour le réutiliser. Sur Claude, un jeton mis en cache lit environ 10% du prix normal des intrants ; sur GPT et Gemini, l'entrée en cache concerne 25–50% moins cher. La seule exigence est que la partie mise en cache reste identique et à l'avant de l'invite - placez la partie variable (la question de l'utilisateur) en dernier.

Comment fonctionnent les mathématiques

Le calculateur divise chaque demande en deux parties. Le jetons d'invite réutilisés peut être mis en cache : sur un cache frapper ils facturent au tarif de lecture bon marché, sur un manquer ils facturent au taux d'écriture (légèrement plus cher) pour actualiser le cache. Le jetons frais - l'entrée réelle de l'utilisateur qui est différente à chaque fois - paie toujours le prix total de l'entrée et ne peut pas être mise en cache. Ton taux de réussite du cache décide du mélange : les caches expirent après quelques minutes d'inactivité (la durée de vie par défaut d'Anthropic est d'environ 5 minutes), de sorte que les applications à fort trafic constant maintiennent le cache au chaud et atteignent plus de 90 %, tandis que les applications en rafale ou à faible volume s'actualisent plus souvent et frappent moins. Essayez de réduire le taux de réussite à 50 % et regardez les économies diminuer – en mettant principalement en cache les récompenses. volume et un préfixe stable.

Quand la mise en cache en vaut la peine (et quand elle ne l'est pas)

La mise en cache est plus rentable lorsqu'un un contexte important et immuable se répète sur de nombreux appels: les chatbots RAG renvoyant les mêmes documents, les agents rejouant de longues définitions et historiques d'outils, ou tout produit avec une invite système lourde. Dans ces cas-là, il coupe régulièrement saisir coût de 50 à 90 %. C'est le cas rien pour les invites ponctuelles qui ne se répètent jamais, et peu si votre préfixe réutilisé est minuscule. Ça ne touche pas non plus sortir coût du jeton : mise en cache uniquement des entrées de remises. Pour modéliser l'image complète, y compris la sortie, utilisez le Estimateur du coût des applications d'IA ou le par modèle Claude / GPT-4o / Gémeaux calculatrices.

FAQ

Combien la mise en cache des invites permet-elle réellement d’économiser ?

Si 80 à 90 % de votre entrée est une invite fixe ou un contexte qui se répète, la mise en cache réduit généralement le coût total de l'entrée de 50 à 90 %. Les économies évoluent en fonction du volume et de la stabilité du préfixe réutilisé, et sont proches de zéro pour les invites qui ne se répètent jamais.

L'écriture du cache coûte-t-elle plus cher ?

Sur Claude, l'écriture du cache coûte environ 25 % de plus qu'un jeton d'entrée normal une fois, mais chaque lecture ultérieure coûte environ 90 % moins cher : elle est rentabilisée après environ deux accès. La mise en cache OpenAI est automatique sans supplément d’écriture. Gemini ajoute de petits frais de stockage par heure pour le contenu mis en cache.

Qu'est-ce qu'un taux de réussite du cache ?

La part des requêtes qui trouvent votre invite déjà stockée. Les caches expirent après quelques minutes d'inactivité, de sorte que les applications à fort trafic les maintiennent au chaud (90 %+) tandis que les applications en rafale ou à faible volume s'actualisent plus souvent et frappent moins.

La mise en cache réduit-elle le coût du jeton de sortie ?

Non. La mise en cache rapide ne réduit que les saisir (invite) côté. Les jetons de sortie/d'achèvement sont toujours facturés au tarif normal, donc une application bavarde et à réponse longue économise globalement moins qu'une application à réponse courte et à contexte lourd.

Outils et guides associés

Estimateur du coût des applications d'IA · Calculateur de coût RAG · Calculateur de coûts Claude · Calculateur de coût GPT-4o · Tarification OpenAI vs Claude vs Gemini · les coûts de l'API qui doublent votre facture

Hébergez votre projet :DigitalOcean — 200 $ gratuits ↗VPS Hostinger
Économies de coûts en matière d'IAOptimisation des coûts LLMPiste de niveau gratuitCalculateur d'économies de déviation pris en charge par l'IANiveaux d'API gratuits