Publié le 15 juillet 2026 · prix de référence, vérifier avant de budgétiser
Chaque comparaison des coûts LLM que vous avez vue ignore probablement la mise en cache. C'est une erreur, car la mise en cache rapide modifie le classement des coûts. Claude facture des frais d'écriture ; Ce n’est pas le cas d’OpenAI. Les coûts de mise en cache contextuelle de Gemini par heure stockée. Voici le vrai calcul.
| Fournisseur | Type de cache | Coût d'écriture du cache | Coût de lecture du cache | Durée de vie du cache | Jetons minimum |
|---|---|---|---|---|---|
| Anthropique (Claude) | Cache de préfixe d'invite | 1,25 × entrée standard | 0,10× entrée standard | 5 minutes (extensible) | 1,024 |
| OpenAI (GPT-4o) | Cache automatique | Pas de frais d'écriture | 0,50× entrée standard | ~5 minutes | 1,024 |
| Google (Gémeaux) | Cache contextuel | Pas de frais d'écriture | 0,25× entrée standard | Facturé à l'heure stockée | 32,768 |
Principales différences structurelles :
| Modèle | Entrée $/1M | Production $/1M |
|---|---|---|
| Claude Sonnet4 | $3.00 | $15.00 |
| GPT-4o | $2.50 | $10.00 |
| Gémeaux 2.5 Pro | $1.25 | $10.00 |
Sans mise en cache : Gemini 2.5 Pro est le moins cher en entrée (1,25 $ contre 2,50 $ contre 3,00 $). Mais une fois la mise en cache appliquée, la situation change.
Une application de production typique : vous disposez d'une invite système de 10 000 jetons (instructions + contexte + exemples) et vous envoyez 500 requêtes/jour. Chaque requête ajoute 300 jetons d'entrée utilisateur et récupère 400 jetons.
| Modèle | Entrée/demande (10 300 tok) | Sortie/demande (400 tok) | Mensuel (15 000 demandes) |
|---|---|---|---|
| GPT-4o | $0.02575 | $0.004 | $446 |
| Claude Sonnet4 | $0.0309 | $0.006 | $550 |
| Gémeaux 2.5 Pro | $0.012875 | $0.004 | $255 |
L'invite système de 10 000 jetons est mise en cache. Chaque requête suivante lit 10 000 jetons mis en cache + 300 nouveaux jetons d'entrée.
| Modèle | Lecture du cache /1M | Nouvelle entrée /1M | Mensuel | vs pas de cache |
|---|---|---|---|---|
| GPT-4o (cache automatique) | $1.25 | $2.50 | $204 | −242 $ (−54 %) |
| Claude Sonnet 4 + cache | $0.30 | $3.00 | $117 | −433$ (−79%) |
| Gemini 2.5 Pro + cache contextuel | $0.3125 | $1.25 | 58$* | −197$ (−77%) |
*Le cache contextuel Gemini facture également 4,50 $/heure pour 10 000 jetons stockés. Avec 1 instance de cache fonctionnant 24h/24 et 7j/7 : +3,24 $/mois de coût de stockage. Ajouté séparément ci-dessous.
À la première demande, Anthropic facture 1,25× pour écrire le cache. Pour une invite système de 10 000 jetons à 3,00 $/1 million : la première demande coûte 0,0375 $ contre 0,030 $ standard. Les 0,0075 $ supplémentaires sont récupérés après seulement 1,14 accès au cache. Si vous effectuez 500 requêtes/jour, cette prime d'écriture est insignifiante. Pour une utilisation intensive et à faible volume, cela s’additionne.
Le cache contextuel de Gemini offre 75 % de réduction sur les lectures – la plus grosse remise. Mais il facture à l’heure le contenu stocké, quel que soit le trafic. Pour un cache de 10 000 jetons fonctionnant 24h/24 et 7j/7 :
Pour les cas d'utilisation à grande échelle (assistant de base de code, analyse de documents), le coût de stockage de Gemini peut éroder l'avantage de la remise sur le cache. Calculez les deux termes avant de supposer que les Gémeaux gagnent.
| Cas d'utilisation | Meilleur choix | Raison |
|---|---|---|
| Application à volume élevé, grande invite système fixe (> 2 000 jetons, > 200 demandes/jour) | Claude Sonnet4 | 90 % de réduction sur le cache + aucun frais de stockage = total le plus bas à grande échelle |
| Trafic variable, demandes en rafale | GPT-4o | Pas de frais d'écriture, pas de frais de stockage, automatique – le plus indulgent |
| Contexte très volumineux (> 32 000 jetons) à volume élevé | Gémeaux 2.5 Pro | 75 % de réduction sur la lecture du cache ; coût de stockage faible par rapport aux économies d’intrants |
| Faible volume (<50 req/jour), petite invite | Gémeaux 2.0 Flash | Économies de mise en cache minimes ; Le prix brut de Flash gagne |
| Développement/test, utilisation imprévisible | GPT-4o mini | Moins cher à faible volume ; mise en cache automatique sans surcharge |
Pour comparer les fournisseurs avec mise en cache pour votre cas d'utilisation :
Ou utilisez simplement notre calculateur de coûts — définissez le nombre de jetons et les résultats reflètent les tarifs standard (la mise en cache s'applique automatiquement sur l'infrastructure du fournisseur).