Publié le 2 août 2026 · prix de référence de notre registre de 387 modèles, à vérifier avant de budgétiser
"Utilisez simplement le petit modèle" est le conseil standard en matière de coûts. J'ai finalement fixé un prix correct pour l'ensemble de notre registre de modèles et les conseils s'avèrent presque dénués de sens en eux-mêmes. Rétrograder un niveau dans la gamme Anthropic vous permet d'économiser 40%. Le même mouvement dans la gamme de Google enregistre 96%. Même décision, même quantité de travail d'ingénierie, résultats très différents, car l'écart entre le produit phare d'un fournisseur et son niveau bon marché n'est pas une constante. Il va de 1,7× à 24×.
Un mois, 200 millions de jetons d'entrée et 40 millions de jetons de sortie. Cela représente environ 250 000 requêtes avec 800 jetons entrants et 160 sortants – un produit de forme réelle effectuant une classification, des résumés et de courtes réponses au chat. Pas de mise en cache, pas de remise par lots, les chiffres restent donc comparables. Chaque prix ci-dessous provient de notre registre suivi (387 modèles, prix de référence pour juillet-août 2026).
| Famille | Étage | $/1M en | $/1 million de sorties | Mois |
|---|---|---|---|---|
| OpenAI | GPT-5.5 | $5.00 | $30.00 | $2,200 |
| GPT-5 | $1.25 | $10.00 | $650 | |
| GPT-5 mini | $0.40 | $1.60 | $144 | |
| GPT-5 nano le moins cher | $0.10 | $0.40 | $36 | |
| Anthropique | Claude Opus 4.8 | $5.00 | $25.00 | $2,000 |
| Claude Sonnet 4.6 | $3.00 | $15.00 | $1,200 | |
| Claude Haïku 4.5 | $1.00 | $5.00 | $400 | |
| Gémeaux 3.1 Pro | $2.00 | $12.00 | $880 | |
| Gémeaux 3.1 Flash | $0.10 | $0.40 | $36 | |
| Gemini 3.1 Flash-Lite | $0.05 | $0.20 | $18 | |
| xAI | Grok 4 | $3.00 | $15.00 | $1,200 |
| Grok 4 mini | $0.50 | $2.50 | $200 | |
| Recherche profonde | Recherche profonde V4 | $0.27 | $1.10 | $98 |
| Flash DeepSeek V4 | $0.14 | $0.28 | $39 | |
| Mistral | Mistral Grand | $2.00 | $6.00 | $640 |
| Mistral Petit | $0.10 | $0.30 | $32 |
Supprimez tout sauf le mouvement que la plupart des équipes envisagent réellement – le produit phare du niveau immédiatement inférieur :
| Se déplacer | Avant → après | Enregistré |
|---|---|---|
| Opus 4.8 → Sonnet 4.6 | 2 000 $ → 1 200 $ | 40% |
| DeepSeek V4 → Flash V4 | 98 $ → 39 $ | 60% |
| GPT-5.5 → GPT-5 | 2 200 $ → 650 $ | 70% |
| Grok 4 → Grok 4 mini | 1 200 $ → 200 $ | 83% |
| Mistral Grand → Petit | 640 $ → 32 $ | 95% |
| Gémeaux 3.1 Pro → Flash | 880 $ → 36 $ | 96% |
Quarante pour cent contre quatre-vingt-seize pour cent. Les deux « utilisent le modèle le plus petit ». L'un d'eux vaut un sprint de travail d'évaluation et une couche de routage ; l'autre vaut au mieux un après-midi, car vous passerez plus d'heures d'ingénieur à prouver que Sonnet est assez bon que les 800 $ que vous économisez.
Ce n’est pas Anthropic qui est avare de réductions. C'est le contraire : leur produit phare est devenu considérablement moins cher. Claude Opus 4.1 se trouve dans notre registre à $15/$75. Les Opus 4.5, 4.6 et 4.8 se trouvent tous à $5/$25 — une coupe 3× en haut de la gamme sans modification du prix Sonnet ou Haiku. Sur mon mois de 240 millions de jetons, Opus est passé de 6 000 $ à 2 000 $.
L’effet secondaire : l’écart Opus-Sonnet s’est effondré de 5× à 1,67×. La taxe de frontière chez Anthropic a pour la plupart cessé d'exister. OpenAI a fait la même chose sur un axe différent : o1 à 15 $/60 $ a été remplacé par GPT-5 à 1,25 $/10 $, de sorte que l'élément de campagne du modèle de frontière coûteux pour lequel les gens ont budgétisé en 2025 est désormais d'un ordre de grandeur différent.
Google est allé dans l'autre sens. Ils ont maintenu le prix Pro à 2 $/12 $ et ont poussé Flash-Lite à 0,05 $/0,20 $, de sorte que leur répartition interne est désormais la plus large de toutes les grandes familles. Rien dans tout cela n’est accidentel – c’est un pitch de routage.
Coûts Gemini 3.1 Flash $36 sur cette charge de travail. DeepSeek V4, que j'avais mentalement classé comme "l'option bon marché", coûte $98 – près de 3 fois plus. Et GPT-5.5 à 2 200 $ est 122× le prix de Gemini 3.1 Flash-Lite à 18 $ pour déplacer le même volume de jetons.
Je portais un classement mental des prix depuis deux ans. C'était faux dans les deux sens. La réputation des fournisseurs bon marché est en retard d'environ un an sur les prix réels, et les chiffres évoluent plus rapidement que le folklore.
1. Je vérifie l’écart entre les niveaux avant de construire le routeur. Si le produit phare vers mini est inférieur à 2 ×, une cascade ne vaut pas la complexité ou le budget d'évaluation - je prends le produit phare et consacre plutôt l'effort à la mise en cache rapide, ce qui réduit davantage.
2. Si l’écart est de 20×, je parcours de manière agressive. Le niveau bon marché gère la classification, l’extraction, le marquage et le routage. Le produit phare ne voit que ce qui échoue à un contrôle de confiance. Sur le spread de Google qui transforme 880 $ en quelque chose de proche de 60 $ avec un taux d'indexation de 10 % – l'arithmétique est dans le Calculateur d'économies en cascade LLM et le calculateur d'économies de routage modèle.
3. Je réévalue toute la gamme chaque trimestre. La retarification d'Opus a modifié les optimisations qui valaient la peine d'être effectuées, et je l'ai découvert des semaines plus tard. C'est ce que suivi des changements de prix c'est pour l'instant.
4. Je ne compare jamais uniquement sur le prix des intrants. La sortie exécute 4 × l'entrée à la médiane sur les 97 modèles de discussion propriétaires que j'ai vérifiés, et 6 × sur GPT-5.5 et Gemini 3.1 Pro. Un modèle bavard sur un taux d’entrée bon marché perd face à un modèle laconique sur un taux élevé plus souvent que prévu. Si votre application change de modèle, le coût de la migration compte également : consultez le calculateur de coût de migration de modèle.
Mettez votre propre jeton divisé dans le Calculateur de coût de l'API IA →, ou modéliser un produit complet dans le Estimateur du coût des applications d'IA et le calculateur de coût de chatbot. Vous êtes nouveau dans la tarification des jetons ? Commencez à Découvrez : comment fonctionne la tarification des API.
Estimations de référence, août 2026, tirées de notre registre de modèles suivis. Les prix changent sans préavis et excluent la mise en cache, les remises par lots et par volume — vérifiez auprès du fournisseur avant d'engager un budget. Non affilié à OpenAI, Anthropic, Google, xAI, DeepSeek ou Mistral.