HomeBlog › La taxe de frontière

La taxe de frontière : supprimer un niveau de modèle permet d'économiser 40 % ou 96 % selon le vendeur

Publié le 2 août 2026 · prix de référence de notre registre de 387 modèles, à vérifier avant de budgétiser

"Utilisez simplement le petit modèle" est le conseil standard en matière de coûts. J'ai finalement fixé un prix correct pour l'ensemble de notre registre de modèles et les conseils s'avèrent presque dénués de sens en eux-mêmes. Rétrograder un niveau dans la gamme Anthropic vous permet d'économiser 40%. Le même mouvement dans la gamme de Google enregistre 96%. Même décision, même quantité de travail d'ingénierie, résultats très différents, car l'écart entre le produit phare d'un fournisseur et son niveau bon marché n'est pas une constante. Il va de 1,7× à 24×.

La charge de travail sur laquelle j'ai tout évalué

Un mois, 200 millions de jetons d'entrée et 40 millions de jetons de sortie. Cela représente environ 250 000 requêtes avec 800 jetons entrants et 160 sortants – un produit de forme réelle effectuant une classification, des résumés et de courtes réponses au chat. Pas de mise en cache, pas de remise par lots, les chiffres restent donc comparables. Chaque prix ci-dessous provient de notre registre suivi (387 modèles, prix de référence pour juillet-août 2026).

Ce que vous coûte réellement un niveau inférieur

FamilleÉtage$/1M en$/1 million de sortiesMois
OpenAIGPT-5.5$5.00$30.00$2,200
GPT-5$1.25$10.00$650
GPT-5 mini$0.40$1.60$144
GPT-5 nano le moins cher$0.10$0.40$36
AnthropiqueClaude Opus 4.8$5.00$25.00$2,000
Claude Sonnet 4.6$3.00$15.00$1,200
Claude Haïku 4.5$1.00$5.00$400
GoogleGémeaux 3.1 Pro$2.00$12.00$880
Gémeaux 3.1 Flash$0.10$0.40$36
Gemini 3.1 Flash-Lite$0.05$0.20$18
xAIGrok 4$3.00$15.00$1,200
Grok 4 mini$0.50$2.50$200
Recherche profondeRecherche profonde V4$0.27$1.10$98
Flash DeepSeek V4$0.14$0.28$39
MistralMistral Grand$2.00$6.00$640
Mistral Petit$0.10$0.30$32
⚠️ Tarifs de référence, août 2026. Vérifiez toujours sur la page du prestataire avant de budgétiser. Exécutez votre propre mélange de jetons via le Calculateur de coût de l'API IA. · Signaler un prix obsolète →

Le tableau en un abaissement est le plus intéressant

Supprimez tout sauf le mouvement que la plupart des équipes envisagent réellement – ​​le produit phare du niveau immédiatement inférieur :

Se déplacerAvant → aprèsEnregistré
Opus 4.8 → Sonnet 4.62 000 $ → 1 200 $40%
DeepSeek V4 → Flash V498 $ → 39 $60%
GPT-5.5 → GPT-52 200 $ → 650 $70%
Grok 4 → Grok 4 mini1 200 $ → 200 $83%
Mistral Grand → Petit640 $ → 32 $95%
Gémeaux 3.1 Pro → Flash880 $ → 36 $96%

Quarante pour cent contre quatre-vingt-seize pour cent. Les deux « utilisent le modèle le plus petit ». L'un d'eux vaut un sprint de travail d'évaluation et une couche de routage ; l'autre vaut au mieux un après-midi, car vous passerez plus d'heures d'ingénieur à prouver que Sonnet est assez bon que les 800 $ que vous économisez.

Pourquoi l'écart d'Anthropic est si étroit

Ce n’est pas Anthropic qui est avare de réductions. C'est le contraire : leur produit phare est devenu considérablement moins cher. Claude Opus 4.1 se trouve dans notre registre à $15/$75. Les Opus 4.5, 4.6 et 4.8 se trouvent tous à $5/$25 — une coupe 3× en haut de la gamme sans modification du prix Sonnet ou Haiku. Sur mon mois de 240 millions de jetons, Opus est passé de 6 000 $ à 2 000 $.

L’effet secondaire : l’écart Opus-Sonnet s’est effondré de 5× à 1,67×. La taxe de frontière chez Anthropic a pour la plupart cessé d'exister. OpenAI a fait la même chose sur un axe différent : o1 à 15 $/60 $ a été remplacé par GPT-5 à 1,25 $/10 $, de sorte que l'élément de campagne du modèle de frontière coûteux pour lequel les gens ont budgétisé en 2025 est désormais d'un ordre de grandeur différent.

Google est allé dans l'autre sens. Ils ont maintenu le prix Pro à 2 $/12 $ et ont poussé Flash-Lite à 0,05 $/0,20 $, de sorte que leur répartition interne est désormais la plus large de toutes les grandes familles. Rien dans tout cela n’est accidentel – c’est un pitch de routage.

Le numéro cross-fournisseur qui m'a énervé

Coûts Gemini 3.1 Flash $36 sur cette charge de travail. DeepSeek V4, que j'avais mentalement classé comme "l'option bon marché", coûte $98 – près de 3 fois plus. Et GPT-5.5 à 2 200 $ est 122× le prix de Gemini 3.1 Flash-Lite à 18 $ pour déplacer le même volume de jetons.

Je portais un classement mental des prix depuis deux ans. C'était faux dans les deux sens. La réputation des fournisseurs bon marché est en retard d'environ un an sur les prix réels, et les chiffres évoluent plus rapidement que le folklore.

Ce que je fais avec ça

1. Je vérifie l’écart entre les niveaux avant de construire le routeur. Si le produit phare vers mini est inférieur à 2 ×, une cascade ne vaut pas la complexité ou le budget d'évaluation - je prends le produit phare et consacre plutôt l'effort à la mise en cache rapide, ce qui réduit davantage.

2. Si l’écart est de 20×, je parcours de manière agressive. Le niveau bon marché gère la classification, l’extraction, le marquage et le routage. Le produit phare ne voit que ce qui échoue à un contrôle de confiance. Sur le spread de Google qui transforme 880 $ en quelque chose de proche de 60 $ avec un taux d'indexation de 10 % – l'arithmétique est dans le Calculateur d'économies en cascade LLM et le calculateur d'économies de routage modèle.

3. Je réévalue toute la gamme chaque trimestre. La retarification d'Opus a modifié les optimisations qui valaient la peine d'être effectuées, et je l'ai découvert des semaines plus tard. C'est ce que suivi des changements de prix c'est pour l'instant.

4. Je ne compare jamais uniquement sur le prix des intrants. La sortie exécute 4 × l'entrée à la médiane sur les 97 modèles de discussion propriétaires que j'ai vérifiés, et 6 × sur GPT-5.5 et Gemini 3.1 Pro. Un modèle bavard sur un taux d’entrée bon marché perd face à un modèle laconique sur un taux élevé plus souvent que prévu. Si votre application change de modèle, le coût de la migration compte également : consultez le calculateur de coût de migration de modèle.

Mettez votre propre jeton divisé dans le Calculateur de coût de l'API IA →, ou modéliser un produit complet dans le Estimateur du coût des applications d'IA et le calculateur de coût de chatbot. Vous êtes nouveau dans la tarification des jetons ? Commencez à Découvrez : comment fonctionne la tarification des API.

Estimations de référence, août 2026, tirées de notre registre de modèles suivis. Les prix changent sans préavis et excluent la mise en cache, les remises par lots et par volume — vérifiez auprès du fournisseur avant d'engager un budget. Non affilié à OpenAI, Anthropic, Google, xAI, DeepSeek ou Mistral.