L’effondrement des prix frontière, visualisé
Saisissez le prix par million de jetons pour le meilleur modèle de « classe frontière » généralement disponible à chaque date. Même niveau de capacité, à trois ans d’intervalle.
Pas le même modèle — le même classe de capacité. Cette distinction est toute l'histoire : les modèles ne deviennent pas moins chers, les niveaux de capacités le font, car les modèles plus récents font de la frontière d'hier une marchandise.
Chronologie de chaque événement majeur sur les prix
Le prix qui définit « l’IA coûteuse ». Une seule session de chat intensive pourrait coûter de l’argent. GPT-3.5 Turbo, à 2 $/2 $, était le cheval de bataille du volume.
Anthropic réduit le GPT-4 d'environ 60 % avec une fenêtre contextuelle de 100 000 — la première véritable pression sur les prix au niveau frontière.
La première grande coupe d'OpenAI. Plus rapide, contexte 128k et un tiers du prix. Le modèle est posé : chaque génération expédie mieux et moins cher.
Le menu à trois niveaux devient le modèle de l'industrie. Le haïku à 0,25 $ rend occasionnelles des charges de travail d'un million de jetons ; Opus fixe le plafond des primes.
Qualité proche de la frontière, deux ordres de grandeur inférieurs au prix de lancement du GPT-4. Déclenche une guerre des prix immédiate entre les fournisseurs chinois (Alibaba, ByteDance coupés en quelques jours) et réinitialise définitivement ce que signifie « bon marché ».
La moitié du prix de Turbo, multimodal inclus. Les intrants frontaliers sont désormais 6 fois moins chers que 14 mois plus tôt.
Mieux que GPT-3.5 Turbo à moins d’un tiers de son prix. Le « niveau budgétaire » surpasse désormais la frontière de 2023 dans la plupart des tâches.
Deuxième moitié en quatre mois. L’entrée Frontier a diminué de 12 fois depuis le lancement de GPT-4 – 17 mois.
Gemini 1.5 Flash passe de 0,35 $ à 0,075 $ d'entrée ; 1.5 Pro de 3,50 $ à 1,25 $. Google achète des parts de marché avec les réductions les plus fortes et soutenues de tous les grands fournisseurs.
Le contre-exemple à retenir : Anthropic a fixé le prix du nouveau Haiku 3,2 × au-dessus de son prédécesseur, arguant que ses capacités le justifiaient. La déflation est une tendance, pas une loi : les niveaux budgétaires peuvent être réévalués à la hausse lorsqu’un modèle surproduit.
Les modèles de raisonnement rétablissent le plafond et introduisent des coûts invisibles de « jetons de réflexion », dans lesquels vous payez pour une chaîne de pensée que vous ne voyez jamais. Un nouveau niveau premium est né aux prix 2023.
Le deuxième choc DeepSeek : raisonnement de classe o1 à une fraction du prix, pondérations ouvertes. Efface brièvement environ 600 milliards de dollars de la capitalisation boursière de Nvidia – au moment où les marchés prenant en compte cette inférence devenaient bon marché.
La plus grande réduction de pourcentage sur un modèle de raisonnement phare – o3 tombe à 2 $/8 $ du jour au lendemain, sous-cotant son propre petit frère et confirmant que le niveau de raisonnement suit la même courbe de déflation, juste plus rapidement.
Les modèles de classe Llama-4, Qwen et DeepSeek servis par Together, Fireworks, Groq et DeepInfra placent la capacité de niveau GPT-4 en dessous de 1 $ par million de jetons. Les modèles fermés Frontier (GPT-5,5 à 5 $, niveau Claude Opus) proposent des prix premium – mais l'écart qu'ils doivent justifier ne cesse de se creuser.
Ce que disent réellement trois années de données
1. Les niveaux de capacité se dégonflent d’environ 10 fois par an ; les modèles individuels sont rarement moins chers. Le prix catalogue du GPT-4o a été réduit deux fois, mais le mécanisme le plus important est le remplacement : le nouveau modèle est livré au niveau inférieur de l'ancien modèle. Budget pour le niveau, pas pour le nom du modèle.
2. Les prix des produits chutent plus lentement que les prix des intrants. La sortie du lancement de GPT-4 était 2 × entrée (60 $ contre 30 $) ; aujourd'hui, les ratios 4 à 5 × sont standard (GPT-4o : 10 $ contre 2,50 $). Les fournisseurs protègent la marge sur la génération. Si votre charge de travail est lourde de résultats – réponses longues, génération de code – votre déflation effective est nettement plus lente que ce que suggèrent les gros titres.
3. Des hausses de prix se produisent. Claude 3,5 Haiku (+220%) est le plus célèbre. Lorsqu’un « petit » modèle se compare à un modèle de niveau intermédiaire, son prix dépend de ses capacités et non de sa lignée. Ne codez jamais en dur l’hypothèse selon laquelle le niveau bon marché reste bon marché.
4. Les chocs viennent de l’extérieur. Les deux baisses discontinues (mai 2024, janvier 2025) provenaient de DeepSeek et non de la concurrence historique. La prochaine révision des prix viendra probablement aussi d’un endroit inattendu – ce qui plaide en faveur d’une plomberie indépendante du fournisseur plutôt que d’une intégration approfondie d’un seul fournisseur.
Ce que cela signifie pour votre budget
Actualiser les projections à long terme. Une fonctionnalité qui coûte aujourd'hui 10 000 $/mois en appels d'API coûtera vraisemblablement entre 1 et 3 000 $/mois pour la même qualité dans 18 mois. Les modèles économiques des unités d’IA qui semblent aujourd’hui marginaux fonctionnent souvent bien sur la courbe de déflation – et les contrats annuels engagés aux taux actuels combattent cette courbe.
Ré-achetez tous les trimestres. Le Tableau de comparaison de plus de 300 modèles reclasse chaque modèle en fonction de votre mélange de jetons réel. Quinze minutes par trimestre permettent régulièrement de réaliser des économies de 30 à 60 % en réduisant un niveau de charge de travail. Le calculateur d'économies de baisse de prix des prix exactement ce que vaut une migration.
Parcours par difficulté. L'écart 100× entre les prix des matières premières et les prix frontières est une opportunité : la plupart des requêtes de production n'ont pas besoin de frontière. Le calculateur de routage modèle montre le calcul du coût pondéré.