Publié 2026-08-12 · numéros de référence, vérifier avant de budgétiser
Exécutez le même travail de modération de contenu – 150 jetons de contexte d’entrée, une étiquette de 5 jetons à l’autre extrémité – via neuf modèles « bon marché » différents et la facture mensuelle se situe entre 59,50 $ et 1 750 $. Même travail, même volume, même rendement. Un spread 29x, et chacun de ces neuf modèles vous est présenté comme « l'option budgétaire » en fonction des documents du fournisseur que vous lisez.
Tiré de notre tableau de prix suivi (387 modèles) : chaque modèle coûte moins de 1 million de dollars de jetons d'entrée qu'un fournisseur commercialise actuellement pour des tâches à volume élevé et à faible latence : classification, extraction, modération, routage. 10 millions d'appels par mois, 150 jetons d'entrée et 5 jetons de sortie chacun, soit 1,5 milliard de jetons d'entrée et 50 millions de jetons de sortie au total.
| Modèle | Fournisseur | Entrée /1M | Sortie /1M | Mensuel (10 millions d'appels) |
|---|---|---|---|---|
| Nova Micro | Amazone | $0.035 | $0.14 | $59.50 |
| Ministral 3B | Mistral | $0.040 | $0.04 | $62.00 |
| Commande R7B | Adhérer | $0.0375 | $0.15 | $63.75 |
| Gemini 3.1 Flash-Lite | $0.050 | $0.20 | $85.00 | |
| GPT-5 nano | OpenAI | $0.100 | $0.40 | $170.00 |
| GPT-4.1 nano | OpenAI | $0.100 | $0.40 | $170.00 |
| GPT-4o mini | OpenAI | $0.150 | $0.60 | $255.00 |
| Claude Haïku 3.5 | Anthropique | $0.800 | $4.00 | $1,400.00 |
| Claude Haïku 4.5 | Anthropique | $1.000 | $5.00 | $1,750.00 |
| Prix de référence de notre tableau suivi, 387 modèles. Exemple concret : 10 millions d'appels/mois × 150 entrées + 5 jetons de sortie. Fixez le prix de votre propre volume sur le calculateur de coût de classification. | ||||
Nova Micro, Ministral 3B et Command R7B sont à moins de 7 % l'un de l'autre et aucun d'entre eux n'est un nom familier dans cette liste. Les deux SKU OpenAI nano représentent près de 3x Nova Micro. GPT-4o mini – probablement le modèle « bon marché » le plus recherché par la seule reconnaissance de la marque – est déjà 4,3x Nova Micro. Et la ligne Haiku de Claude, commercialisée comme le niveau budgétaire d'Anthropic, est plus proche de certains modèles de chat de niveau intermédiaire que de tout autre modèle sur ce tableau : 29,4x Nova Micro en entrée, 35,7x en sortie.
Chaque fournisseur propose un modèle bon marché, car chaque fournisseur a besoin d'une réponse à la question « que dois-je exécuter avec un milliard d'appels par mois ? ». Mais le prix bon marché est relatif au produit phare de chaque fournisseur, et non au marché. L'écart entre le produit phare d'Anthropic et Haiku et l'écart entre le produit phare d'Amazon et Nova-Micro sont tous deux de véritables réductions au sein de leurs propres catalogues - ils ne partent tout simplement pas du même endroit. Nova Micro a été construit par un fournisseur de cloud qui vend également le calcul en dessous, de sorte que le prix du modèle peut être plus proche du coût marginal. Claude Haiku hérite de la gravité des prix en étant positionné à côté de Sonnet et Opus, où « 10 fois moins cher que notre produit phare » atterrit toujours à 1/1 million de dollars parce que le produit phare lui-même est cher.
Rien de tout cela ne signifie que Haiku est un mauvais modèle pour un travail de classification : il s’agit souvent du modèle le plus précis, et la précision vaut la peine d’être payée lorsqu’une mauvaise étiquette coûte plus cher que la différence symbolique. Cela signifie que le « niveau budgétaire » est une affirmation concernant la propre gamme d'un fournisseur, et non une affirmation concernant le marché, et les deux sont constamment confondus dans les pages de prix et dans les fils de comparaison.
Pour une tâche véritablement volumineuse et peu complexe (filtrage du spam, routage d'intention, détection de PII, marquage des sentiments), commencez par Nova Micro, Ministral 3B ou Command R7B comme prix plancher, et non par la marque pour laquelle vous disposez déjà d'une clé API. Effectuez une véritable vérification de l'exactitude de vos données étiquetées avant de vous engager ; un écart de prix de 29x n'est une bonne affaire que si le taux d'erreur du modèle bon marché ne réduit pas les économies réalisées sur les coûts en aval (billets mal acheminés, indicateurs de modération manqués, mauvaises extractions nécessitant un examen humain). Si la précision de votre tâche spécifique ne tient pas en dessous de GPT-4o mini ou Haiku, c'est le prix réel de la tâche – pas 59,50 $, ni 1 750 $ par défaut non plus. Évaluez votre propre mélange et volume de jetons sur le calculateur de coût de classification ou le calculateur de coût de modération de contenu, et comparez les files d'attente complètes sur le page API LLM la moins chère.
Méthodologie : prix issus de notre tableau de tarification suivi (387 modèles) en août 2026, correspondant aux tarifs publiés par 1 million de jetons de chaque fournisseur. L'exemple utilisé utilise un ratio de jetons construit de 150 entrées/5 sorties typique des appels de classification courts, et non la télémétrie d'un système de production : confirmez la combinaison de jetons de votre propre charge de travail et le tarif actuel de chaque fournisseur avant de budgétiser.