Publié le 15 juillet 2026 · prix de référence, vérifier avant de budgétiser
"Combien coûtera notre chatbot de support IA ?" est l’une des questions les plus courantes que nous rencontrons. La réponse varie de 23 fois selon le modèle et augmente plus rapidement que prévu à mesure que l’historique des conversations s’accumule.
| Modèle | $/1M en | $/1 million de sorties | Coût par conversation | 100 000 chats/mois | Annuel |
|---|---|---|---|---|---|
| Gémeaux 2.0 Flash | $0.10 | $0.40 | $0.0043 | $432 | $5,184 |
| GPT-4o mini | $0.15 | $0.60 | $0.0065 | $648 | $7,776 |
| Claude Haïku 4.5 | $0.80 | $4.00 | $0.0374 | $3,744 | $44,928 |
| GPT-4o | $2.50 | $10.00 | $0.1013 | $10,125 | $121,500 |
| Claude Sonnet4 | $3.00 | $15.00 | $0.1258 | $12,576 | $150,912 |
C’est là que la plupart des estimations de coûts des chatbots se trompent. Ils modélisent le coût par message avec un nombre de jetons fixe, mais en réalité, chaque message contient l'historique complet.
| Message # | Jetons d'entrée (y compris l'historique) | Jetons de sortie | Coût flash | Coût GPT-4o |
|---|---|---|---|---|
| 1 | 550 | 280 | $0.000167 | $0.00418 |
| 2 | 900 | 280 | $0.000202 | $0.00505 |
| 4 | 1,400 | 280 | $0.000252 | $0.00630 |
| 6 | 1,950 | 280 | $0.000307 | $0.00768 |
| 8 (finale) | 2,500 | 280 | $0.000362 | $0.00905 |
| Total (8 messages) | ~10 800 | ~2 240 | $0.0043 | $0.101 |
Toutes les requêtes d’assistance n’ont pas besoin du même modèle. Acheminez les requêtes vers différents niveaux :
Un simple classificateur d'intention (lui-même bon marché – Flash à ~ 0,002 $ par appel de routage) peut déterminer quel niveau gère chaque conversation.
Au lieu d'inclure la transcription complète dans chaque message, résumez la conversation après le message 4 et transmettez un résumé compressé (≈200 jetons) pour les messages 5+. Cela maintient le contexte stable plutôt que de croître de manière linéaire.
Effet : réduit les entrées moyennes par message de 1 350 à environ 600 jetons, soit une réduction de 55 % des coûts d'entrée. Sur GPT-4o : 10 125 $ → ~5 400 $/mois.
L'invite système et le contexte FAQ (400 jetons dans notre modèle) sont répétés dans chaque message. Anthropic et OpenAI proposent une mise en cache rapide : les jetons de préfixe répétés sont facturés entre 10 et 50 % du tarif normal après la première demande.
Si votre invite système contient 1 000 jetons et que vous la mettez en cache, vous économisez 90 % sur ces 1 000 jetons dans tous les messages suivants. Sur 100 000 chats × 8 messages = 800 000 messages, soit 800 millions de jetons × 0,10 $/1 million × 90 % = 72 $/mois économisés sur Flash uniquement. Sur GPT-4o, l’économie est plus importante en termes absolus.
| Échelle | Éclair | Mixte (routage) | GPT-4o |
|---|---|---|---|
| 10 000 chats/mois (démarrage) | $43 | $164 | $1,013 |
| 100 000 chats/mois (croissance) | $432 | $1,639 | $10,125 |
| 500 000 chats/mois (échelle) | $2,160 | $8,195 | $50,625 |
| 1 million de conversations/mois (entreprise) | $4,320 | $16,390 | $101,250 |
Avec 1 million de discussions/mois, la différence entre Flash et GPT-4o est de 97 000 $/mois, soit 1,16 million de dollars par an. Même si Flash nécessite 15 % de transmissions supplémentaires aux agents humains, les calculs favorisent presque toujours le niveau de modèle le moins cher.
C'est la vraie question, et cela dépend entièrement de votre cas d'utilisation. Pour Réponse aux FAQ, statut de la commande, politique de retour, informations d'expédition — Flash fonctionne de manière comparable à GPT-4o dans les évaluations contrôlées. Pour traitement nuancé des plaintes, dépannage en plusieurs étapes ou situations nécessitant un véritable raisonnement sur les cas extrêmes — les modèles frontières présentent un avantage mesurable.
L'approche pratique : exécutez Flash pendant 30 jours, mesurez le taux d'escalade et le CSAT, puis comparez-le à votre référence. Si le CSAT chute <1 point et que l'escalade augmente <5 %, le changement de modèle est justifié par les économies de coûts.
À 100 000 chats/mois avec 8 messages en moyenne : Gemini Flash ~432$, GPT-4o mini ~648$, Claude Haiku ~3 744$, GPT-4o ~10 125$. Le choix du modèle est le plus gros levier de coûts.
Chaque message inclut l'historique complet sous forme de jetons d'entrée. Le message 1 coûte environ 400 jetons d'entrée ; le message 8 coûte environ 2 500 – une augmentation de 6 fois pour le même résultat. Sans résumé des conversations, les coûts augmentent linéairement avec la durée de la conversation.
Pour les réponses aux FAQ, l’état des commandes et les questions relatives aux politiques – généralement oui. Pour un traitement nuancé des réclamations ou un dépannage complexe, évaluez d'abord. De nombreuses équipes utilisent Flash pour 60 à 70 % du volume et passent à un modèle frontière pour les cas extrêmes.
Trois leviers principaux : (1) le routage du modèle : utilisez Flash pour les requêtes simples, GPT-4o uniquement pour les requêtes complexes ; (2) résumé de la conversation : compressez l'ancien historique en environ 200 jetons ; (3) mise en cache des invites — Anthropic et OpenAI offrent des réductions de 50 à 90 % sur les préfixes d'invite répétés.