HomeBlog › Coût de l'historique des conversations

Pourquoi le message 30 coûte près de 7 fois plus que le message 1

Publié 2026-07-08 · numéros de référence, vérifier avant de budgétiser

Lorsque vous créez un chatbot avec n'importe quelle API LLM, chaque message que vous envoyez inclut le historique complet des conversations comme entrée. Pas seulement la dernière question de l'utilisateur : tous les tours précédents, chaque réponse de l'assistant, tout. C'est ainsi que les LLM maintiennent le contexte. C'est aussi ainsi que vos coûts se transforment en quelque chose de surprenant.

Au message 30 d’une seule conversation, le nombre de jetons d’entrée est passé d’environ 1 150 jetons à plus de 11 000. À Jetons d'entrée de 5/1 million de dollars (Tarif GPT-4o), cette réponse vous coûte près de 7 fois plus que la première.

Les mathématiques derrière tout ça

Supposons que votre chatbot dispose d'une invite système de 1 000 jetons, que les utilisateurs envoient des messages contenant en moyenne 150 jetons et que le modèle répond avec environ 200 jetons à chaque fois. Au tour k:

input(k) = 1 000 (système) + (k−1) × (150 + 200) (tours précédents) + 150 (message actuel)

Cela simplifie à 800 + 350k. Le coût augmente linéairement à chaque tour, car chaque tour ajoute pour toujours 350 jetons à chaque appel futur.

TournerJetons d'entréeCoût des intrants (5 $/1 M)Coût total du tour
11,150$0.0058$0.009
52,550$0.0128$0.016
104,300$0.0215$0.025
207,800$0.039$0.042
3011,300$0.0565$0.060

Les prix sont des estimations de référence, juillet 2026. Signaler un prix obsolète →

Sortie : 200 jetons × 15 $/1 M = 0,003 $ par tour. Modèle : GPT-4o (prix de référence 5 $/15 $).

Le tour 30 coûte 0,060 $, le tour 1 coûte 0,009 $ – un 6,8× différence pour la même question utilisateur de 150 jetons et la même réponse de 200 jetons.

Combien coûte réellement une conversation de 30 tours

En additionnant les 30 tours : la contribution totale à travers la conversation est 186 750 jetons. Coût total :

Si l'API était sans état et que chaque appel envoyait uniquement le tour en cours (1 150 jetons entrants), les mêmes 30 tours coûteraient 30 × 0,009 $ = $0.27. The conversation history adds 0,75 $ de coût d'intrant supplémentaire — de l'argent dépensé pour relire ce que le modèle a déjà traité.

À grande échelle, c'est la facture

10 000 utilisateurs par jour, chacun effectuant en moyenne 15 tours :

Coût quotidienCoût mensuel
Conversations en 15 tours (avec historique)$1,840$55,200
Apatride (hypothétique, sans antécédent)$810$24,300
Frais généraux d’historique$1,030$30,900

La surcharge d'historique n'est pas un bug de facturation. Il s’agit du coût structurel de la création d’une IA conversationnelle sur une API qui évalue chaque jeton à chaque appel. La plupart des équipes le découvrent à l’arrivée de la facture de fin de mois.

Quatre façons de le gérer

1. Élaguez les anciens messages. Ne conservez que les N derniers tours (par exemple, 5 à 8). Fonctionne bien pour les assistants de questions-réponses factuels où l'ancien contexte compte rarement. Solution la moins chère, mise en œuvre en un après-midi. Compromis : le modèle oublie le contexte initial.

2. Compressez avec un résumé. Tous les 5 à 10 tours, appelez le modèle une fois pour résumer la conversation jusqu'à présent. Remplacez l'historique brut par le résumé. Coût : un appel supplémentaire par N tours. Avantage : la surcharge de l'historique reste presque stable quelle que soit la durée de la conversation.

3. Fenêtre coulissante avec filtrage sémantique. Conservez toujours les tours récents et incluez de manière sélective uniquement les tours plus anciens sémantiquement pertinents à l'aide des intégrations. Plus complexe mais préserve le contexte clé sans coût historique complet. Mérite d'être mis en œuvre à grande échelle pour les assistants de soutien ou de recherche.

4. Mise en cache rapide. Sur Claude et Gemini, marquer l'invite système statique comme pouvant être mise en cache offre une réduction de 50 à 90 % sur cette partie. Cela n'aide pas à l'historique croissant (qui est toujours unique), mais réduit les frais généraux fixes. À 0,0050 USD pour une invite système de 1 000 jetons par appel, sa mise en cache permet d'économiser environ 0,0045 USD par tour, ce qui est significatif sur des millions d'appels. Voir le calculateur d'économies de mise en cache rapide.

La base pratique

La plupart des chatbots de production devraient utiliser une fenêtre continue de 6 à 10 tours plus une passe de compression à un certain seuil. "Envoyer tout l'historique pour toujours" est une valeur par défaut raisonnable pour les prototypes. C'est un défaut coûteux pour la production.

Mettez vos propres numéros dans le calculateur de coût de l'historique des conversations pour voir exactement où va votre coût à travers les virages, comparer les modèles et estimer les économies de compression. La différence entre un historique de 30 tours et une fenêtre de 5 tours est souvent un coût inférieur de 60 à 70 % pour la même expérience produit.

FAQ

Pourquoi chaque message du chatbot coûte-t-il plus cher que le précédent ?

Chaque appel d'API renvoie l'historique complet des conversations sous forme de jetons d'entrée. Chaque tour ajoute le message de l'utilisateur et la réponse de l'assistant à tout ce qui suit – de sorte que la taille de l'entrée augmente linéairement avec le nombre de tours.

Comment empêcher les coûts de conversation d’exploser ?

La solution la plus pratique est une fenêtre déroulante : conservez uniquement les 5 à 10 derniers tours au lieu de tout l'historique. Pour les assistants où le contexte est important, le résumé périodique vous permet de compresser les anciens virages en un court paragraphe, en gardant le coût stable. Utilisez le calculateur de coût de l'historique des conversations pour modéliser les économies.

La mise en cache rapide aide-t-elle à couvrir les coûts de l’historique des conversations ?

Uniquement pour la partie statique (invite système, définitions d'outils). L'historique croissant est unique par conversation et ne peut donc pas être mis en cache. La mise en cache permet de réduire les frais généraux fixes – la partie variable de l’historique que vous payez malgré tout.

Quel est le coût total d’une conversation chatbot de 30 tours ?

Avec GPT-4o à 5 $/15 $ par million de jetons, une invite système de 1 000 jetons, des tours d'utilisateur de 150 jetons et des réponses d'assistant de 200 jetons : environ 1,02 $ au total. Le premier tour coûte 0,009 $, le dernier coûte 0,060 $, soit près de 7 fois plus.

Numéros de référence basés sur les tarifs GPT-4o, juin 2026 : vérifiez les tarifs actuels sur la page de tarification du fournisseur.

Déployez votre projet de chatbot

DigitalOcean — Crédit gratuit de 200 $ → VPS Hostinger →