—dernier tour seul
—vs coût forfaitaire
—avec fenêtre/cache
Les coûts s'accélèrent avec le nombre de tours
Le coût par tour continue d'augmenter à mesure que l'historique s'accumule, de sorte que la courbe des coûts cumulés se courbe vers le haut - doubler les tours fait plus que doubler la facture.
| Au tour | Ce tour coûte | Cumulatif |
|---|
Vous payez pour l'historique à chaque tour
Un modèle de langage est sans état : il ne se souvient de rien entre les appels d'API. Ainsi, pour poursuivre une conversation, votre application renvoie l'intégralité de la transcription (invite système, chaque message utilisateur passé et chaque réponse passée) comme entrée de chaque nouvelle requête. Cela signifie que l’entrée augmente d’un échange à la fois et que le coût de l’ensemble de la conversation augmente à peu près du carré du nombre de tours, et non de manière linéaire. Le dernier tour d'une longue conversation est le plus coûteux car il contient le plus d'historique, et l'invite système fixe est facturée une fois par tour en plus. Trois leviers le font redescendre : un fenêtre coulissante qui ne conserve que les tours récents (le coût devient linéaire, au détriment de la mémoire), mise en cache rapide qui facture le préfixe répété à un prix très réduit, et résumer les anciens se transforme en un bref récapitulatif. Comparez une seule fenêtre sur le calculateur de coût de fenêtre contextuelle, dimensionnez la victoire de mise en cache sur le calculateur d'économies de mise en cache rapide, et coûte un assistant complet sur le calculateur de coût de chatbot.
Calculateur de débit provisionné (PTU)Calculateur de balisage AI GatewayCalculateur de prix de siège et d'utilisationEstimateur du coût des applications IAPrix du wrapper IA
Comment fonctionne cette calculatrice
Calculateur gratuit de coût de conversation multi-tours — étant donné que chaque tour renvoie l'intégralité de l'historique, le coût de la conversation LLM augmente avec le carré du nombre de tours, et non de manière linéaire.
Questions fréquemment posées
Pourquoi une longue conversation coûte-t-elle plus cher que le nombre de messages ne le suggère ?
Étant donné qu'un LLM n'a pas de mémoire entre les appels, chaque tour doit renvoyer l'intégralité de la conversation précédente en entrée afin que le modèle puisse voir le contexte. Au dixième tour, le modèle relit les neuf échanges précédents ainsi que l'invite du système, au vingtième tour, il relit dix-neuf, et ainsi de suite. Les jetons d'entrée augmentent donc à chaque tour, et le coût cumulé de l'ensemble de la conversation augmente à peu près avec le carré du nombre de tours plutôt que de manière linéaire. Une conversation en cent tours peut coûter bien plus qu’une centaine d’appels en un seul tour de même taille de message – l’historique est ce que vous payez, encore et encore.
Comment puis-je empêcher le coût des conversations d’exploser ?
Trois leviers. Une fenêtre glissante ne conserve que les derniers tours de l’historique, plafonnant l’entrée à une taille fixe afin que le coût augmente de manière linéaire plutôt que quadratique – au prix de l’oubli du contexte plus ancien par le modèle. La mise en cache des invites permet au fournisseur de stocker le préfixe répété et de le facturer avec une remise importante à chaque réutilisation, ce qui est idéal lorsque l'historique initial et l'invite du système restent identiques. Et le résumé compresse les anciens virages en un court récapitulatif afin que vous conserviez le sens sans conserver les jetons. Cette calculatrice affiche le coût naïf de l'historique complet ainsi qu'une version fenêtrée et en cache afin que vous puissiez voir quel levier est rentable pour la durée de votre conversation.
Une invite système plus importante est-elle importante dans une longue conversation ?
Oui, plus que ce à quoi les gens s'attendent, car l'invite du système est renvoyée à chaque tour. Une invite système de 2 000 jetons dans une conversation de cinquante tours est facturée cinquante fois, soit cent mille jetons d'entrée avant qu'un message utilisateur ne soit compté. Dans les discussions longues ou à volume élevé, l'invite système fixe représente souvent une part plus importante de la facture que la conversation elle-même, ce qui est exactement le genre de coût que la mise en cache des invites est conçue pour supprimer. La calculatrice sépare la contribution de l'invite système afin que vous puissiez voir si elle vaut la peine de la couper ou de la mettre en cache.