Comment fonctionne cette calculatrice
Le Calculateur de coût du chatbot RAG estime le coût d'exécution d'un chatbot avec récupération augmentée, à la fois par requête et par mois. Vous entrez votre requêtes par mois, le jetons de contexte récupérés chaque requête est récupérée, le jetons de réponse le modèle génère, et votre LLM saisir et sortir prix par million de jetons. Il multiplie les jetons de contexte par le taux d'entrée et les jetons de réponse par le taux de sortie pour obtenir un coût par requête, puis l'adapte en fonction du volume mensuel. Le facteur le plus important est généralement le contexte récupéré : chaque morceau que vous attachez est facturé comme une entrée sur chaque appel, donc la taille de récupération et le volume des requêtes dominent la facture plus que la longueur de la réponse.
Le compromis clé est combien de contexte vous récupérez. Un plus grand nombre de morceaux récupérés peuvent améliorer la qualité des réponses, mais comme ce contexte est renvoyé et refacturé à chaque requête, le doubler double grossièrement votre coût d'entrée à grande échelle. Essayez de réduire le nombre ou la taille des passages récupérés et observez l'évolution du chiffre mensuel. Vous pouvez souvent réduire considérablement le contexte avec peu de perte de qualité. Parce que sortir les jetons ont généralement un prix plus élevé par jeton, mais sont beaucoup moins nombreux, le contrôle des réponses détaillées aide moins que le contrôle du contexte. Utilisez la calculatrice pour trouver le point où la récupération est suffisamment importante pour répondre correctement, mais pas au point que le coût augmente plus rapidement que la valeur fournie par chaque requête.
Questions fréquemment posées
Combien coûte un chatbot RAG par requête ?
Chaque requête RAG paie pour l'intégration de la question, une recherche dans la base de données vectorielles et l'appel LLM qui inclut les morceaux récupérés comme contexte. L'entrée LLM (votre contexte récupéré peut être constitué de milliers de jetons) domine généralement ; les incorporations et la requête vectorielle coûtent des centimes ou moins.
Comment puis-je réduire les coûts RAG ?
Récupérez des morceaux moins nombreux et plus petits, mettez en cache l'invite du système, utilisez un modèle moins cher pour les réponses de routine et mettez en cache les intégrations pour les requêtes répétées. La taille du contexte récupéré est le plus gros levier de coûts.