Le coût d'un chatbot RAG est dominé par le contexte récupéré que vous insérez dans l'invite, pas la question. Chaque requête = intégration + recherche de vecteur + un appel LLM transportant vos morceaux. Entrez votre consommation pour voir la facture mensuelle.
Répartition des coûts par requête
| Composant | $ / requête | % du total |
|---|
Pourquoi le contexte récupéré est le facteur de coût
Les gens supposent que la question détermine le coût du RAG. Ce n'est pas le cas - le morceaux récupérés vous collez dans l'invite do. Extrayez 8 morceaux de 500 jetons et chaque requête contient 4 000 jetons d'entrée avant que le modèle n'écrive un mot. C'est pourquoi récupérer des morceaux moins nombreux, plus petits et de meilleure qualité bat toute autre optimisation, suivi de mise en cache l'invite système statique. Dimensionnez le magasin de vecteurs avec le calculateur de coût de base de données vectorielle, et comparer les modèles sur le Calculateur de coût de l'API IA. Pour un bot non-RAG, consultez le calculateur de coût de chatbot.