Coût équivalent au RAG statique par rapport au coût réel du moteur de réponse
Mêmes entrées et sorties LLM, moins les frais de l'API de recherche Web en direct - c'est ce que coûterait exactement la même requête en tant que système RAG statique pré-indexé et sans recherche en direct. L'écart est la prime de recherche en direct.
| Base de coût | Coût / requête | Coût mensuel |
|---|---|---|
| Équivalent RAG statique (synthèse LLM uniquement, pas de frais de recherche en direct) | — | — |
| Coût réel du moteur de réponse (synthèse LLM + API de recherche en direct) | — | — |
Coût par extraits récupérés (top-K)
Tout le reste est maintenu aux valeurs ci-dessus, en fonction du nombre de résultats de recherche insérés dans le contexte du LLM par requête. Plus d'extraits peuvent signifier des réponses mieux fondées, mais chaque extrait supplémentaire correspond à des jetons d'entrée supplémentaires facturés pour chaque requête.
| Extraits (top-K) | Jetons d'entrée/requête | Coût / requête | Coût mensuel |
|---|
Comment cela se connecte à d'autres outils
Cette page coûte un moteur de réponse de recherche en direct - un pipeline de style Perplexity / You.com / Bing Copilot où chaque requête atteint une API de recherche Web tierce avant que le LLM ne voie la question. Il s'agit d'une architecture différente d'un système construit autour d'un corpus que vous possédez déjà : si votre étape de récupération est une recherche vectorielle sur des documents que vous avez indexés vous-même, sans frais d'API de recherche en direct sur aucune requête, fixez-la au tarif Calculateur de coût RAG à la place, ou le Calculateur de coût du chatbot RAG pour une interface conversationnelle avec un historique au-dessus de ce même corpus statique. Si vous envisagez spécifiquement une architecture de graphe de connaissances au lieu d'une simple récupération de vecteurs, le Calculateur de coût d'indexation GraphRAG prix du pass d'extraction unique qui le construit. Et comme chaque requête ici paie le prix total du jeton d'entrée pour la même invite système et les mêmes jetons de surcharge, vérifiez si la mise en cache des invites peut réduire ce coût récurrent sur le système. Calculateur d'économies de mise en cache rapide.