—par requête
—indexation unique
—le plus gros coût mensuel
Modèle de réponse le moins cher pour ce RAG
Même récupération et même trafic, chaque modèle classé par coût mensuel.
| Modèle | Coût / mois | Par requête |
|---|
⚠️ Devis modifiable à partir des prix de référence (juillet 2026). Le coût de Vector DB varie énormément selon le fournisseur et le forfait – définissez le vôtre. Les factures réelles évoluent également en fonction du reclassement, de la mise en cache, du filtrage des métadonnées et de la fréquence de réindexation. ·
Signaler un prix obsolète →
Où va réellement l’argent de RAG
Les gens supposent que les intégrations sont la partie la plus coûteuse de RAG. Ce sont généralement les moins chers. Intégrer 10 000 documents courts coûte souvent quelques centimes, payés une seule fois. Le coût réel et récurrent est le LLM sur chaque requête - et plus particulièrement le contexte récupéré tu le nourris. Tirez 5 morceaux de 400 jetons et vous avez ajouté 2 000 jetons d'entrée à chaque question avant même que l'utilisateur ait fini de taper. Multipliez par votre volume de requêtes et vous obtenez votre facture. Il s'agit d'un simple RAG vectoriel : si vous créez plutôt un graphe de connaissances, la passe d'indexation elle-même a son propre coût LLM initial, tarifé séparément sur le Calculateur de coût d'indexation GraphRAG.
Les gros leviers, dans l'ordre : récupérer moins/morceaux plus petits (top-k et taille du morceau), utilisez un modèle de réponse moins cher pour les requêtes de routine et limiter la longueur des réponses. La réintégration uniquement des documents modifiés (et non de l'ensemble du corpus) évite que le coût ponctuel ne se reproduise. Construire le reste de l'application ? Évaluez un bot de support avec le calculateur de coût de chatbot, toute une fonctionnalité avec le Estimateur du coût des applications d'IA, ou le backend complet avec le Calculateur du coût de la pile API. Il suffit de dimensionner la couche de stockage ? Voir le calculateur de coût de base de données vectorielle pour Pinecone contre Qdrant contre pgvector.
BinanceTwilioGoogle GémeauxCoinGeckoIA et LLMCoût du moteur de recherche/réponse IA
Comment fonctionne cette calculatrice
Le Calculateur de coût RAG estime le coût mensuel de fonctionnement d'un pipeline de production augmentée par récupération en combinant trois factures distinctes. Premièrement, il calcule un coût d'intégration unique à partir du nombre de documents, du nombre moyen de jetons par document et de la taille des blocs, tarifés selon le modèle d'intégration sélectionné. Deuxièmement, il prend en compte la base de données vectorielles qui stocke ces intégrations de morceaux. Troisièmement, et généralement le plus important, il calcule les dépenses récurrentes. coût LLM par requête: votre volume de requête mensuel multiplié par les jetons d'entrée des morceaux récupérés (top-k) plus la longueur de réponse générée, tarifée en fonction du modèle de réponse choisi. Le volume des requêtes, le top-k et le modèle de réponse sont les principaux facteurs déterminants.
Regardez le paramètre de récupération top-k étroitement. Chaque morceau récupéré est ajouté à l'invite de chaque requête, donc augmenter le top-k ou la taille du morceau gonfle directement les jetons d'entrée sur chaque requête pour tout le mois. Récupérer davantage de contexte peut améliorer la qualité des réponses, mais le coût évolue linéairement avec les requêtes. Un conseil pratique : récupérez moins de fragments plus serrés et réservez un modèle de réponse plus grand et plus coûteux uniquement là où la précision le justifie. L'intégration est un coût initial fixe, tandis que la facture LLM par requête augmente avec l'utilisation, alors optimisez d'abord le chemin de la requête.
Questions fréquemment posées
Quel est le coût d'un système RAG ?
Trois parties. Unique : intégration de tous vos documents dans des vecteurs. En continu mensuellement : la base de données de vecteurs qui stocke et recherche ces vecteurs, plus le coût LLM par requête, qui inclut les morceaux récupérés que vous insérez dans l'invite en tant que contexte. Pour la plupart des applications RAG, le coût LLM par requête domine, car le contexte récupéré peut être bien plus vaste que la question réelle de l'utilisateur.
Pourquoi le contexte récupéré représente-t-il le coût RAG le plus important ?
Chaque requête envoie les k premiers morceaux récupérés au modèle en tant que jetons d'entrée. Récupérez 5 morceaux de 400 jetons et vous payez 2 000 jetons d'entrée par requête avant que l'utilisateur n'en ait dit grand-chose. Récupérer des morceaux moins nombreux ou plus petits, ou utiliser un modèle moins cher, réduit la facture bien plus que la modification des modèles d'intégration.