Une facture DB vectorielle provient de trois nombres et non du modèle. Combien de vecteurs vous conservez, quelle est la largeur de chacun (sa dimension) et combien de requêtes vous exécutez. Tout ce qui suit est dérivé de ces trois éléments : le stockage est vectors × dimension × 4 bytes plus la surcharge d'indexation et le coût des requêtes évolue avec le volume de lecture.
Coût mensuel par fournisseur
Même charge de travail, classé premier le moins cher. Estimation stockage + requêtes, avant tout niveau gratuit.
| Fournisseur | Modèle | HNE. / mois |
|---|
Comment le numéro de stockage est construit
Chaque vecteur est un tableau de flottants de 32 bits, donc une seule intégration de 1536 dimensions représente environ 6 Ko brut (1536 × 4 octets). Multipliez par votre nombre de vecteurs pour la charge utile brute, puis ajoutez approximativement 50 % de frais généraux pour la structure de l'index HNSW/IVF et les métadonnées que tout magasin de vecteurs sérieux conserve aux côtés des vecteurs bruts. C'est le chiffre du « stockage indexé » ci-dessus – ce que chaque fournisseur facture, qu'il l'appelle stockage, pod ou taille de cluster. Doubler la dimension (1536 → 3072) double ce nombre pour le même nombre de vecteurs, c'est pourquoi « une intégration plus grande = meilleure » n'est pas un choix libre.
Pourquoi les tarifs des fournisseurs sont si différents
Pomme de pin et Nuage de Zilliz sont sans serveur basés sur l'utilisation : vous payez pour les Go stockés plus les unités de lecture et d'écriture, de sorte qu'un point de terminaison RAG à forte lecture peut coûter plus cher que son stockage ne le suggère. Cloud Qdrant et Weaviate Cloud sont plus proches du calcul/basé sur la RAM - vous choisissez une taille de cluster qui doit contenir l'index en mémoire, donc le coût suit le stockage plus que les requêtes. pgvecteur n'est qu'une extension dans Postgres : si vous exécutez déjà une base de données, l'ajout de vecteurs est presque gratuit jusqu'à ce que l'index dépasse la RAM, auquel cas vous payez pour une boîte plus grande. La calculatrice aplatit tous ces éléments en une seule forme de stockage + requête afin que vous puissiez comparer l'ordre de grandeur, puis vous confirmez la facture exacte du fournisseur que vous choisissez.
Comment réduire la facture
Stockez moins de morceaux de meilleure qualité plutôt que chaque paragraphe deux fois. Utilisez une dimension d'intégration plus petite lorsque le rappel le permet : 768-d correspond souvent à 1536-d sur des domaines étroits avec la moitié du stockage. Supprimez les vecteurs obsolètes au lieu de laisser l'index croître pour toujours. Et rappelez-vous le côté lecture : la mise en cache des requêtes fréquentes et le contexte LLM qui les entoure est l'endroit où se trouve l'argent réel. Associez-le avec le calculateur d'économies de mise en cache rapide et, si vous dimensionnez un pipeline de récupération complet, le calculateur de coût de chatbot ou le complet Estimateur du coût des applications d'IA.
Choisir des intégrations ? Le OpenAI et Gémeaux les guides répertorient les prix d'intégration actuels, et le Calculateur du coût des agents IA couvre les agents augmentés par récupération de bout en bout.