Un billete DB vectorial proviene de tres números, no del modelo. Cuántos vectores mantienes, qué ancho tiene cada uno (su dimensión) y cuántas consultas ejecutas. Todo lo que aparece a continuación se deriva de esos tres: el almacenamiento es vectors × dimension × 4 bytes además de gastos generales de índice y escalas de costos de consulta con volumen de lectura.
Costo mensual por proveedor
Misma carga de trabajo, clasificado en primer lugar como el más barato. Almacenamiento + estimación de consultas, antes de cualquier nivel gratuito.
| Proveedor | Modelo | Est. / mes |
|---|
Cómo se construye el número de almacenamiento
Cada vector es una matriz de flotantes de 32 bits, por lo que una única incrustación de 1536 dimensiones es aproximadamente 6 KB sin formato (1536 × 4 bytes). Multiplique por su recuento de vectores para obtener la carga útil sin procesar, luego agregue aproximadamente 50% gastos generales para la estructura del índice HNSW/IVF y los metadatos que todo almacén de vectores serio guarda junto con los vectores sin procesar. Esa es la figura de "almacenamiento indexado" anterior: aquello contra lo que todos los proveedores cobran, ya sea que lo llamen almacenamiento, pod o tamaño de clúster. Duplicar la dimensión (1536 → 3072) duplica este número para el mismo recuento de vectores, razón por la cual "mayor incrustación = mejor" no es una elección libre.
¿Por qué los proveedores fijan precios tan diferentes?
Piña y Nube Zilliz se basan en el uso sin servidor: usted paga por los GB almacenados más las unidades de lectura y escritura, por lo que un punto final RAG con mucha lectura puede costar más de lo que sugiere su almacenamiento. Nube Qdrant y Nube Weaviate están más cerca de la computación/RAM: usted elige un tamaño de clúster que debe contener el índice en la memoria, por lo que el costo rastrea el almacenamiento más que las consultas. pgvector es solo una extensión dentro de Postgres: si ya ejecuta una base de datos, agregar vectores es casi gratis hasta que el índice supera la RAM, momento en el que paga por una caja más grande. La calculadora agrupa todos estos en una forma de almacenamiento + consulta para que pueda comparar el orden de magnitud y luego confirme la factura exacta del proveedor que elija.
Cómo mantener la factura baja
Almacene menos fragmentos y mejores en lugar de cada párrafo dos veces. Utilice una dimensión de incrustación más pequeña cuando la recuperación lo permita: 768-d a menudo coincide con 1536-d en dominios estrechos con la mitad del almacenamiento. Elimine los vectores obsoletos en lugar de dejar que el índice crezca para siempre. Y recuerde el lado de lectura: almacenar en caché las consultas frecuentes y el contexto LLM que las rodea es donde está el dinero real. Combina esto con el calculadora de ahorro de almacenamiento en caché rápida y, si está dimensionando un proceso de recuperación completo, el calculadora de costos de chatbot o el completo Estimador de costos de aplicaciones de IA.
¿Elegir incrustaciones? El AbiertoAI y Géminis Las guías enumeran los precios de incorporación actuales y el Calculadora de costos de agentes de IA cubre agentes de recuperación aumentada de principio a fin.