—por consulta
—indexación única
—mayor costo mensual
Modelo de respuesta más barato para este RAG
Misma recuperación y tráfico, cada modelo clasificado por costo mensual.
| Modelo | Costo / mes | Por consulta |
|---|
⚠️ Estimación editable utilizando precios de referencia (julio 2026). El costo de Vector DB varía enormemente según el proveedor y el plan: establezca el suyo propio. Las facturas reales también cambian con la frecuencia de reclasificación, almacenamiento en caché, filtrado de metadatos y reindexación. ·
Informar precio desactualizado →
Adónde va realmente el dinero de RAG
La gente supone que las incrustaciones son la parte cara de RAG. Suelen ser los más baratos. Incrustar 10.000 documentos cortos suele costar unos pocos centavos y se paga una vez. El costo real y recurrente es el LLM en cada consulta - y específicamente el contexto recuperado lo alimentas. Extraiga 5 fragmentos de 400 tokens y habrá agregado 2000 tokens de entrada a cada pregunta antes de que el usuario termine de escribir. Multiplique por su volumen de consultas y esa será su factura. Eso es un RAG vectorial simple: si, en cambio, estás creando un gráfico de conocimiento, el pase de indexación en sí tiene su propio costo inicial de LLM, que se cotiza por separado en el Calculadora de costos de indexación GraphRAG.
Las grandes palancas, en orden: recuperar menos trozos/más pequeños (top-k y tamaño de fragmento), utilice un modelo de respuesta más barato para consultas de rutina y limitar la longitud de las respuestas. Volver a incrustar sólo los documentos modificados (no todo el corpus) evita que el costo único se repita. ¿Construyendo el resto de la aplicación? Ponle precio a un bot de soporte con el calculadora de costos de chatbot, toda una característica con el Estimador de costos de aplicaciones de IA, o el backend completo con el Calculadora de costos de pila de API. ¿Solo dimensionar la capa de almacenamiento? Ver el calculadora de costos de bases de datos vectoriales para Pinecone vs Qdrant vs pgvector.
binanceTwilioGoogle GéminisMonedaGeckoIA y LLMCosto del motor de búsqueda/respuesta de IA
Cómo funciona esta calculadora
El Calculadora de costos RAG estima el costo mensual de operar un gasoducto de generación con recuperación aumentada combinando tres facturas separadas. Primero, calcula una costo de incorporación único a partir del recuento de documentos, el promedio de tokens por documento y el tamaño del fragmento, con un precio según el modelo de incrustación seleccionado. En segundo lugar, tiene en cuenta la base de datos vectorial que almacena esas incrustaciones de fragmentos. En tercer lugar, y generalmente el más grande, calcula el recurrente costo de LLM por consulta: su volumen de consultas mensual multiplicado por los tokens de entrada de los fragmentos recuperados (top-k) más la longitud de la respuesta generada, con un precio según el modelo de respuesta elegido. El volumen de consultas, top-k y el modelo de respuesta son los principales impulsores.
Mira el configuración de recuperación top-k cercanamente. Cada fragmento recuperado se agrega al mensaje de cada consulta, por lo que aumentar el tamaño del fragmento o top-k infla directamente los tokens de entrada en cada consulta para todo el mes. Recuperar más contexto puede mejorar la calidad de las respuestas, pero el costo aumenta linealmente con las consultas. Un consejo práctico: recupere menos fragmentos y más ajustados y reserve un modelo de respuesta más grande y costoso sólo cuando la precisión lo justifique. La integración tiene un costo inicial fijo, mientras que la factura de LLM por consulta se suma al uso, por lo que primero optimice la ruta de consulta.
Preguntas frecuentes
¿Qué constituye el costo de un sistema RAG?
Tres partes. Una sola vez: incrustar todos sus documentos en vectores. Mensualmente continuo: la base de datos de vectores que almacena y busca esos vectores, más el costo de LLM por consulta, que incluye los fragmentos recuperados que ingresa en el mensaje como contexto. Para la mayoría de las aplicaciones RAG, el costo LLM por consulta domina, porque el contexto recuperado puede ser mucho mayor que la pregunta real del usuario.
¿Por qué el contexto recuperado es el mayor coste de RAG?
Cada consulta envía los k fragmentos recuperados top al modelo como tokens de entrada. Recupere 5 fragmentos de 400 tokens y pagará 2000 tokens de entrada por consulta antes de que el usuario haya dicho mucho. Recuperar menos fragmentos o más pequeños, o utilizar un modelo más barato, reduce la factura mucho más que cambiar los modelos de incrustación.