El costo de un chatbot RAG está dominado por el contexto recuperado que ingresa en el mensaje, no la pregunta. Cada consulta = incrustar + búsqueda de vectores + una llamada LLM que transporta sus fragmentos. Ingrese su uso para ver la factura mensual.

por mes
por consulta
por año
consultas/mes

Desglose de costos por consulta

Componente$/consulta% del total
⚠️ Estimaciones de referencia (julio 2026). La incorporación de tokens de ~$0,02/1 millón y una consulta vectorial son pequeñas al lado de la llamada LLM que lleva el contexto recuperado. Los precios varían según el modelo y el proveedor: escriba sus tarifas reales. El almacenamiento de la base de datos vectorial se factura por separado (consulte la calculadora de costos de la base de datos vectorial). · Informar precio desactualizado →

Por qué el contexto recuperado es el generador de costos

La gente supone que la pregunta influye en el coste del RAG. No es así - el trozos recuperados pegas en el mensaje hacer. Extraiga 8 fragmentos de 500 tokens y cada consulta llevará 4000 tokens de entrada antes de que el modelo escriba una palabra. Es por eso Recuperar menos trozos, más pequeños y mejores supera cualquier otra optimización, seguida de almacenamiento en caché el indicador del sistema estático. Dimensione el almacén de vectores con el calculadora de costos de bases de datos vectorialesy comparar modelos en el Calculadora de costos de API de IA. Para un bot que no sea RAG, consulte la calculadora de costos de chatbot.

Aloja tu proyecto:Océano Digital — $200 gratis ↗VPS Hostinger
Calculadora de rendimiento aprovisionado (PTU)Calculadora de costos de conversación de varios turnosCalculadora de margen de puerta de enlace AICalculadora de precios por asiento y por usoEstimador de costos de aplicaciones de IA