El costo de un chatbot RAG está dominado por el contexto recuperado que ingresa en el mensaje, no la pregunta. Cada consulta = incrustar + búsqueda de vectores + una llamada LLM que transporta sus fragmentos. Ingrese su uso para ver la factura mensual.
Desglose de costos por consulta
| Componente | $/consulta | % del total |
|---|
Por qué el contexto recuperado es el generador de costos
La gente supone que la pregunta influye en el coste del RAG. No es así - el trozos recuperados pegas en el mensaje hacer. Extraiga 8 fragmentos de 500 tokens y cada consulta llevará 4000 tokens de entrada antes de que el modelo escriba una palabra. Es por eso Recuperar menos trozos, más pequeños y mejores supera cualquier otra optimización, seguida de almacenamiento en caché el indicador del sistema estático. Dimensione el almacén de vectores con el calculadora de costos de bases de datos vectorialesy comparar modelos en el Calculadora de costos de API de IA. Para un bot que no sea RAG, consulte la calculadora de costos de chatbot.