Cómo funciona esta calculadora
El Calculadora de costos del chatbot RAG estima lo que cuesta ejecutar un chatbot con recuperación aumentada, tanto por consulta y por mes. Entras tu consultas por mes, el tokens de contexto recuperados cada consulta llega, el fichas de respuesta el modelo genera, y su LLM aporte y producción Precios por millón de tokens. Multiplica los tokens de contexto por la tasa de entrada y los tokens de respuesta por la tasa de salida para obtener un costo por consulta y luego lo escala según el volumen mensual. El factor más importante suele ser el contexto recuperado: cada fragmento que adjunte se factura como entrada en cada llamada, por lo que el tamaño de la recuperación y el volumen de la consulta dominan la factura más que la longitud de la respuesta.
La compensación clave es ¿Cuánto contexto recuperas?. Una mayor cantidad de fragmentos recuperados puede mejorar la calidad de las respuestas, pero dado que ese contexto se reenvía y se factura nuevamente en cada consulta, duplicarlo aproximadamente duplica el costo de los insumos a escala. Intente recortar la cantidad o el tamaño de los pasajes recuperados y observe cómo se mueve la cifra mensual; a menudo puede reducir sustancialmente el contexto con poca pérdida de calidad. Porque producción Los tokens suelen tener un precio más alto por token, pero son mucho menos numerosos; controlar las respuestas detalladas ayuda menos que controlar el contexto. Utilice la calculadora para encontrar el punto en el que la recuperación sea lo suficientemente grande como para responder bien, pero no tan grande como para que el costo crezca más rápido que el valor que ofrece cada consulta.
Preguntas frecuentes
¿Cuánto cuesta un chatbot RAG por consulta?
Cada consulta RAG paga por la incorporación de la pregunta, una búsqueda en la base de datos vectorial y la llamada LLM que incluye los fragmentos recuperados como contexto. La entrada LLM (su contexto recuperado puede ser miles de tokens) generalmente domina; las incrustaciones y la consulta vectorial cuestan centavos o menos.
¿Cómo puedo reducir los costos de RAG?
Recupere menos fragmentos y más pequeños, almacene en caché el mensaje del sistema, utilice un modelo más económico para respuestas rutinarias y almacene en caché incrustaciones para consultas repetidas. El tamaño del contexto recuperado es el mayor factor de coste.