Cómo funciona esta calculadora
El Calculadora de costos de ventana contextual estima lo que cuesta llenar una ventana de contexto grande en cada llamada de modelo: el escenario detrás TRAPO canalizaciones y avisos de documentos largos. multiplica tu tokens de contexto por llamada por el precio de entrada por millón de tokens, agrega tu tokens de salida por llamada veces el precio de producción por millóny escala el total según su llamadas por mes para mostrar cifras por llamada y mensuales. El factor dominante casi siempre es el tamaño del contexto: los tokens de entrada se repiten en cada llamada, por lo que una carga útil de recuperación pesada o un aviso largo del sistema establece el costo base mucho más que la respuesta que se obtiene.
La contrapartida clave es la profundidad del contexto versus el gasto. Duplicar los pasajes recuperados o rellenar el mensaje con documentos adicionales puede multiplicar su factura sin mejorar las respuestas. Utilice la calculadora para comprobar si contexto de recorte, ajustar la recuperación o cambiar a un nivel de entrada más económico reduce el total mensual, y observe el número por llamada cuando el volumen es alto: las pequeñas cantidades por llamada se acumulan rápidamente en miles de solicitudes.
Preguntas frecuentes
¿Por qué cuesta tanto una gran ventana de contexto?
Paga el precio de entrada por cada token en el contexto, en cada llamada. Un aviso de 32.000 tokens a 2,50 USD/1 millón supone 0,08 USD de entrada antes de que el modelo escriba algo, y eso se repite en cada solicitud.
¿Cómo reduzco el costo del contexto?
Recupere menos fragmentos y más pequeños, resuma el historial y almacene en caché la parte estática del mensaje. El tamaño del contexto suele ser el factor más importante en un RAG o en una factura de documentos largos.