—último turno solo
—vs costo fijo
—con ventana/caché
El costo se acelera con el conteo de turnos
El insumo por turno sigue aumentando a medida que se acumula el historial, por lo que la curva de costo acumulativo se inclina hacia arriba: duplicar los giros duplica con creces la factura.
| a su vez | Este turno cuesta | Acumulativo |
|---|
Pagas por la historia en cada turno.
Un modelo de lenguaje no tiene estado: no recuerda nada entre llamadas a la API, por lo que, para continuar una conversación, su aplicación reenvía la transcripción completa (mensaje del sistema, cada mensaje de usuario anterior y cada respuesta anterior) como entrada de cada nueva solicitud. Eso significa que la entrada crece un intercambio a la vez, y el costo de toda la conversación crece aproximadamente con el cuadrado del número de turnos, no linealmente. El último turno de un chat largo es el más caro porque tiene la mayor cantidad de historial y, además, el aviso fijo del sistema se factura una vez por turno. Tres palancas lo bajan: una ventana corredera que mantiene solo los giros recientes (el costo se vuelve lineal, a costa de la memoria), almacenamiento en caché rápido eso factura el prefijo repetido con un gran descuento, y resumir lo antiguo se convierte en un breve resumen. Comparar una sola ventana en el calculadora de costos de ventana contextual, dimensione la ganancia de almacenamiento en caché en el calculadora de ahorro de almacenamiento en caché rápida, y cuesta un asistente completo en el calculadora de costos de chatbot.
Calculadora de rendimiento aprovisionado (PTU)Calculadora de margen de puerta de enlace AICalculadora de precios por asiento y por usoEstimador de costos de aplicaciones de IAPrecios del contenedor de IA
Cómo funciona esta calculadora
Calculadora gratuita de costos de chat de múltiples turnos: debido a que cada turno reenvía todo el historial, el costo de la conversación LLM crece con el cuadrado del conteo de turnos, no de manera lineal.
Preguntas frecuentes
¿Por qué una charla larga cuesta más de lo que sugiere la cantidad de mensajes?
Debido a que un LLM no tiene memoria entre llamadas, cada turno debe volver a enviar toda la conversación anterior como entrada para que el modelo pueda ver el contexto. En el turno diez, el modelo vuelve a leer los nueve intercambios anteriores más el mensaje del sistema, en el turno veinte vuelve a leer el diecinueve, y así sucesivamente. Por lo tanto, los tokens de entrada crecen con cada turno, y el costo acumulativo de toda la conversación crece aproximadamente con el cuadrado del recuento de turnos en lugar de linealmente. Una conversación de cien turnos puede costar mucho más que cien llamadas de un solo turno del mismo tamaño de mensaje: paga por el historial, una y otra vez.
¿Cómo puedo evitar que el coste de las conversaciones se dispare?
Tres palancas. Una ventana deslizante mantiene solo los últimos giros de la historia, limitando la entrada a un tamaño fijo para que el costo crezca linealmente en lugar de cuadráticamente, a costa de que el modelo olvide el contexto anterior. El almacenamiento en caché de avisos permite al proveedor almacenar el prefijo repetido y facturarlo con un gran descuento en cada reutilización, lo cual es ideal cuando el historial inicial y el aviso del sistema permanecen idénticos. Y el resumen comprime los viejos cambios en un breve resumen para que puedas conservar el significado sin conservar las fichas. Esta calculadora muestra el costo ingenuo del historial completo junto con una versión en ventana y en caché para que pueda ver qué palanca vale la pena para la duración de su conversación.
¿Importa un sistema más grande en una conversación larga?
Sí, más de lo que la gente espera, porque el aviso del sistema se reenvía en cada turno. Un aviso del sistema de 2.000 tokens en una conversación de cincuenta turnos se factura cincuenta veces: cien mil tokens de entrada antes de que se cuente cualquier mensaje de usuario. En chats largos o de gran volumen, el aviso fijo del sistema suele representar una parte mayor de la factura que la conversación real, que es exactamente el tipo de costo que el almacenamiento en caché de avisos está diseñado para eliminar. La calculadora separa la contribución del sistema para que pueda ver si vale la pena recortarla o almacenarla en caché.