—último turno solo
—vs costo fijo
—con ventana/caché
El costo se acelera con el conteo de turnos
El insumo por turno sigue aumentando a medida que se acumula el historial, por lo que la curva de costo acumulativo se inclina hacia arriba: duplicar los giros duplica con creces la factura.
| a su vez | Este turno cuesta | Acumulativo |
|---|
Pagas por la historia en cada turno.
Un modelo de lenguaje no tiene estado: no recuerda nada entre llamadas a la API, por lo que, para continuar una conversación, su aplicación reenvía la transcripción completa (mensaje del sistema, cada mensaje de usuario anterior y cada respuesta anterior) como entrada de cada nueva solicitud. Eso significa que la entrada crece un intercambio a la vez, y el costo de toda la conversación crece aproximadamente con el cuadrado del número de turnos, no linealmente. El último turno de un chat largo es el más caro porque tiene la mayor cantidad de historial y, además, el aviso fijo del sistema se factura una vez por turno. Tres palancas lo bajan: una ventana corredera que mantiene solo los giros recientes (el costo se vuelve lineal, a costa de la memoria), almacenamiento en caché rápido eso factura el prefijo repetido con un gran descuento, y resumir lo antiguo se convierte en un breve resumen. Comparar una sola ventana en el calculadora de costos de ventana contextual, dimensione la ganancia de almacenamiento en caché en el calculadora de ahorro de almacenamiento en caché rápida, y cuesta un asistente completo en el calculadora de costos de chatbot.
Calculadora de rendimiento aprovisionado (PTU)Calculadora de margen de puerta de enlace AICalculadora de precios por asiento y por usoEstimador de costos de aplicaciones de IAPrecios del contenedor de IA
Cómo funciona esta calculadora
El Calculadora de costos de conversación de varios turnos estima el costo total del token de una sesión de chat completa, no de una sola solicitud. Debido a que la mayoría de las API de chat no tienen estado, cada nuevo turno reenvía todo el historial anterior, por lo que la calculadora multiplica tu aviso del sistema, tokens por mensaje de usuario, y tokens por respuesta del asistente a través de la transcripción en crecimiento para cada uno de los especificados vueltas, luego aplica los precios de entrada y salida por millón de tokens. El principal factor de costo es que el historial de reenvío hace que se acumulen tokens de entrada. cuadráticamente con recuento de turnos, razón por la cual una conversación larga puede costar mucho más de lo que sugieren los mensajes individuales.
La contrapartida clave es controlar ese crecimiento. Establecer un ventana corredera mantiene solo los giros más recientes, limitando la cantidad de historia que se resiente, mientras que un descuento de caché reduce el precio del prefijo repetido. Ambos tienen un costo más bajo, pero una ventana más estrecha significa que el modelo olvida contexto anterior, así que observe con qué agresividad recorta antes de que la calidad se vea afectada.
Preguntas frecuentes
¿Por qué una charla larga cuesta más de lo que sugiere la cantidad de mensajes?
Debido a que un LLM no tiene memoria entre llamadas, cada turno debe volver a enviar toda la conversación anterior como entrada para que el modelo pueda ver el contexto. En el turno diez, el modelo vuelve a leer los nueve intercambios anteriores más el mensaje del sistema, en el turno veinte vuelve a leer el diecinueve, y así sucesivamente. Por lo tanto, los tokens de entrada crecen con cada turno, y el costo acumulativo de toda la conversación crece aproximadamente con el cuadrado del recuento de turnos en lugar de linealmente. Una conversación de cien turnos puede costar mucho más que cien llamadas de un solo turno del mismo tamaño de mensaje: paga por el historial, una y otra vez.
¿Cómo puedo evitar que el coste de las conversaciones se dispare?
Tres palancas. Una ventana deslizante mantiene solo los últimos giros de la historia, limitando la entrada a un tamaño fijo para que el costo crezca linealmente en lugar de cuadráticamente, a costa de que el modelo olvide el contexto anterior. El almacenamiento en caché de avisos permite al proveedor almacenar el prefijo repetido y facturarlo con un gran descuento en cada reutilización, lo cual es ideal cuando el historial inicial y el aviso del sistema permanecen idénticos. Y el resumen comprime los viejos cambios en un breve resumen para que puedas conservar el significado sin conservar las fichas. Esta calculadora muestra el costo ingenuo del historial completo junto con una versión en ventana y en caché para que pueda ver qué palanca vale la pena para la duración de su conversación.
¿Importa un sistema más grande en una conversación larga?
Sí, más de lo que la gente espera, porque el aviso del sistema se reenvía en cada turno. Un aviso del sistema de 2.000 tokens en una conversación de cincuenta turnos se factura cincuenta veces: cien mil tokens de entrada antes de que se cuente cualquier mensaje de usuario. En chats largos o de gran volumen, el aviso fijo del sistema suele representar una parte mayor de la factura que la conversación real, que es exactamente el tipo de costo que el almacenamiento en caché de avisos está diseñado para eliminar. La calculadora separa la contribución del sistema para que pueda ver si vale la pena recortarla o almacenarla en caché.