—compactaciones
—costos generales
—costo total de ejecución
Donde la compactación vale la pena: apretar el gatillo
Compacte demasiado pronto y disparará muchos eventos; se compacta demasiado tarde (o nunca) y cada paso relee un contexto enorme. La columna de costo total suele tener un mínimo en el medio.
| Compacto en | Compactaciones | Arriba | Costo total de ejecución |
|---|
La limpieza que nadie presupuesta
An autonomous agent has no long-term memory of its own run, so it keeps the whole working context in the prompt: the system instructions, the tool definitions, every tool result it has seen and every step it has taken. Ese contexto crece monótonamente y mucho antes de que desborde la ventana del modelo, el agente tiene que compacto : entregue todo el contexto al modelo, obtenga un resumen comprimido y continúe desde el resumen. La compactación es lo que mantiene vivo a un agente de varias horas, pero no es gratis: resumir un contexto de 150.000 tokens factura 150.000 tokens de entrada para ese evento, y una ejecución que se compacta tres o cuatro veces puede gastar entre una quinta y una tercera parte de sus tokens totales solo en esto. Es un costo que nunca aparece en un precio por llamada y nunca aparece en una estimación simbólica ingenua, que es exactamente la razón por la que las facturas de los agentes son más altas que las matemáticas en el reverso del sobre. La forma de controlarlo es ajustar cuándo compacta y qué tan pequeño restablece, y facturar la relectura con un descuento con almacenamiento en caché o un resumen más económico. Dimensione el lado de múltiples vueltas en el calculadora de costos de conversación de varios turnos, todo el bucle en el calculadora de presupuesto de bucle de agente, y el almacenamiento en caché gana en el calculadora de ahorro de almacenamiento en caché rápida.
Calculadora de presupuesto de bucle de agenteCosto de conversación de varios turnosCosto del paso del agente de IACosto de la ventana de contextoAhorro de almacenamiento en caché rápido
Cómo funciona esta calculadora
Simula la carrera paso a paso. El contexto comienza en el tamaño base y crece en cada paso; cuando cruza el disparador, se activa una compactación (todo el contexto se factura como entrada más una salida resumida) y el contexto se restablece. Suma el costo productivo (leer el contexto para realizar cada paso) y los gastos generales de compactación por separado, luego barre el disparador para que pueda encontrar el costo total mínimo.
Preguntas frecuentes
¿Qué es la compactación del contexto y por qué cuesta dinero?
Un agente de larga duración acumula contexto (resultados de herramientas, mensajes, razonamiento) hasta que se acerca a la ventana de contexto del modelo. Para continuar, se compacta: alimenta todo el contexto actual al modelo y solicita un resumen comprimido, luego continúa desde ese resumen en lugar del historial completo. El problema es que resumir significa volver a leer todo, por lo que cada evento de compactación factura todo el contexto como tokens de entrada más una pequeña salida para el resumen. Una sola compactación de un contexto de 150.000 tokens cuesta lo mismo que 150.000 tokens de entrada, y un agente largo que compacta varias veces puede gastar entre una quinta y una tercera parte de sus tokens totales sólo en esta limpieza.
¿Cuántas veces compactará mi agente?
Depende de qué tan rápido crezca el contexto y dónde se encuentre el desencadenante. Si cada paso agrega unos cuantos miles de tokens de salida de la herramienta y el agente se compacta cuando alcanza, digamos, 140 000 tokens y luego se restablece a un resumen de 25 000 tokens, se compactará aproximadamente cada vez que vuelva a subir esa brecha. Una ejecución que agrega 8000 tokens por paso y se compacta a 140k activará una compactación aproximadamente cada quince pasos. Esta calculadora simula la ejecución paso a paso, cuenta las compactaciones y separa el costo productivo de los gastos generales de compactación para que pueda ver la división.
¿Cómo reduzco los gastos generales de compactación?
Tres palancas lo mueven. Compactar más tarde (un disparador más alto) significa menos compactaciones y más grandes, pero pasos productivos más costosos porque el contexto que se relee en cada turno es más amplio: hay un punto ideal genuino en lugar de que siempre más alto es mejor. Restablecer a un resumen más pequeño compra más espacio entre compactaciones. Y enrutar el resumen a un modelo más económico, o utilizar el almacenamiento en caché rápido para que el prefijo releído se facture con un descuento, reduce directamente el costo por evento. La tabla en esta página barre el umbral de activación para que pueda ver cómo se dobla el costo total, y tampoco se muestra nunca compactar en absoluto; generalmente es la peor opción porque el contexto crece sin límites y cada paso paga por ello.
¿Es la compactación más económica que simplemente usar una ventana de contexto más grande?
A menudo sí, porque la alternativa a la compactación es llevar el historial completo en cada paso, y el costo de los insumos crece con el cuadrado de la longitud del recorrido cuando nunca se recorta nada. La compactación limita ese crecimiento: después de cada resumen, el contexto por paso vuelve a caer, por lo que el costo productivo permanece aproximadamente lineal en lugar de cuadrático. Paga una suma global en cada evento de compactación, pero evita releer una transcripción cada vez más grande miles de veces. Para tiradas muy cortas, los gastos generales no merecen la pena; para agentes autónomos durante mucho tiempo, generalmente se amortiza muchas veces, lo que esta calculadora le permite confirmar para sus propios números.