Modelo y perfil de tarea
Retención de capturas de pantalla: el mayor coste
Misma tarea, mismos pasos: solo cambia la cantidad de capturas de pantalla anteriores que permanecen en el contexto. Las capturas de pantalla antiguas de estados obsoletos rara vez mejoran la siguiente acción, pero siempre se facturan como tokens de entrada nuevos.
| Estrategia | Entrada tok/tarea | Costo / tarea | Mensual | vs mantener todo |
|---|
El bucle de captura de pantalla es donde mueren los presupuestos de automatización del navegador
Un agente que utiliza una computadora no lee el DOM, sino que mira la pantalla. Cada paso de cada tarea es un viaje completo de ida y vuelta: capture una captura de pantalla, envíela al modelo como tokens de entrada de visión, obtenga una acción de hacer clic, escribir o desplazarse, ejecutarla y capturar la siguiente captura de pantalla. Con aproximadamente 1000-1600 tokens por captura de pantalla (dependiendo de la resolución) y 10-30 pasos para una tarea de rutina, la entrada de visión por sí sola eclipsa todo lo demás en la solicitud. La salida de texto real del modelo (una coordenada y una breve justificación) es trivialmente pequeña en comparación. Esta inversión toma a los equipos con la guardia baja: en las cargas de trabajo de chat, los tokens de salida son la parte cara; en el uso de computadoras, la entrada suele representar entre el 80% y el 95% de la factura.
La acumulación de contexto es el multiplicador superior. Si el agente mantiene todas las capturas de pantalla anteriores en la conversación, el paso 15 reenvía catorce capturas de pantalla obsoletas más la actual, y el total de tokens de captura de pantalla crece cuadráticamente con la duración de la tarea: una tarea de 15 pasos con 1200 tokens por captura de pantalla quema alrededor de 144 000 tokens de captura de pantalla con el historial completo, frente a aproximadamente 50 000 manteniendo solo los últimos tres. Esa configuración de retención única cambia el componente de costo dominante casi 3 veces, razón por la cual la implementación de referencia de Anthropic recorta las capturas de pantalla antiguas de forma predeterminada. Las mismas matemáticas de contexto de acumulación para agentes de solo texto se tratan en nuestro Calculadora de costos de pasos del agente de IA; Las capturas de pantalla simplemente aumentan las apuestas en un orden de magnitud.
Dos notas prácticas. En primer lugar, el presupuesto para los reintentos: los agentes que utilizan la computadora fallan y vuelven a ejecutar tareas a un ritmo significativo (cambios en la interfaz de usuario, tiempos de espera, clics erróneos), y cualquier estimación honesta debe tener un margen de reintento del 10 al 20 %. En segundo lugar, la resolución es una palanca real: reducir las capturas a la resolución efectiva del modelo antes de enviarlas evita pagar por los píxeles que el modelo vuelve a muestrear de todos modos. Si su carga de trabajo tiene forma de raspado en lugar de interacción, compárela con una carga convencional API de raspado web: cuando no es necesario hacer clic ni escribir, las capturas de pantalla son una forma costosa de leer una página.