Modelo y perfil de tarea
—tokens de entrada/tarea
—parte de la captura de pantalla de la factura
—costo / tarea
Retención de capturas de pantalla: el mayor coste
Misma tarea, mismos pasos: solo cambia la cantidad de capturas de pantalla anteriores que permanecen en el contexto. Las capturas de pantalla antiguas de estados obsoletos rara vez mejoran la siguiente acción, pero siempre se facturan como tokens de entrada nuevos.
| Estrategia | Entrada tok/tarea | Costo / tarea | Mensual | vs mantener todo |
|---|
El bucle de captura de pantalla es donde mueren los presupuestos de automatización del navegador
Un agente que utiliza una computadora no lee el DOM, sino que mira la pantalla. Cada paso de cada tarea es un viaje completo de ida y vuelta: capture una captura de pantalla, envíela al modelo como tokens de entrada de visión, obtenga una acción de hacer clic, escribir o desplazarse, ejecutarla y capturar la siguiente captura de pantalla. Con aproximadamente 1000-1600 tokens por captura de pantalla (dependiendo de la resolución) y 10-30 pasos para una tarea de rutina, la entrada de visión por sí sola eclipsa todo lo demás en la solicitud. La salida de texto real del modelo (una coordenada y una breve justificación) es trivialmente pequeña en comparación. Esta inversión toma a los equipos con la guardia baja: en las cargas de trabajo de chat, los tokens de salida son la parte cara; en el uso de computadoras, la entrada suele representar entre el 80% y el 95% de la factura.
La acumulación de contexto es el multiplicador superior. Si el agente mantiene todas las capturas de pantalla anteriores en la conversación, el paso 15 reenvía catorce capturas de pantalla obsoletas más la actual, y el total de tokens de captura de pantalla crece cuadráticamente con la duración de la tarea: una tarea de 15 pasos con 1200 tokens por captura de pantalla quema alrededor de 144 000 tokens de captura de pantalla con el historial completo, frente a aproximadamente 50 000 manteniendo solo los últimos tres. Esa configuración de retención única cambia el componente de costo dominante casi 3 veces, razón por la cual la implementación de referencia de Anthropic recorta las capturas de pantalla antiguas de forma predeterminada. Las mismas matemáticas de contexto de acumulación para agentes de solo texto se tratan en nuestro Calculadora de costos de pasos del agente de IA; Las capturas de pantalla simplemente aumentan las apuestas en un orden de magnitud.
Dos notas prácticas. En primer lugar, el presupuesto para los reintentos: los agentes que utilizan la computadora fallan y vuelven a ejecutar tareas a un ritmo significativo (cambios en la interfaz de usuario, tiempos de espera, clics erróneos), y cualquier estimación honesta debe tener un margen de reintento del 10 al 20 %. En segundo lugar, la resolución es una palanca real: reducir las capturas a la resolución efectiva del modelo antes de enviarlas evita pagar por los píxeles que el modelo vuelve a muestrear de todos modos. Si su carga de trabajo tiene forma de raspado en lugar de interacción, compárela con una carga convencional API de raspado web: cuando no es necesario hacer clic ni escribir, las capturas de pantalla son una forma costosa de leer una página.
Costo del paso del agente de IAPresupuesto del agente Loop P99Costo de entrada de imágenes de visiónCosto de la API de investigación profunda
Cómo funciona esta calculadora
El Calculadora de costos del agente de uso de computadora estima lo que cuesta ejecutar un agente de automatización de navegador o uso de computadora, donde cada paso alimenta un nuevo captura de pantalla en el modelo como tokens de visión. Usted ingresa su modelo, la cantidad de tareas por mes, los precios de entrada y salida por millón de tokens, cuántas capturas de pantalla mantiene en contexto y el porcentaje de tareas fallidas o reintentadas. A partir de estos, la herramienta proyecta tu factura mensual. El factor clave que captura es acumulación de contexto: debido a que un agente recorre muchos pasos y cada captura de pantalla es costosa, las imágenes retenidas se acumulan en una tarea, por lo que el costo crece con los pasos, la retención de imágenes y los reintentos en lugar de solo con el recuento de tareas.
La palanca práctica que destaca esta calculadora es la retención de capturas de pantalla. Mantener cada captura de pantalla anterior en contexto hace que cada paso recompense todas las imágenes anteriores, por lo que estrategia de mantener la última N (conservando solo las capturas de pantalla más recientes) puede reducir las facturas aproximadamente dos o tres veces sin mucha pérdida de estado útil. La contrapartida a tener en cuenta es que un recorte demasiado agresivo puede despojar al agente del contexto que necesita, elevando el riesgo. fallido/reintentado y los reintentos también se facturan. Ajuste las entradas de retención y reintento juntas para encontrar el punto en el que gasta menos mientras mantiene las tareas confiables.
Preguntas frecuentes
¿Por qué los agentes que usan computadoras son mucho más caros que completar el chat?
Un agente que utiliza una computadora funciona en un bucle: captura la pantalla, la envía al modelo como tokens de entrada de visión, recibe un clic o una acción de pulsación de tecla, la ejecuta, captura de nuevo. Cada captura de pantalla cuesta aproximadamente entre 1.000 y 1.600 tokens de entrada, dependiendo de la resolución, y una sola tarea requiere habitualmente entre 10 y 30 pasos. Si el agente mantiene las capturas de pantalla anteriores en contexto, los tokens de entrada crecen con cada paso: una tarea de 15 pasos que mantiene el historial completo puede quemar más de 150.000 tokens de entrada, cientos de veces una finalización típica de un chat. Los tokens de visión, no la salida de texto del modelo, dominan el proyecto de ley.
¿Cuál es la estrategia de mantener la última N captura de pantalla y cuánto ahorra?
En lugar de reenviar cada captura de pantalla anterior en cada paso, el agente mantiene solo las N capturas de pantalla más recientes en contexto (la implementación de referencia de Anthropic por defecto recorta las antiguas). Para una tarea de 15 pasos con 1200 tokens por captura de pantalla, mantener el historial completo envía alrededor de 144 000 tokens de captura de pantalla a través de la tarea, mientras que mantener los últimos 3 envía alrededor de 50 000, aproximadamente una reducción de 2,9 veces en el componente de costo dominante, generalmente sin pérdida en el éxito de la tarea porque las capturas de pantalla antiguas de estados de pantalla obsoletos rara vez ayudan en la siguiente acción. Es la palanca de costos de mayor apalancamiento en el uso de computadoras.
¿Cómo se comparan los precios del uso de computadoras de Claude y de la vista previa del uso de computadoras de OpenAI?
Ambos facturan tarifas de token estándar en el bucle: uso de computadora de clase Claude Sonnet a $3/M de entrada y $15/M de salida (con una tasa promocional de $2/$10 vigente hasta agosto de 2026), vista previa del uso de computadora OpenAI a $3/M de entrada y $12/M de salida. Dado que los tokens de visión de entrada dominan la carga de trabajo, la tasa de entrada es lo más importante y los dos están cerca: la diferencia de costo real proviene de los pasos por tarea y la estrategia de retención de capturas de pantalla, no del proveedor. La herramienta de uso informático de Claude también agrega aproximadamente entre 700 y 1200 tokens fijos de sistema/herramienta por solicitud, que esta calculadora modela como gastos generales por paso.