Modelo e perfil de tarefa

tokens de entrada/tarefa
captura de tela parcela da conta
custo / tarefa
custo mensal

Retenção de capturas de tela – a maior alavanca de custos

Mesma tarefa, mesmas etapas – apenas quantas capturas de tela anteriores permanecem nas mudanças de contexto. Capturas de tela antigas de estados de tela obsoletos raramente melhoram a próxima ação, mas sempre são cobradas como novos tokens de entrada.

EstratégiaInserir tok/tarefaCusto/tarefaMensalvs manter tudo

O loop de captura de tela é onde os orçamentos de automação do navegador morrem

Um agente de uso de computador não lê o DOM – ele olha para a tela. Cada etapa de cada tarefa é uma viagem completa: capture uma captura de tela, envie-a para o modelo como tokens de entrada de visão, receba de volta uma ação de clique, digitação ou rolagem, execute-a e capture a próxima captura de tela. Com cerca de 1.000 a 1.600 tokens por captura de tela (dependendo da resolução) e 10 a 30 etapas para uma tarefa de rotina, a entrada de visão por si só supera todo o resto da solicitação. A saída de texto real do modelo — uma coordenada e uma breve justificativa — é trivialmente pequena em comparação. Essa inversão pega as equipes desprevenidas: nas cargas de trabalho de chat, os tokens de saída são a parte cara; no uso do computador, a entrada normalmente representa 80-95% da conta.

A acumulação de contexto é o multiplicador no topo. Se o agente mantiver todas as capturas de tela anteriores na conversa, a etapa 15 reenviará quatorze capturas de tela obsoletas mais a atual, e o total de tokens de captura de tela crescerá quadraticamente com o comprimento da tarefa – uma tarefa de 15 etapas com 1.200 tokens por captura de tela queima cerca de 144 mil tokens de captura de tela com histórico completo versus cerca de 50 mil mantendo apenas os três últimos. Essa configuração de retenção única altera o componente de custo dominante em quase 3x, e é por isso que a implementação de referência do Anthropic corta capturas de tela antigas por padrão. A mesma matemática de contexto acumulado para agentes somente texto é abordada em nosso Calculadora de custo de etapa do agente de IA; as capturas de tela apenas aumentam as apostas em uma ordem de magnitude.

Duas notas práticas. Primeiro, o orçamento para novas tentativas: os agentes que usam o computador falham e executam novamente tarefas em taxas significativas (mudanças na interface do usuário, tempos limite, cliques errados), e uma margem de repetição de 10 a 20% pertence a qualquer estimativa honesta. Em segundo lugar, a resolução é uma alavanca real - reduzir a escala das capturas para a resolução efetiva do modelo antes do envio evita pagar pelos pixels que o modelo faz uma nova amostragem de qualquer maneira. Se sua carga de trabalho tiver formato de raspagem e não de interação, compare com uma carga convencional API de web scraping: quando não é necessário clicar ou digitar, as capturas de tela são uma forma cara de ler uma página.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Custo da etapa do agente AIOrçamento do Agente Loop P99Custo de entrada de imagem de visãoCusto da API de pesquisa profunda