Modelo e perfil de tarefa
—tokens de entrada/tarefa
—captura de tela parcela da conta
—custo / tarefa
Retenção de capturas de tela – a maior alavanca de custos
Mesma tarefa, mesmas etapas – apenas quantas capturas de tela anteriores permanecem nas mudanças de contexto. Capturas de tela antigas de estados de tela obsoletos raramente melhoram a próxima ação, mas sempre são cobradas como novos tokens de entrada.
| Estratégia | Inserir tok/tarefa | Custo/tarefa | Mensal | vs manter tudo |
|---|
O loop de captura de tela é onde os orçamentos de automação do navegador morrem
Um agente de uso de computador não lê o DOM – ele olha para a tela. Cada etapa de cada tarefa é uma viagem completa: capture uma captura de tela, envie-a para o modelo como tokens de entrada de visão, receba de volta uma ação de clique, digitação ou rolagem, execute-a e capture a próxima captura de tela. Com cerca de 1.000 a 1.600 tokens por captura de tela (dependendo da resolução) e 10 a 30 etapas para uma tarefa de rotina, a entrada de visão por si só supera todo o resto da solicitação. A saída de texto real do modelo — uma coordenada e uma breve justificativa — é trivialmente pequena em comparação. Essa inversão pega as equipes desprevenidas: nas cargas de trabalho de chat, os tokens de saída são a parte cara; no uso do computador, a entrada normalmente representa 80-95% da conta.
A acumulação de contexto é o multiplicador no topo. Se o agente mantiver todas as capturas de tela anteriores na conversa, a etapa 15 reenviará quatorze capturas de tela obsoletas mais a atual, e o total de tokens de captura de tela crescerá quadraticamente com o comprimento da tarefa – uma tarefa de 15 etapas com 1.200 tokens por captura de tela queima cerca de 144 mil tokens de captura de tela com histórico completo versus cerca de 50 mil mantendo apenas os três últimos. Essa configuração de retenção única altera o componente de custo dominante em quase 3x, e é por isso que a implementação de referência do Anthropic corta capturas de tela antigas por padrão. A mesma matemática de contexto acumulado para agentes somente texto é abordada em nosso Calculadora de custo de etapa do agente de IA; as capturas de tela apenas aumentam as apostas em uma ordem de magnitude.
Duas notas práticas. Primeiro, o orçamento para novas tentativas: os agentes que usam o computador falham e executam novamente tarefas em taxas significativas (mudanças na interface do usuário, tempos limite, cliques errados), e uma margem de repetição de 10 a 20% pertence a qualquer estimativa honesta. Em segundo lugar, a resolução é uma alavanca real - reduzir a escala das capturas para a resolução efetiva do modelo antes do envio evita pagar pelos pixels que o modelo faz uma nova amostragem de qualquer maneira. Se sua carga de trabalho tiver formato de raspagem e não de interação, compare com uma carga convencional API de web scraping: quando não é necessário clicar ou digitar, as capturas de tela são uma forma cara de ler uma página.
Custo da etapa do agente AIOrçamento do Agente Loop P99Custo de entrada de imagem de visãoCusto da API de pesquisa profunda
Como funciona esta calculadora
O Calculadora de custos de agente de uso de computador estima quanto custa executar um agente de uso de computador ou de automação de navegador, onde cada etapa alimenta um novo captura de tela no modelo como tokens de visão. Você insere seu modelo, o número de tarefas por mês, os preços de entrada e saída por milhão de tokens, quantas capturas de tela você mantém no contexto e a porcentagem de tarefas com falha ou repetidas. A partir deles, a ferramenta projeta sua fatura mensal. O principal driver que ele captura é acumulação de contexto: como um agente percorre muitas etapas e cada captura de tela é cara, as imagens retidas se acumulam em uma tarefa, de modo que o custo aumenta com as etapas, a retenção de imagens e as novas tentativas, em vez de apenas com a contagem de tarefas.
A alavanca prática que esta calculadora destaca é a retenção de capturas de tela. Manter todas as capturas de tela anteriores no contexto faz com que cada etapa pague novamente por todas as imagens anteriores, portanto, um estratégia manter o último N – retendo apenas as capturas de tela mais recentes – pode reduzir as contas cerca de duas a três vezes sem muita perda de estado útil. A desvantagem a ser observada é que o corte muito agressivo pode retirar o contexto que o agente precisa, aumentando o falhou/tentou novamente taxa e novas tentativas também são cobradas. Ajuste a retenção e tente novamente as entradas em conjunto para encontrar o ponto onde você gasta menos, mantendo as tarefas confiáveis.
Perguntas frequentes
Por que os agentes que usam computadores são muito mais caros do que as conclusões de bate-papo?
Um agente de uso de computador funciona em loop: captura de tela da tela, envia-a para o modelo como tokens de entrada de visão, recebe uma ação de clique ou pressionamento de tecla, executa-a, captura de tela novamente. Cada captura de tela custa cerca de 1.000 a 1.600 tokens de entrada, dependendo da resolução, e uma única tarefa leva rotineiramente de 10 a 30 etapas. Se o agente mantiver capturas de tela anteriores no contexto, os tokens de entrada aumentarão a cada passo – uma tarefa de 15 etapas que mantém o histórico completo pode queimar bem mais de 150 mil tokens de entrada, centenas de vezes uma conclusão típica de um bate-papo. Os tokens de visão, e não a saída de texto do modelo, dominam o projeto.
Qual é a estratégia de captura de tela keep-last-N e quanto ela economiza?
Em vez de reenviar todas as capturas de tela anteriores em cada etapa, o agente mantém apenas as N capturas de tela mais recentes no contexto (o padrão da implementação de referência do Anthropic é cortar as antigas). Para uma tarefa de 15 etapas com 1.200 tokens por captura de tela, manter o histórico completo envia cerca de 144 mil tokens de captura de tela em toda a tarefa, enquanto mantém os últimos 3 envios em cerca de 50 mil – aproximadamente uma redução de 2,9x no componente de custo dominante, geralmente sem perda no sucesso da tarefa porque capturas de tela antigas de estados de tela obsoletos raramente ajudam na próxima ação. É a alavanca de custo de maior alavancagem no uso do computador.
Como se comparam os preços de uso do computador Claude e de visualização do uso do computador OpenAI?
Ambos cobram taxas de token padrão no loop: uso de computador da classe Claude Sonnet a US$ 3/M de entrada e US$ 15/M de saída (com uma taxa promocional de US$ 2/US$ 10 em vigor até agosto de 2026), visualização de uso de computador OpenAI a US$ 3/M de entrada e US$ 12/M de saída. Como os tokens de visão de entrada dominam a carga de trabalho, a taxa de entrada é mais importante e as duas estão próximas – a diferença real de custo vem das etapas por tarefa e da estratégia de retenção de captura de tela, não do provedor. A ferramenta de uso de computador de Claude também adiciona cerca de 700 a 1.200 tokens fixos de sistema/ferramenta por solicitação, que esta calculadora modela como sobrecarga por etapa.