Modèle et profil de tâche
Rétention des captures d'écran : le plus gros levier de coûts
Même tâche, mêmes étapes : seul le nombre de captures d'écran précédentes reste dans les changements de contexte. Les anciennes captures d'écran d'états d'écran obsolètes améliorent rarement l'action suivante, mais elles sont toujours facturées comme de nouveaux jetons d'entrée.
| Stratégie | Jeton d'entrée/tâche | Coût / tâche | Mensuel | vs garder tout |
|---|
La boucle de capture d'écran est l'endroit où les budgets d'automatisation du navigateur meurent
Un agent informatique ne lit pas le DOM – il regarde l’écran. Chaque étape de chaque tâche est un aller-retour complet : capturez une capture d'écran, envoyez-la au modèle sous forme de jetons d'entrée de vision, récupérez une action de clic, de saisie ou de défilement, exécutez-la et capturez la capture d'écran suivante. Avec environ 1 000 à 1 600 jetons par capture d'écran (en fonction de la résolution) et 10 à 30 étapes pour une tâche de routine, l'entrée de vision éclipse à elle seule tout le reste de la demande. Le résultat textuel réel du modèle – une coordonnée et une brève justification – est trivialement petit en comparaison. Cette inversion prend les équipes au dépourvu : dans les charges de travail de chat, les jetons de sortie sont la partie la plus coûteuse ; dans l'utilisation d'un ordinateur, les dépenses représentent généralement 80 à 95 % de la facture.
L'accumulation de contexte est le multiplicateur en haut. Si l'agent conserve toutes les captures d'écran précédentes de la conversation, l'étape 15 renvoie quatorze captures d'écran obsolètes plus la capture d'écran actuelle, et le nombre total de jetons de capture d'écran augmente quadratiquement avec la longueur de la tâche : une tâche en 15 étapes à 1 200 jetons par capture d'écran brûle environ 144 000 jetons de capture d'écran avec historique complet contre environ 50 000 en ne gardant que les trois derniers. Ce paramètre de rétention unique modifie la composante de coût dominante de près de 3 fois, c'est pourquoi l'implémentation de référence d'Anthropic supprime les anciennes captures d'écran par défaut. Les mêmes calculs de contexte d'accumulation pour les agents textuels sont traités dans notre Calculateur du coût des étapes de l'agent IA; les captures d’écran ne font qu’augmenter les enjeux d’un ordre de grandeur.
Deux notes pratiques. Tout d’abord, prévoyez un budget pour les tentatives : les agents utilisant l’ordinateur échouent et réexécutent les tâches à des taux significatifs (modifications de l’interface utilisateur, délais d’attente, clics erronés), et une allocation de tentatives de 10 à 20 % fait partie de toute estimation honnête. Deuxièmement, la résolution est un véritable levier : la réduction des captures à la résolution effective du modèle avant l'envoi évite de toute façon de payer pour les pixels que le modèle rééchantillonne. Si votre charge de travail est axée sur le grattage plutôt que sur l'interaction, comparez-la à une charge de travail conventionnelle. API de grattage Web: lorsqu'aucun clic ou saisie n'est requis, les captures d'écran sont un moyen coûteux de lire une page.