Modello e profilo del compito
—token/attività di input
—condivisione di screenshot della fattura
—costo/compito
Conservazione degli screenshot: la principale leva di costo
Stessa attività, stessi passaggi: cambia solo il numero di screenshot precedenti che rimangono nel contesto. I vecchi screenshot di stati di schermo obsoleti raramente migliorano l'azione successiva, ma vengono sempre fatturati come nuovi token di input.
| Strategia | Inserisci tok / attività | Costo/compito | Mensile | vs tieni tutto |
|---|
Il ciclo degli screenshot è il punto in cui muoiono i budget per l'automazione del browser
Un agente che utilizza il computer non legge il DOM: guarda lo schermo. Ogni fase di ogni attività è un viaggio di andata e ritorno completo: acquisisci uno screenshot, invialo al modello come token di input visivo, ottieni un clic, un tipo o un'azione di scorrimento, eseguilo e acquisisci lo screenshot successivo. Con circa 1.000-1.600 token per screenshot (a seconda della risoluzione) e 10-30 passaggi per un'attività di routine, il solo input visivo fa impallidire tutto il resto nella richiesta. L'effettivo output testuale del modello - una coordinata e una breve giustificazione - è banalmente piccolo in confronto. Questa inversione coglie i team alla sprovvista: nei carichi di lavoro di chat i token di output sono la parte costosa; nell'uso del computer, l'input rappresenta in genere l'80-95% del conto.
L'accumulo del contesto è il moltiplicatore in alto. Se l'agente conserva tutti gli screenshot precedenti nella conversazione, il passaggio 15 invia nuovamente quattordici screenshot obsoleti più quello corrente e i token screenshot totali crescono quadraticamente con la durata dell'attività: un'attività in 15 passaggi con 1.200 token per screenshot brucia circa 144.000 token screenshot con cronologia completa contro circa 50.000 mantenendo solo gli ultimi tre. Questa singola impostazione di conservazione modifica la componente di costo dominante di quasi 3 volte, motivo per cui l'implementazione di riferimento di Anthropic taglia i vecchi screenshot per impostazione predefinita. La stessa matematica del contesto di accumulo per gli agenti di solo testo è trattata nel nostro Calcolatore del costo dei passaggi dell'agente AI; gli screenshot aumentano semplicemente la posta in gioco di un ordine di grandezza.
Due note pratiche. Innanzitutto, il budget per i nuovi tentativi: gli agenti che utilizzano il computer falliscono e rieseguono le attività a frequenze significative (modifiche dell'interfaccia utente, timeout, clic errati) e una percentuale di tentativi del 10-20% rientra in qualsiasi stima onesta. In secondo luogo, la risoluzione è una vera leva: ridimensionare le acquisizioni alla risoluzione effettiva del modello prima dell'invio evita di pagare per i pixel che il modello ricampiona comunque. Se il tuo carico di lavoro è basato sullo scraping piuttosto che sull'interazione, confrontalo con un carico convenzionale API di web scraping: quando non è necessario fare clic o digitare, gli screenshot sono un modo costoso per leggere una pagina.
Costo in passi dell'agente AIBudget dell'agente Loop P99Costo di input dell'immagine visivaCosto dell'API Deep Research
Come funziona questa calcolatrice
IL Calcolatore del costo dell'agente per l'utilizzo del computer stima quanto costa eseguire un agente di utilizzo del computer o di automazione del browser, in cui ogni passaggio alimenta un nuovo screenshot nel modello come token di visione. Inserisci il tuo modello, il numero di attività al mese, i prezzi di input e output per milione di token, il numero di screenshot che mantieni nel contesto e la percentuale di attività fallite o riprovate. Da questi, lo strumento proietta la tua fattura mensile. Il driver chiave che cattura è accumulo del contesto: poiché un agente esegue molti passaggi e ogni screenshot è costoso, le immagini conservate si accumulano in un'attività, quindi il costo aumenta con i passaggi, la conservazione delle immagini e i tentativi anziché solo con il conteggio delle attività.
La leva pratica evidenziata da questa calcolatrice è la conservazione degli screenshot. Mantenere ogni screenshot precedente nel contesto fa sì che ogni passaggio ripaghi tutte le immagini precedenti, quindi a strategia mantieni l'ultimo N - conservando solo gli screenshot più recenti - puoi ridurre le bollette circa due o tre volte senza molta perdita di stato utile. Il compromesso da tenere d'occhio è che un taglio troppo aggressivo può eliminare il contesto di cui l'agente ha bisogno, aumentando il fallito/riprovato tariffa e anche i tentativi vengono fatturati. Regola la fidelizzazione e riprova insieme gli input per trovare il punto in cui spendi meno mantenendo le attività affidabili.
Domande frequenti
Perché gli agenti che utilizzano il computer sono molto più costosi dei completamenti della chat?
Un agente che utilizza il computer funziona in loop: effettua lo screenshot dello schermo, lo invia al modello come token di input visivo, riceve un clic o un'azione di pressione di un tasto, eseguilo, esegui nuovamente lo screenshot. Ogni screenshot costa circa 1.000-1.600 token di input a seconda della risoluzione e una singola attività richiede normalmente 10-30 passaggi. Se l'agente mantiene gli screenshot precedenti nel contesto, i token di input crescono ad ogni passaggio: un'attività in 15 passaggi che mantiene la cronologia completa può bruciare ben oltre 150.000 token di input, centinaia di volte un tipico completamento di una chat. I token di visione, non l'output testuale del modello, dominano il conto.
Qual è la strategia keep-last-N screenshot e quanto fa risparmiare?
Invece di inviare nuovamente tutti gli screenshot precedenti in ogni passaggio, l'agente mantiene solo gli N screenshot più recenti nel contesto (l'implementazione di riferimento di Anthropic per impostazione predefinita taglia quelli vecchi). Per un'attività in 15 passaggi con 1.200 token per screenshot, mantenendo la cronologia completa vengono inviati circa 144.000 token di screenshot nell'intera attività, mentre mantenendo gli ultimi 3 vengono inviati circa 50.000: all'incirca una riduzione di 2,9 volte nella componente di costo dominante, di solito senza perdita di successo dell'attività perché i vecchi screenshot di stati di schermo obsoleti raramente aiutano l'azione successiva. È l’unica leva di costo con l’effetto leva più elevato nell’uso del computer.
Come si confrontano i prezzi per l'uso del computer Claude e l'anteprima per l'uso del computer OpenAI?
Entrambi fatturano tariffe standard per i token in sequenza: utilizzo del computer di classe Claude Sonnet a 3 dollari/milione di input e 15 dollari/milione di output (con una tariffa promozionale di 2/milioni di dollari in vigore fino ad agosto 2026), anteprima dell'uso del computer OpenAI a 3 dollari/milione di input e 12 dollari/milione di output. Poiché i token di visione di input dominano il carico di lavoro, la velocità di input conta di più e le due cose sono vicine: la differenza di costo reale deriva dai passaggi per attività e dalla strategia di conservazione degli screenshot, non dal fornitore. Lo strumento di utilizzo del computer di Claude aggiunge inoltre circa 700-1.200 token di sistema/strumento fissi per richiesta, che questo calcolatore modella come sovraccarico per passaggio.