Pubblicato il 23-07-2026 · numeri di riferimento, verificare prima di definire il budget
Ogni conversazione sui costi dell'IA inizia con i token. Costruiamo calcolatrici per vivere e le calcolatrici a gettone sono quelle che le persone usano: le confronto dei prezzi è la pagina più frequentata di questo sito con un ampio margine. Quindi questa settimana abbiamo fatto l'esercizio opposto: abbiamo scritto guide per quattro pezzi di infrastruttura degli agenti — Cerebri per deduzione, E2B per sandbox di codice, Base del browser per browser headless e LiveKit per il trasporto in tempo reale – e poi valutare un compito realistico tra tutti e quattro contemporaneamente.
L'attività: una chiamata vocale di dieci minuti in cui un agente parla con un utente, esplora quattro minuti di pagine Web ed esegue cinque brevi script. Il risultato non era vicino. I token LLM sono arrivati allo 0,89% del conto. La larghezza di banda del proxy ammontava a tre quarti.
La cosa che rende difficile il budget dell'infrastruttura degli agenti è che nessuno di questi servizi fattura all'unità in cui pensi all'attività. Pensi in "chiamate" o "attività"; fatturano in secondi sandbox, ore browser, gigabyte e minuti partecipante.
| Servizio | Metro | Valutare | La trappola |
|---|---|---|---|
| Cerebri | gettoni in entrata/uscita | $ 0,35 / $ 0,75 per 1 milione | nessuno: questo è quello onesto e ben compreso |
| E2B | durata del sandbox, al secondo | ≈$ 0,10/ora | il tempo di inattività viene fatturato come il tempo di esecuzione |
| Base del browser | ore browser + GB proxy | ≈$ 0,12/ora · ≈$ 12/GB | il contatore GB è 100× il contaore |
| LiveKit | min partecipante + min agente | ≈$ 0,0005 · ≈$ 0,01 | il contatore dell'agente è 20× il contatore del trasporto |
Tassi di riferimento, luglio 2026. Segnala prezzo obsoleto →
Guarda la colonna delle trappole. Tre dei quattro servizi hanno un contatore secondario che costa un ordine di grandezza o più di quello indicato nel titolo della pagina dei prezzi. Questo non è un inganno: ognuno di questi numeri è pubblicato apertamente. È solo che il modello mentale che porti ("un browser costa dodici centesimi l'ora, va bene") attribuisce al numero sbagliato.
Ecco la chiamata di dieci minuti, costata due volte: la prima da parte di un team che chiude i suoi sandbox e blocca le immagini nel browser, e l'altra da parte di un team che non fa né l'una né l'altra cosa. Stessa funzionalità, stesso utente, stessi modelli.
| Elemento pubblicitario | Disciplinato | Troppo liquido | Cosa è cambiato |
|---|---|---|---|
| LiveKit — 10 minuti agente + 20 minuti partecipante | $0.1100 | $0.1100 | Niente; Il 91% è il contatore dell'agente |
| Cerebras: gettoni da 8k in ingresso / 2k in uscita | $0.0043 | $0.0043 | Niente |
| E2B: 5 sandbox | $0.0028 | $0.5040 | chiuso dopo 20 secondi rispetto al timeout di 1 ora |
| Browserbase: 4 minuti di navigazione | $0.0080 | $0.0080 | Niente |
| Browserbase: larghezza di banda proxy | $0.3600 | $2.4000 | 30 MB con immagini bloccate contro 200 MB senza |
| Totale per chiamata | $0.485 | $3.026 | 6.2× |
| Ogni 1.000 chiamate | $485 | $3,026 | lo stesso prodotto, due volte |
Due cose saltano all'occhio. Il primo è che il divario tra le colonne non è una decisione sui prezzi: nessuno ha cambiato fornitore, nessuno ha negoziato un livello. Si tratta di due abitudini di configurazione: chiamata kill() su una sandbox invece di lasciarlo scadere e bloccare immagini e caratteri in un browser headless che è lì solo per leggere il testo. Tra di loro rappresentano una differenza di 6,2× nell’economia unitaria.
La seconda è che lo è la linea dei token, quella di cui parla ogni articolo di costo su Internet $0.0043. Meno dell'1% della fattura disciplinata e meno di due decimi di quella sciatta. Potresti dimezzare la spesa in token – cambiare modello, comprimere i prompt, memorizzare nella cache in modo aggressivo – e spostare il totale dello 0,4%. Potresti bloccare le immagini in una riga della configurazione di Playwright e spostarle del 42%.
Fatture E2B al secondo di sandbox tutta la vita, non per secondo di esecuzione. Uno script che viene eseguito per venti secondi all'interno di una sandbox costa circa $ 0,00056. Lo script identico all'interno di un sandbox lasciato per esaurire il limite di sessione di un'ora costa $ 0,10 — 180 volte di più per lo stesso calcolo, con i 3.580 secondi extra spesi a non fare assolutamente nulla. In un ciclo dell'agente che genera una sandbox per passaggio, questo non è un errore di arrotondamento; è la differenza tra l'infrastruttura degli agenti che è economica e l'essere la seconda riga più grande in fattura.
La soluzione è una riga di codice di smontaggio e il motivo per cui i team non la notano è che funziona bene in fase di sviluppo. Un prototipo con tre prove al giorno non se ne accorge mai; il contatore diventa visibile solo al volume di produzione, a quel punto l'abitudine viene inserita nel percorso del codice. Se stai creando un ciclo agente, modellalo con il file calcolatore del budget del loop dell'agente prima di ridimensionarlo, non dopo.
Browserbase addebita circa $ 0,12 per un'ora di navigazione e circa $ 12 per un gigabyte di larghezza di banda proxy. Questo rapporto – 100:1 – significa che una singola ora di navigazione deve spostare solo circa dieci megabyte prima che la larghezza di banda e il calcolo costino lo stesso, e le pagine web moderne spostano dieci megabyte senza provarci. La nostra sessione di navigazione di quattro minuti a 200 MB costava 2,40 dollari di larghezza di banda contro 0,008 dollari di tempo del browser: la larghezza di banda era 300× il calcolo.
Il blocco di immagini, caratteri, video e fogli di stile in un browser di scraping in genere riduce il carico utile dell'80-90%, da cui deriva la nostra cifra disciplinata di 30 MB. Se l'agente sta leggendo del testo, e per la maggior parte delle attività dell'agente lo è, nessuno di quel carico utile verrà mai utilizzato. Questa è la stessa lezione di i costi nascosti che raddoppiano le tue fatture AI e SMS: la forma dell'utilizzo determina la fattura molto più della tariffa del contrassegno.
La tariffa partecipante-minuto di LiveKit è il numero in ogni articolo comparativo: circa $ 0,0005 al minuto, che sembra niente perché non è niente. Il contatore della sessione agente costa circa 0,01 dollari al minuto – venti volte di più – ed è quello che viene effettivamente utilizzato durante una chiamata dell’agente. Nel nostro esempio di dieci minuti, i minuti del partecipante ammontavano a un centesimo e i minuti dell'agente a dieci. Una stima costruita a partire dal tasso principale è 10 volte più bassa.
Nessuno di questi include i modelli vocali: la trascrizione, il turno LLM e la sintesi vocale sono tutti fatturati da chi li fornisce, oltre a tutto quanto sopra. Valuta l'intero stack con il Calcolatore dei costi dell'agente vocale AI.
L'infrastruttura degli agenti non è costosa. L'infrastruttura degli agenti configurata con abitudini di sviluppo al volume di produzione è costosa e le due sono separate di circa sei volte sui nostri numeri. La parte scomoda è che tutto il denaro è espresso in contatori di cui nessuno scrive post sul blog – secondi sandbox, gigabyte proxy, minuti di sessione agente – mentre il contatore di cui tutti scrivono si è rivelato essere la riga più piccola sulla fattura.
Leggi le guide: Cerebri · E2B · Base del browser · LiveKit · Tutto API AI e agenti.
Metodologia: le tariffe sono i dati di riferimento pubblicati a luglio 2026, confrontati con la pagina dei prezzi pubblici di ciascun fornitore durante la stesura delle quattro guide collegate sopra. L’esempio pratico è uno scenario costruito, non la telemetria di un sistema di produzione: il punto è il rapporto tra i contatori, che vale per un’ampia gamma di ipotesi, non il totale assoluto. Conferma i prezzi attuali prima di stabilire il budget.