Come funziona questa calcolatrice
IL Calcolatore dei tempi e dei costi di elaborazione batch stima due cose per un lavoro LLM in blocco: il l'ora dell'orologio da parete ci vuole per finire e il costo totale della corsa. Moltiplica il conteggio dei tuoi articoli per i token generati per articolo per ottenere il volume totale dei token, quindi applica il prezzo per 1 milione di token per produrre la cifra in dollari. Il runtime deriva dalla divisione del lavoro del token tra i tuoi lavoratori: la velocità per lavoratore in token al secondo e il numero di lavoratori paralleli insieme impostano il throughput, quindi una maggiore concorrenza riduce il tempo trascorso anche se la fattura del token rimane la stessa.
Il compromesso chiave è questo la concorrenza riduce i tempi ma non i costi. Raddoppiando i lavoratori si dimezza all'incirca la durata dell'orologio da parete, ma si paga comunque per ogni token generato. Prima di aumentare le dimensioni, controlla se la stima dei token per articolo è realistica lunghezza di uscita è il principale fattore determinante sia in termini di tempo che di spesa. Taglia prima gli output dettagliati, quindi aumenta il numero dei lavoratori per rispettare la scadenza.
Domande frequenti
Come posso stimare la durata di un lavoro LLM in blocco?
Gettoni totali = articoli × gettoni per articolo. Dividere per il throughput combinato (velocità per lavoratore × numero di lavoratori paralleli) per ottenere i secondi dell'orologio. Dieci lavoratori a 60 tok/s consegnano 600 tok/s, quindi un lavoro da 8 milioni di token richiede circa 3,7 ore, prima che i limiti di velocità ti limitino.
Dovrei invece utilizzare l'API batch?
Se il lavoro non è urgente, sì. Gli endpoint batch (OpenAI, Anthropic, Gemini) eseguono lavori in modo asincrono all'interno di una finestra di 24 ore a circa la metà del prezzo per token. Scambia la latenza immediata con un grande sconto: ideale per integrazioni di backfill, valutazioni e arricchimento offline.