Pubblicato il 07-08-2026 · numeri di riferimento, verificare prima della stesura del budget
OpenAI, Anthropic e Gemini gestiscono tutti lo stesso mestiere: inviare un lavoro invece di una richiesta, attendere fino a 24 ore, pagare circa la metà. Stesso modello, stessi pesi, stessa qualità di output: l'unica cosa che cambia è quando arriva la risposta. I team considerano questa decisione come una decisione sul volume, qualcosa che si attiva una volta che il carico di lavoro diventa abbastanza grande da occuparsene. Non lo è. È una decisione di interazione e non ha nulla a che fare con le dimensioni.
Tutti e tre i principali fornitori raggruppano allo stesso modo: caricano un file di prompt, il lavoro viene eseguito in modo asincrono entro una finestra di 24 ore e il prezzo per token ammonta a circa il 50% della tariffa sincrona standard. Non è un modello più piccolo o più stupido a svolgere il lavoro: è il modello identico, che genera lo stesso output che avrebbe generato in tempo reale. Il risparmio deriva dalla pianificazione, non dalla scorciatoia: i fornitori mantengono la capacità in tempo reale pronta per i picchi di traffico, e questo margine inattivo è costoso. Un processo batch può essere eseguito ogni volta che esiste capacità di riserva, in modo che il provider restituisca parte di tale efficienza.
I calcoli non hanno bisogno di una calcolatrice per capirne la forma: un lavoro che costa $ 200 alla tariffa standard costa $ 100 attraverso l'endpoint batch, per lo stesso output. Su un carico di lavoro eseguito una volta, è un elemento pubblicitario interessante. Su un carico di lavoro eseguito ogni notte per un anno, rappresenta la differenza tra una voce di budget reale e un errore di arrotondamento.
Classificazione di 1 milione di documenti brevi - 500 token di input e 20 token di output ciascuno - rispetto a una tariffa di riferimento di $ 2,50 / $ 10,00 per 1 milione di token (input/output; prezzi di riferimento illustrativi, conferma la tariffa effettiva del tuo modello prima di definire il budget):
| Sentiero | Costo di ingresso | Costo di produzione | Totale |
|---|---|---|---|
| Sincrono (tariffa standard) | $1,250.00 | $200.00 | $1,450.00 |
| Lotto (~50% di sconto) | $625.00 | $100.00 | $725.00 |
| Salvato | $725.00 (50%) | ||
| 1 milione di documenti × 500 token in ingresso/20 in uscita. Prezzi di riferimento: imposta la tua tariffa su calcolatore del risparmio API batch. | |||
$ 725 risparmiati su un pass di classificazione. Esegui lo stesso lavoro di notte per una pipeline di reindicizzazione e l'endpoint batch si ripaga da solo nella prima settimana, senza alcuna variazione nella qualità dell'output, perché nulla di ciò che produce il modello è diverso.
La documentazione batch di ogni fornitore utilizza la stessa parola attenta: target. La finestra di 24 ore non è uno SLA. I lavori spesso finiscono più velocemente, a volte in pochi minuti, ma nulla lo obbliga e una pipeline costruita presupponendo una consegna rapida alla fine rimarrà in attesa per ore senza alcuna possibilità di ricorso. Batch molto grandi possono anche raggiungere limiti di dimensione o velocità, il che significa che un lavoro davvero enorme potrebbe dover essere suddiviso in più invii anziché in uno solo, aggiungendo orchestrazione a una chiamata sincrona mai necessaria in primo luogo.
Niente di tutto ciò conta per un lavoro che non aspetta nulla. È completamente importante per un lavoro per il quale una persona sta fissando uno spinner. Questa è la vera linea di demarcazione: non "questo carico di lavoro è abbastanza grande", ma "c'è qualcosa di bloccato in questa risposta in questo momento".
Salta la soglia del volume. Poni una domanda: un essere umano o un sistema a valle aspettano in modo sincrono questa risposta specifica? In caso negativo (un riempimento notturno di incorporamenti, una riclassificazione di massa, un arretrato di documenti che nessuno guarda in tempo reale) il batch è vicino a un taglio gratuito del 50%, punto, prendilo. Se sì, una risposta di un chatbot, un risultato di ricerca dal vivo, qualsiasi cosa visualizzata dietro uno spinner di caricamento, il batch non è uno sconto a cui puoi accedere, indipendentemente da quanto volume lo giustificherebbe sulla carta. La dimensione del lavoro non entra mai nella decisione. Lo fa solo se c'è qualcosa che lo sta aspettando.
Ciò significa anche che la stessa applicazione può utilizzare entrambi i percorsi contemporaneamente: sincrono per il turno di chat dal vivo che un utente sta guardando, batch per il lavoro notturno che incorpora nuovamente tutto ciò che la chat ha toccato quel giorno. Valuta il lato sincrono con il calcolatore rapido del risparmio di memorizzazione nella cache se si tratta di un carico di lavoro con contesto ripetuto e il lato batch con il file calcolatore del risparmio API batch - stanno risolvendo metà diverse dello stesso conto. Per i meccanismi di ciò che conta come lavoro batch e quali fornitori supportano cosa, vedere Spiegazione dell'API batch; per sapere se la tua pipeline può effettivamente tollerare l'attesa, il calcolatore del tempo di elaborazione batch prezzi direttamente dal lato del turnaround.
Metodologia: lo sconto batch di circa 50% e la finestra target di 24 ore riflettono i termini API batch pubblicati da OpenAI, Anthropic e Gemini a partire da agosto 2026. L'esempio utilizzato utilizza un tasso di riferimento rotondo e chiaramente etichettato ($ 2,50/$ 10,00 per 1 milione di token) anziché il prezzo attuale esatto di qualsiasi singolo fornitore: conferma le tariffe sincrone e batch effettive del tuo modello prima di definire il budget. L'esempio è uno scenario costruito inteso a mostrare come viene scalato lo sconto, non la telemetria da un sistema di produzione.