L'API Batch: 50% di sconto per lavori non urgenti
La maggior parte delle persone chiama un modello AI e attende una risposta in tempo reale. Ma gran parte del lavoro sull’intelligenza artificiale non è affatto urgente, come la generazione di report dall’oggi al domani, la classificazione in massa, l’etichettatura dei set di dati. Per questi lavori, le API batch offrono gli stessi modelli con un forte sconto, solitamente intorno al 50%, in cambio della rinuncia a risultati immediati.
Cos'è un'API batch
Un'API batch ti consente di inviare più richieste contemporaneamente come un singolo lavoro, anziché una alla volta in tempo reale. Carichi un file contenente tutte le tue richieste, il provider le elabora in modo asincrono in un periodo di tempo e scarichi i risultati quando sono pronti.
Il trade che stai facendo è semplice: rinunci alla velocità e ottieni un prezzo inferiore. Invece di una risposta in pochi secondi, potresti attendere minuti o ore. In cambio, il costo per token viene generalmente ridotto di circa la metà rispetto alla tariffa sincrona standard.
Perché i fornitori possono offrire lo sconto
Il traffico API in tempo reale è irregolare e imprevedibile. I fornitori devono mantenere la capacità inutilizzata pronta per i picchi di domanda e questo margine inattivo è costoso. I lavori batch sono flessibili: possono essere eseguiti ogni volta che esiste capacità di riserva, livellando il carico.
Poiché consenti al fornitore di pianificare il tuo lavoro durante i periodi più tranquilli, può utilizzare l'hardware in modo più efficiente e restituirti parte del risparmio. Lo sconto non è un modello di qualità inferiore, è esattamente lo stesso modello utilizzato con un programma rilassato.
Come appare il flusso di lavoro
Il tipico flusso batch prevede quattro passaggi:
- Preparare un fascicolo dove ogni riga rappresenta una richiesta, solitamente in un formato strutturato con un ID personalizzato in modo da poter abbinare i risultati agli input.
- Invia il batch e ricevere un ID lavoro.
- Sondaggio per lo stato mentre il fornitore lavora in coda, spesso con un obiettivo di completamento dichiarato, ad esempio entro 24 ore.
- Recupera il file di output una volta completato, associa nuovamente ciascun risultato alla relativa richiesta utilizzando gli ID.
La logica dell'applicazione cambia a malapena, vengono utilizzati gli stessi prompt e gli stessi modelli. Ciò che cambia è che non stai bloccando ogni risposta.
Quali lavori si adattano al modello batch
Batch è l'ideale ogni volta che un essere umano non sta aspettando la risposta:
- Classificazione o tagging in blocco di set di dati di grandi dimensioni.
- Generazione di contenuti per cataloghi, descrizioni di prodotti o riepiloghi prodotti in anticipo.
- Estrazione dei dati da grandi raccolte di documenti.
- Valutazioni e backtesting dove esegui un prompt su migliaia di casi di test.
- Incorporamenti generazione per un intero corpus contemporaneamente.
Non è adatto a qualsiasi cosa interattiva: chatbot, ricerca dal vivo o qualsiasi funzionalità in cui un utente fissa uno spinner di caricamento.
L'economia dell'attesa
È facile ragionare sul risparmio. Se un lavoro costasse $ 200 alla tariffa standard e lo sconto batch fosse del 50%, costerebbe invece $ 100, per un output identico. Su grandi carichi di lavoro ricorrenti la differenza aumenta mese dopo mese.
Ecco un esempio pratico con tariffe illustrative, quindi i conti rimangono concreti. Classificare 1 milione di documenti brevi con 500 token di input e 20 token di output ciascuno equivale a 500 milioni di token di input e 20 milioni di token di output in totale. Ad un tasso indicativo di 0,15 $ per 1 milione di token di input e 0,60 $ per 1 milione di token di output, il prezzo sincrono è di circa 75 $ + 12 $ = 87 $ per l'intero lavoro. Lo stesso lavoro tramite l'endpoint batch a metà prezzo lo riduce a circa $ 43,50: un risparmio di $ 43,50 su una singola esecuzione, prima ancora di contare l'esecuzione del mese successivo. Il calcolatore dei costi LLM ti consente di inserire i conteggi e il volume dei token, quindi dimezzare il totale per visualizzare in anteprima lo scenario batch rispetto a quello in tempo reale utilizzando le tariffe attuali del fornitore.
Cose a cui prestare attenzione
Alcune avvertenze pratiche. I tempi di completamento sono obiettivi, non garanzie, quindi costruisci la tua pipeline per tollerare ritardi variabili. I lotti molto grandi possono essere soggetti a limiti di dimensione o di velocità, quindi potrebbe essere necessario suddividere lavori enormi in blocchi. E paghi comunque sia per i token di input che per quelli di output, lo sconto si applica alla tariffa, non al conteggio dei token, quindi l'efficienza tempestiva è ancora importante.
Le richieste non riuscite all'interno di un batch in genere non vengono fatturate. Se una riga nel file di input non è corretta o una singola richiesta presenta errori, i fornitori generalmente addebitano solo le richieste effettivamente completate, non quelle non riuscite. Ciò significa che una manciata di righe errate non rovinerà lo sconto sul resto del lavoro, ma significa anche che il file di output deve essere confrontato con gli ID di input per vedere quali richieste è necessario inviare nuovamente.
Infine, controlla le specifiche di ciascun fornitore nelle pagine /models, poiché lo sconto esatto, l'obiettivo di restituzione e le funzionalità supportate (ad esempio se la memorizzazione nella cache o gli strumenti funzionano all'interno del batch) differiscono da fornitore a fornitore.
Continua ad imparare
Strumenti correlati
Domande frequenti
L'API batch è un modello più debole?
No. Ottieni lo stesso modello e la stessa qualità di output dell'API in tempo reale. L’unica differenza è che i risultati arrivano più tardi, per questo il prezzo è più basso.
Quanto tempo richiede un lavoro batch?
I fornitori di solito danno un obiettivo di completamento, ad esempio entro 24 ore, e molti lavori terminano molto più velocemente quando la capacità è disponibile. Non è immediato, quindi usalo solo quando nessuno sta aspettando la risposta.
Quanto risparmiano in genere le API batch?
Circa il 50% di sconto sulla tariffa standard per token è comune tra i principali fornitori, applicato sia ai token di input che a quelli di output. Conferma sempre lo sconto attuale per il tuo fornitore e modello specifico.
Pago per le richieste che non riescono all'interno di un batch?
Generalmente no. I fornitori in genere fatturano solo le richieste in un batch effettivamente completato con successo, quindi una richiesta non corretta o un errore occasionale non ti costa lo sconto sul resto del lavoro. Devi comunque controllare il file di output rispetto agli ID inviati per vedere quali richieste non sono riuscite e inviarle nuovamente.
Solo formazione, non consulenza finanziaria.