Metrico Al giorno Al mese

Cosa costa effettivamente denaro con i nuovi tentativi?

429 errori stessi sono gratuiti — non vengono fatturati token quando una richiesta ha una velocità limitata prima dell'inizio dell'elaborazione. I costi reali sono:

  1. Riprovare le richieste — ogni tentativo invia nuovamente la richiesta di input completa. Se il tentativo ha esito positivo, paghi i token. Se l'input è di 2.000 token, 3 tentativi sul 3% delle richieste aggiungono 0,09 input aggiuntivi per richiesta riuscita.
  2. Duplicati di timeout - quando una richiesta impiega troppo tempo e il codice riprova, ma l'originale è stato effettivamente elaborato. Paghi per due completamenti. Ciò è particolarmente costoso con richieste di grandi quantità.
  3. Richieste non riuscite — se tutti i tentativi vengono esauriti e la richiesta fallisce, hai sprecato latenza e qualsiasi costo parziale del token di input se il fornitore addebita alla ricezione.

Risolvilo: Utilizzare un limitatore di velocità token al minuto locale (ad esempio LangChain ContextWindowExceededHandler o un semplice bucket di token) per attenuare i burst prima che raggiungano l'API. Ciò elimina la maggior parte dei 429 senza aumentare i costi.

Imparentato: Pianificatore del budget API · Previsione dei costi · Pista di livello libero

Domande frequenti

Mi verranno addebitate le chiamate API che restituiscono un errore di limite di velocità 429?

No: gli errori 429 vengono rifiutati prima dell'elaborazione e non ti vengono addebitati. Il costo reale è la logica dei nuovi tentativi, le risposte ritardate e talvolta i completamenti duplicati se la logica dei nuovi tentativi presenta bug.

Cos'è il backoff esponenziale e perché aumenta i costi di latenza?

Backoff esponenziale significa attendere 1s, 2s, 4s, 8s... tra un nuovo tentativo e l'altro. Un singolo 429 con 2 tentativi aggiunge 3–7 secondi di latenza. Se i sistemi a valle hanno degli SLA, ciò ha un costo operativo reale anche se il costo simbolico è pari a zero.

In che modo i nuovi tentativi causano addebiti duplicati?

Se una richiesta ha esito positivo ma scade prima che arrivi la risposta, un nuovo tentativo ingenuo viene inviato nuovamente e, se il primo ha avuto esito positivo, si paga per due completamenti. Utilizza sempre le chiavi di idempotenza o verifica i risultati esistenti prima di riprovare in caso di timeout.

Qual è la tariffa media 429 per le API LLM?

Il traffico intenso può raggiungere tassi di errore del 10–30%. Il traffico stabile ben al di sotto dei limiti in genere registra meno dello 0,1%. La maggior parte dei provider ora utilizza limiti di token al minuto, che puniscono le richieste di contesto di grandi dimensioni più dei limiti di conteggio delle richieste.

Come posso ridurre i costi dei nuovi tentativi API?

Quattro approcci: (1) Limite di velocità a livello locale con un token bucket. (2) Utilizzare una coda con concorrenza controllata. (3) Configurare l'elaborazione asincrona in modo che i nuovi tentativi avvengano in background. (4) Risposte nella cache per prompt identici.