HomeBlog › Perché le app LLM raggiungono 429 limiti di tariffa

Perché la tua app LLM genera 429 errori: i calcoli del TPM nessuno li spiega

Pubblicato il 28-06-2026 · limiti di riferimento, verifica nella dashboard del tuo fornitore

Hai letto i documenti. Il tuo livello lo consente 500 richieste al minuto. Ne manderai forse otto. Eppure i registri ne sono pieni 429 Too Many Requests. Non c'è niente di sbagliato nel tuo codice: stai raggiungendo il file altro limite, quello che la maggior parte dei tutorial salta: token al minuto (TPM). Tutti i principali provider LLM ti misurano su RPM e TPM allo stesso tempo e, per richieste reali, il limite del token morde quasi sempre per primo.

Due limiti, e quello che effettivamente vincola

Prendi il livello di ingresso di OpenAI per GPT-4o: approssimativamente 500 giri al minuto E 30.000 TPM (riferimento, giugno 2026). Il numero di giri sembra generoso. Ma un prompt potenziato per il recupero con alcuni documenti inseriti può facilmente esserlo 4.000 gettoni dentro e 500 fuori - chiamiamoli 4.500 token per richiesta. Ora fai la divisione che i documenti non fanno:

LimiteValoreRichieste massime/min a 4.500 tok
Giri/min (richieste/min)500500
TPM (gettoni/min)30,0006.7 ◀ vincola

I prezzi sono stime di riferimento, luglio 2026. Segnala prezzo obsoleto →

Quindi il tuo vero soffitto è meno di sette richieste al minuto, non 500. Il limite del token ti limita all'1,3% di ciò che implicava il limite della richiesta. Ecco perché i 429 iniziano con un traffico a una cifra e perché "invia più lentamente" o "aggiungi un nuovo tentativo" tratta il sintomo, non la causa.

Trasforma il limite in qualcosa che puoi pianificare: utenti simultanei

Le richieste al minuto sono astratte. Quello che vuoi veramente sapere è quante persone possono utilizzare l'app contemporaneamente. Se ogni utente attivo invia circa due richieste al minuto, il limite massimo di 6,7 RPM è di circa tre utenti simultanei prima che le richieste inizino ad essere accodate. Va bene per una demo; un muro per un lancio. La soluzione raramente è un ciclo più veloce: è una delle quattro leve:

Non è solo OpenAI

La stessa trappola esiste ovunque, a volte più stretta. Il livello Claude di Anthropic è in circolazione 50 giri/min/40.000 giri al minuto; Google's free Gemini 2.5 Flash tier is generous on tokens (~250,000 TPM) but stingy on requests (~10 RPM). The binding limit flips depending on whether your prompts are big or your traffic is spiky — which is exactly why a single rule of thumb fails. You have to plug in tuo dimensione del gettone.

Questo è ciò che è nuovo calcolatore del limite di tariffa fa: inserisci un livello (o il tuo TPM/RPM reale), i tuoi token di input e output e la frequenza con cui ciascun utente chiama, e ti dice le richieste effettive al minuto, gli utenti simultanei che puoi servire e quale limite è il collo di bottiglia. È il modo più veloce per scoprire se un lancio colpirà un muro prima che lo facciano i tuoi utenti.

L'asporto

Gli errori 429 al di sotto del limite RPM non sono un bug: sono il limite di token al minuto che fa il suo lavoro. Capacità dimensionale attivata gettoni, non la richiesta conta; tagliare il contesto prima di raggiungere nuovi tentativi; e ricorda che il limite aumenta con la spesa. Una volta che conosci il tuo tetto reale, valuta il traffico con il Calcolatore del costo del token LLM e modellare l'intera app su Stima dei costi delle app AI.

I limiti tariffari sono cifre di riferimento (giugno 2026) e variano in base al fornitore, al modello e al livello dell'account: confermali sempre nella tua dashboard. Imparentato: Calcolatore del limite di velocità · Risparmi API batch · API LLM più economica.