Tetto RPM vs TPM alla dimensione del tuo token
La barra più piccola è quella che effettivamente ti strozza.
| Limite | Valore | Richiesta massima/min | Si lega? |
|---|
Perché due limiti e perché sono importanti
Tutti i principali fornitori di LLM (OpenAI, Anthropic, Google, Mistral) ti seguono richieste al minuto E gettoni al minuto contemporaneamente. Il problema è che il limite dei token è quello che la maggior parte delle persone dimentica. Un budget di 30.000 TPM sembra elevato finché non invii richieste di 4.000 token: si tratta solo di circa 7 richieste al minuto prima di iniziare a ricevere 429 Too Many Requests, anche se il limite RPM potrebbe consentirne centinaia. La soluzione non è quasi mai "invia più velocemente": si tratta di tagliare il contesto, limitare la lunghezza dell'output o aumentare il livello di utilizzo.
Questa calcolatrice fa la divisione per te. Prende sia i limiti che i tuoi token per richiesta, trova il tetto più piccolo e lo trasforma in qualcosa su cui puoi pianificare: utenti attivi simultanei. Se sai che ogni utente invia circa due richieste al minuto, il numero utente ti dice quante persone serve una chiave prima che le richieste vengano messe in coda. Quando ti trovi di fronte al muro, le opzioni oneste sono: rimpicciolire il prompt (spesso la leva più grande), accorciare max_tokens, lavori in batch non urgenti sul API batch asincronaoppure qualificarti per un livello superiore spendendo di più.
Una volta dimensionato il throughput, stabilisci il prezzo: the Calcolatore del costo del token LLM trasforma quei gettoni in dollari e il Stima dei costi delle app AI modella l'intera fattura in base al conteggio degli utenti. Costruire un prodotto di chat? IL calcolatore dei costi del chatbot collega il volume delle conversazioni sia ai costi che alla velocità effettiva.
Come usarlo
1. Scegli un livello preimpostato o digita i limiti RPM e TPM dalla dashboard del tuo fornitore.
2. Inserisci i token di input e output utilizzati da una richiesta tipica (anche l'output viene conteggiato ai fini del TPM).
3. Imposta il numero di richieste inviate da un utente attivo al minuto.
4. Leggi le richieste effettive al minuto, gli utenti simultanei e quale limite rappresenta il collo di bottiglia.
Errori comuni
Contare solo i token di input. Anche i token di output vengono fatturati e hanno una velocità limitata: un modello loquace con risposte lunghe brucia velocemente il TPM. Dimensionamento al limite RPM. Se i tuoi prompt sono grandi, TPM ti limita prima; il numero di giri è irrilevante. Supponendo che il limite sia fisso. I livelli aumentano automaticamente man mano che la tua spesa cresce, quindi un muro oggi potrebbe essere eliminato il mese prossimo. Ignorando gli scoppi. I limiti sono medie al minuto ma vengono applicati in periodi brevi, quindi il traffico intenso raggiunge 429 secondi al di sotto della media.
Domande frequenti
Come posso trasformare un limite TPM in richieste al minuto?
Dividi TPM per token per richiesta (input + output). Il risultato è il limite massimo delle richieste lato token; il tuo vero limite è il più piccolo tra quello e il limite RPM.
Perché ricevo errori 429 al di sotto del limite RPM?
Perché invece il limite di token al minuto è vincolante. Richieste o output lunghi esauriscono il TPM prima di raggiungere il conteggio delle richieste. Riduci la lunghezza del prompt o del limite dell'output.
Quanti utenti può servire una chiave API?
Richieste effettive al minuto ÷ richieste per utente al minuto. Aumentalo tagliando i token, raggruppando, salendo di livello o distribuendo il carico tra le chiavi.
Gli endpoint batch condividono questi limiti?
No: le API batch asincrone hanno limiti molto più elevati e uno sconto, a scapito della latenza. Usali per lavori in blocco non interattivi.
Solo stima. I limiti di tariffa sono cifre di riferimento e variano in base al fornitore, al modello e al livello dell'account: verifica nella dashboard.