Tetto RPM vs TPM alla dimensione del tuo token
La barra più piccola è quella che effettivamente ti strozza.
| Limite | Valore | Richiesta massima/min | Si lega? |
|---|
Perché due limiti e perché sono importanti
Tutti i principali fornitori di LLM (OpenAI, Anthropic, Google, Mistral) ti seguono richieste al minuto E gettoni al minuto contemporaneamente. Il problema è che il limite dei token è quello che la maggior parte delle persone dimentica. Un budget di 30.000 TPM sembra elevato finché non invii richieste di 4.000 token: si tratta solo di circa 7 richieste al minuto prima di iniziare a ricevere 429 Too Many Requests, anche se il limite RPM potrebbe consentirne centinaia. La soluzione non è quasi mai "invia più velocemente": si tratta di tagliare il contesto, limitare la lunghezza dell'output o aumentare il livello di utilizzo.
Questa calcolatrice fa la divisione per te. Prende sia i limiti che i tuoi token per richiesta, trova il tetto più piccolo e lo trasforma in qualcosa su cui puoi pianificare: utenti attivi simultanei. Se sai che ogni utente invia circa due richieste al minuto, il numero utente ti dice quante persone serve una chiave prima che le richieste vengano messe in coda. Quando ti trovi di fronte al muro, le opzioni oneste sono: rimpicciolire il prompt (spesso la leva più grande), accorciare max_tokens, lavori in batch non urgenti sul API batch asincronaoppure qualificarti per un livello superiore spendendo di più.
Una volta dimensionato il throughput, stabilisci il prezzo: the Calcolatore del costo del token LLM trasforma quei gettoni in dollari e il Stima dei costi delle app AI modella l'intera fattura in base al conteggio degli utenti. Costruire un prodotto di chat? IL calcolatore dei costi del chatbot collega il volume delle conversazioni sia ai costi che alla velocità effettiva.
Come usarlo
1. Scegli un livello preimpostato o digita i limiti RPM e TPM dalla dashboard del tuo fornitore.
2. Inserisci i token di input e output utilizzati da una richiesta tipica (anche l'output viene conteggiato ai fini del TPM).
3. Imposta il numero di richieste inviate da un utente attivo al minuto.
4. Leggi le richieste effettive al minuto, gli utenti simultanei e quale limite rappresenta il collo di bottiglia.
Errori comuni
Contare solo i token di input. Anche i token di output vengono fatturati e hanno una velocità limitata: un modello loquace con risposte lunghe brucia velocemente il TPM. Dimensionamento al limite RPM. Se i tuoi prompt sono grandi, TPM ti limita prima; il numero di giri è irrilevante. Supponendo che il limite sia fisso. I livelli aumentano automaticamente man mano che la tua spesa cresce, quindi un muro oggi potrebbe essere eliminato il mese prossimo. Ignorando gli scoppi. I limiti sono medie al minuto ma vengono applicati in periodi brevi, quindi il traffico intenso raggiunge 429 secondi al di sotto della media.
Solo stima. I limiti di tariffa sono cifre di riferimento e variano in base al fornitore, al modello e al livello dell'account: verifica nella dashboard.