Come funziona questa calcolatrice
IL Calcolatore della capacità del limite di velocità calcola quanti utenti attivi simultanei può servire la tua applicazione prima che un provider API inizi a limitare le richieste. Non stima un costo in dollari: converte i due massimali tariffari del tuo account in un numero di margine. Inserisci il limite token (TPM) E limite di richiesta (RPM) dal tuo provider, oltre alla forma del carico di lavoro: tokens per request E requests per active user per minute. Lo strumento divide ciascun massimale in base alla domanda per utente e riporta il valore lower dei due risultati, poiché la capacità è impostata in base al limite raggiunto per primo: velocità effettiva dei token o conteggio delle richieste.
Il compromesso chiave è questo TPM e RPM si esauriscono a velocità diversee quale vincola dipende dalla dimensione della richiesta. Richieste di grandi dimensioni o completamenti lunghi ti spingono verso il limite del token mentre il conteggio delle richieste è inattivo; molte piccole chiamate fanno il contrario. Il consiglio pratico è controllare Quale limitare i flag della calcolatrice come collo di bottiglia prima di aumentare le dimensioni. Se i token si associano per primi, la riduzione del contesto o della lunghezza dell'output acquista una maggiore capacità dell'utente rispetto a una quota di richiesta più elevata; se le richieste si collegano per prime, raggruppare più operazioni in un'unica chiamata aiuta di più. Il dimensionamento al limite di associazione impedisce richieste limitate e risposte non riuscite durante i picchi di traffico.
Domande frequenti
Come interagiscono i limiti TPM e RPM?
I fornitori ti limitano sia ai token al minuto (TPM) che alle richieste al minuto (RPM) e tu premi quello che si verifica per primo. Le chiamate piccole e frequenti di solito raggiungono gli RPM; le chiamate a contesto ampio raggiungono il TPM. La tua capacità reale è la più bassa delle due, quindi aumentare solo il limite non vincolante non cambia nulla.
Come posso servire più utenti senza raggiungere i limiti di tariffa?
Aumenta il limite vincolante: richiedi un livello più alto per quello che ti limita, raggruppa o combina piccole richieste per facilitare l'RPM e ridurre le dimensioni dei prompt per facilitare il TPM. Anche la memorizzazione nella cache del contesto ripetuto e l'overflow del routing a una seconda chiave o modello distribuiscono il carico oltre un singolo limite.