Comment fonctionne cette calculatrice
Le Calculateur de capacité limite de débit détermine le nombre d'utilisateurs actifs simultanés que votre application peut servir avant qu'un fournisseur d'API ne commence à limiter les demandes. Il n’estime pas un coût en dollars – il convertit les deux plafonds de taux de votre compte en un chiffre de marge. Vous entrez dans le limite de jetons (TPM) et limite de requêtes (RPM) de votre fournisseur, ainsi que la forme de votre charge de travail : jetons par demande et requêtes par utilisateur actif et par minute. L'outil divise chaque plafond en fonction de la demande de chaque utilisateur et rapporte le inférieur des deux résultats, puisque la capacité est définie selon la limite que vous atteignez en premier : débit de jetons ou nombre de requêtes.
Le compromis clé est que TPM et RPM s'épuisent à des rythmes différents, et lequel lie dépend de la taille de votre demande. Les invites volumineuses ou les achèvements longs vous poussent contre la limite de jetons tandis que le nombre de demandes reste inactif ; de nombreux petits appels font l’inverse. Le conseil pratique est de vérifier lequel limiter les indicateurs du calculateur comme goulot d'étranglement avant de passer à l'échelle. Si les jetons se lient en premier, la réduction du contexte ou de la longueur de sortie achète plus de capacité utilisateur qu'un quota de requêtes plus élevé ne le ferait ; si les demandes se lient en premier, le regroupement de plusieurs opérations en un seul appel est le plus utile. Le dimensionnement à la limite de liaison évite les requêtes limitées et les échecs de réponses lors des pics de trafic.
Questions fréquemment posées
Comment les limites TPM et RPM interagissent-elles ?
Les fournisseurs vous limitent à la fois aux jetons par minute (TPM) et aux requêtes par minute (RPM), et vous appuyez sur la première éventualité. Les petits appels fréquents atteignent généralement RPM ; les appels à grand contexte atteignent le TPM. Votre capacité réelle est la plus faible des deux, donc augmenter uniquement la limite non contraignante ne change rien.
Comment puis-je servir plus d’utilisateurs sans atteindre les limites de débit ?
Supprimez la limite de liaison : demandez un niveau plus élevé pour celui qui vous plafonne, regroupez ou combinez de petites requêtes pour faciliter le RPM et réduisez la taille de l'invite pour faciliter le TPM. La mise en cache du contexte répété et le débordement de routage vers une deuxième clé ou un deuxième modèle répartissent également la charge au-delà d'une seule limite.