HomeToolsLearn › Calculateur de limite de taux
requêtes efficaces / min
utilisateurs actifs simultanés
limite contraignante
jetons / min utilisés au plafond

Plafond RPM vs TPM à la taille de votre jeton

La plus petite barre est celle qui vous étrangle réellement.

LimiteValeurDemande maximale/minLie?
⚠️ Estimation. Les numéros de niveau prédéfinis sont chiffres de référence (juillet 2026) — les fournisseurs fixent des limites de débit par modèle et les augmentent au fur et à mesure que vous dépensez, et les TPM/RPM exacts diffèrent selon le compte. Confirmez toujours vos limites réelles dans le tableau de bord du fournisseur. Les points de terminaison par lots/asynchrones ont des limites distinctes et beaucoup plus élevées. · Signaler un prix obsolète →

Pourquoi deux limites et pourquoi c'est important

Tous les principaux fournisseurs de LLM (OpenAI, Anthropic, Google, Mistral) vous mesurent requêtes par minute et jetons par minute simultanément. Le problème est que la limite de jetons est celle que la plupart des gens oublient. Un budget de 30 000 TPM semble important jusqu'à ce que vous envoyiez des invites de 4 000 jetons : cela ne représente qu'environ 7 requêtes par minute avant de commencer à recevoir 429 Too Many Requests, même si la limite de RPM peut en autoriser des centaines. Le correctif n'est presque jamais « envoyer plus rapidement » : il s'agit de réduire le contexte, de limiter la longueur de sortie ou de monter d'un niveau d'utilisation.

Cette calculatrice fait la division pour vous. Il prend à la fois les limites et vos jetons par demande, trouve le plafond le plus petit et le transforme en quelque chose que vous pouvez planifier : utilisateurs actifs simultanés. Si vous savez que chaque utilisateur déclenche environ deux requêtes par minute, le numéro d'utilisateur vous indique le nombre de personnes desservies par une clé avant la file d'attente des requêtes. Lorsque vous heurtez le mur, les options honnêtes sont : réduire l'invite (souvent le plus gros levier), raccourcir max_tokens, lots de travaux non urgents sur le API de lots asynchrones, ou bénéficiez d'un niveau supérieur en dépensant plus.

Une fois le débit dimensionné, évaluez-le : le Calculateur du coût des jetons LLM transforme ces jetons en dollars, et le Estimateur du coût des applications d'IA modélise la facture entière en fonction de votre nombre d'utilisateurs. Créer un produit de chat ? Le calculateur de coût de chatbot lie le volume de conversation au coût et au débit.

Comment l'utiliser

1. Choisissez un niveau prédéfini ou saisissez les limites RPM et TPM à partir du tableau de bord de votre fournisseur.
2. Entrez les jetons d'entrée et de sortie qu'une requête typique utilise (la sortie compte également dans le TPM).
3. Définissez le nombre de requêtes qu’un utilisateur actif envoie par minute.
4. Lisez les requêtes effectives par minute, les utilisateurs simultanés et quelle limite constitue le goulot d'étranglement.

Erreurs courantes

En comptant uniquement les jetons d'entrée. Les jetons de sortie sont également facturés et limités en débit : un modèle bavard avec de longues réponses brûle rapidement le TPM. Dimensionnement à la limite RPM. Si vos invites sont volumineuses, le TPM vous limite d'abord ; le numéro RPM n'a pas d'importance. En supposant que la limite soit fixée. Les niveaux augmentent automatiquement à mesure que vos dépenses augmentent, de sorte qu'un mur aujourd'hui pourrait disparaître le mois prochain. Ignorer les éclats. Les limites sont des moyennes par minute mais appliquées dans des fenêtres courtes, de sorte que le trafic ponctuel atteint 429 secondes en dessous de la moyenne.

FAQ

Comment transformer une limite TPM en requêtes par minute ?

Divisez le TPM par jetons par requête (entrée + sortie). Le résultat est le plafond de vos demandes côté jeton ; votre véritable plafond est le plus petit de celui-ci et de la limite de régime.

Pourquoi est-ce que j'obtiens des erreurs 429 en dessous de ma limite de RPM ?

Parce que la limite de jetons par minute est plutôt contraignante. Les invites ou sorties longues épuisent le TPM avant que vous n’atteigniez le nombre de requêtes. Réduisez la longueur de sortie de l’invite ou du plafond.

Combien d’utilisateurs une clé API peut-elle servir ?

Requêtes effectives par minute ÷ requêtes par utilisateur et par minute. Augmentez-le en réduisant les jetons, en regroupant, en progressant d'un niveau ou en répartissant la charge sur les clés.

Les points de terminaison de lots partagent-ils ces limites ?

Non : les API par lots asynchrones ont leurs propres limites, beaucoup plus élevées, et une remise, au détriment de la latence. Utilisez-les pour des tâches en masse non interactives.

Estimation seulement. Les limites de taux sont des chiffres de référence et varient selon le fournisseur, le modèle et le niveau de compte — vérifiez dans votre tableau de bord.

Hébergez votre projet :DigitalOcean — 200 $ gratuits ↗VPS Hostinger
Calculateur du coût des temps d'arrêt de l'APICalculateur de capacité limite de débitCalculateur de gravure d'essai gratuit AICalculateur des coûts excédentaires du plan APICoût des demandes simultanées