HomeToolsLearn › Calculateur de limite de taux
requêtes efficaces / min
utilisateurs actifs simultanés
limite contraignante
jetons / min utilisés au plafond

Plafond RPM vs TPM à la taille de votre jeton

La plus petite barre est celle qui vous étrangle réellement.

LimiteValeurDemande maximale/minLie?
⚠️ Estimation. Les numéros de niveau prédéfinis sont chiffres de référence (juillet 2026) — les fournisseurs fixent des limites de débit par modèle et les augmentent au fur et à mesure que vous dépensez, et les TPM/RPM exacts diffèrent selon le compte. Confirmez toujours vos limites réelles dans le tableau de bord du fournisseur. Les points de terminaison par lots/asynchrones ont des limites distinctes et beaucoup plus élevées. · Signaler un prix obsolète →

Pourquoi deux limites et pourquoi c'est important

Tous les principaux fournisseurs de LLM (OpenAI, Anthropic, Google, Mistral) vous mesurent requêtes par minute et jetons par minute simultanément. Le problème est que la limite de jetons est celle que la plupart des gens oublient. Un budget de 30 000 TPM semble important jusqu'à ce que vous envoyiez des invites de 4 000 jetons : cela ne représente qu'environ 7 requêtes par minute avant de commencer à recevoir 429 Too Many Requests, même si la limite de RPM peut en autoriser des centaines. Le correctif n'est presque jamais « envoyer plus rapidement » : il s'agit de réduire le contexte, de limiter la longueur de sortie ou de monter d'un niveau d'utilisation.

Cette calculatrice fait la division pour vous. Il prend à la fois les limites et vos jetons par demande, trouve le plafond le plus petit et le transforme en quelque chose que vous pouvez planifier : utilisateurs actifs simultanés. Si vous savez que chaque utilisateur déclenche environ deux requêtes par minute, le numéro d'utilisateur vous indique le nombre de personnes desservies par une clé avant la file d'attente des requêtes. Lorsque vous heurtez le mur, les options honnêtes sont : réduire l'invite (souvent le plus gros levier), raccourcir max_tokens, lots de travaux non urgents sur le API de lots asynchrones, ou bénéficiez d'un niveau supérieur en dépensant plus.

Une fois le débit dimensionné, évaluez-le : le Calculateur du coût des jetons LLM transforme ces jetons en dollars, et le Estimateur du coût des applications d'IA modélise la facture entière en fonction de votre nombre d'utilisateurs. Créer un produit de chat ? Le calculateur de coût de chatbot lie le volume de conversation au coût et au débit.

Comment l'utiliser

1. Choisissez un niveau prédéfini ou saisissez les limites RPM et TPM à partir du tableau de bord de votre fournisseur.
2. Entrez les jetons d'entrée et de sortie qu'une requête typique utilise (la sortie compte également dans le TPM).
3. Définissez le nombre de requêtes qu’un utilisateur actif envoie par minute.
4. Lisez les requêtes effectives par minute, les utilisateurs simultanés et quelle limite constitue le goulot d'étranglement.

Erreurs courantes

En comptant uniquement les jetons d'entrée. Les jetons de sortie sont également facturés et limités en débit : un modèle bavard avec de longues réponses brûle rapidement le TPM. Dimensionnement à la limite RPM. Si vos invites sont volumineuses, le TPM vous limite d'abord ; le numéro RPM n'a pas d'importance. En supposant que la limite soit fixée. Les niveaux augmentent automatiquement à mesure que vos dépenses augmentent, de sorte qu'un mur aujourd'hui pourrait disparaître le mois prochain. Ignorer les éclats. Les limites sont des moyennes par minute mais appliquées dans des fenêtres courtes, de sorte que le trafic ponctuel atteint 429 secondes en dessous de la moyenne.

Estimation seulement. Les limites de taux sont des chiffres de référence et varient selon le fournisseur, le modèle et le niveau de compte — vérifiez dans votre tableau de bord.

Partager : 𝕏 Publier Reddit
Hébergez votre projet :DigitalOcean — 200 $ gratuits ↗VPS Hostinger
Calculateur du coût des temps d'arrêt de l'APICalculateur de capacité limite de débitCalculateur de gravure d'essai gratuit AICalculateur des coûts excédentaires du plan APICoût des demandes simultanées