Limite de RPM vs TPM no tamanho do seu token
A barra menor é aquela que realmente estrangula você.
| Limite | Valor | Necessidade máxima/min | Vincula? |
|---|
Por que dois limites e por que isso é importante
Todos os principais provedores de LLM - OpenAI, Anthropic, Google, Mistral - avaliam você solicitações por minuto e fichas por minuto simultaneamente. O problema é que o limite de token é aquele que a maioria das pessoas esquece. Um orçamento de 30.000 TPM parece grande até você enviar solicitações de 4.000 tokens: são apenas cerca de 7 solicitações por minuto antes de você começar a receber 429 Too Many Requests, mesmo que o limite de RPM possa permitir centenas. A correção quase nunca é “enviar mais rápido” – é cortar o contexto, limitar o comprimento da saída ou subir um nível de uso.
Esta calculadora faz a divisão para você. Ele pega os limites e seus tokens por solicitação, encontra o teto menor e o transforma em algo que você pode planejar: usuários ativos simultâneos. Se você sabe que cada usuário dispara aproximadamente duas solicitações por minuto, o número do usuário informa quantas pessoas uma chave atende antes da fila de solicitações. Quando você bate na parede, as opções honestas são: diminuir o prompt (geralmente a maior alavanca), diminuir max_tokens, trabalho não urgente em lote no API em lote assíncronoou qualifique-se para um nível superior gastando mais.
Uma vez dimensionado o rendimento, defina o preço: o Calculadora de custo de token LLM transforma esses tokens em dólares, e o Estimador de custos de aplicativos de IA modela a conta inteira de acordo com sua contagem de usuários. Construindo um produto de bate-papo? O calculadora de custos do chatbot vincula o volume da conversa ao custo e ao rendimento.
Como usar
1. Escolha um nível predefinido ou digite os limites de RPM e TPM no painel do seu provedor.
2. Insira os tokens de entrada e saída que uma solicitação típica usa (a saída também conta para o TPM).
3. Defina quantas solicitações um usuário ativo envia por minuto.
4. Leia as solicitações efetivas por minuto, usuários simultâneos e qual limite é o gargalo.
Erros comuns
Contando apenas tokens de entrada. Os tokens de saída também são cobrados e têm taxa limitada – um modelo tagarela com respostas longas queima o TPM rapidamente. Dimensionamento até o limite de RPM. Se seus prompts forem grandes, o TPM limita você primeiro; o número RPM é irrelevante. Supondo que o limite seja fixo. Os níveis aumentam automaticamente à medida que seus gastos aumentam, portanto, um muro hoje pode desaparecer no próximo mês. Ignorando explosões. Os limites são médias por minuto, mas aplicados em janelas curtas, de modo que o tráfego intenso atinge 429 segundos abaixo da média.
Perguntas frequentes
Como transformo um limite de TPM em solicitações por minuto?
Divida o TPM por tokens por solicitação (entrada + saída). O resultado é o limite máximo de solicitações do lado do token; seu teto verdadeiro é o menor entre isso e o limite de RPM.
Por que recebo erros 429 abaixo do meu limite de RPM?
Porque o limite de token por minuto é vinculativo. Solicitações ou saídas longas esgotam o TPM antes de você atingir a contagem de solicitações. Reduza o comprimento da saída do prompt ou do limite.
Quantos usuários uma chave de API pode servir?
Solicitações efetivas por minuto ÷ solicitações por usuário por minuto. Aumente-o cortando tokens, agrupando em lote, subindo de nível ou distribuindo a carga pelas chaves.
Os endpoints em lote compartilham esses limites?
Não – as APIs em lote assíncrono têm seus próprios limites muito mais altos e um desconto, ao custo da latência. Use-os para trabalhos em massa não interativos.
Estimativa apenas. Os limites de taxas são números de referência e variam de acordo com provedor, modelo e nível de conta – verifique em seu painel.