HomeToolsLearn › Calculadora de limite de taxa
solicitações efetivas/min
usuários ativos simultâneos
limite de ligação
tokens/min usados ​​no limite

Limite de RPM vs TPM no tamanho do seu token

A barra menor é aquela que realmente estrangula você.

LimiteValorNecessidade máxima/minVincula?
⚠️ Estimativa. Os números de níveis predefinidos são números de referência (julho de 2026) — os provedores definem limites de taxa por modelo e aumentam-nos conforme você gasta, e o TPM/RPM exato varia de acordo com a conta. Sempre confirme seus limites reais no painel do provedor. Os endpoints em lote/assíncronos têm limites separados e muito mais altos. · Informar preço desatualizado →

Por que dois limites e por que isso é importante

Todos os principais provedores de LLM - OpenAI, Anthropic, Google, Mistral - avaliam você solicitações por minuto e fichas por minuto simultaneamente. O problema é que o limite de token é aquele que a maioria das pessoas esquece. Um orçamento de 30.000 TPM parece grande até você enviar solicitações de 4.000 tokens: são apenas cerca de 7 solicitações por minuto antes de você começar a receber 429 Too Many Requests, mesmo que o limite de RPM possa permitir centenas. A correção quase nunca é “enviar mais rápido” – é cortar o contexto, limitar o comprimento da saída ou subir um nível de uso.

Esta calculadora faz a divisão para você. Ele pega os limites e seus tokens por solicitação, encontra o teto menor e o transforma em algo que você pode planejar: usuários ativos simultâneos. Se você sabe que cada usuário dispara aproximadamente duas solicitações por minuto, o número do usuário informa quantas pessoas uma chave atende antes da fila de solicitações. Quando você bate na parede, as opções honestas são: diminuir o prompt (geralmente a maior alavanca), diminuir max_tokens, trabalho não urgente em lote no API em lote assíncronoou qualifique-se para um nível superior gastando mais.

Uma vez dimensionado o rendimento, defina o preço: o Calculadora de custo de token LLM transforma esses tokens em dólares, e o Estimador de custos de aplicativos de IA modela a conta inteira de acordo com sua contagem de usuários. Construindo um produto de bate-papo? O calculadora de custos do chatbot vincula o volume da conversa ao custo e ao rendimento.

Como usar

1. Escolha um nível predefinido ou digite os limites de RPM e TPM no painel do seu provedor.
2. Insira os tokens de entrada e saída que uma solicitação típica usa (a saída também conta para o TPM).
3. Defina quantas solicitações um usuário ativo envia por minuto.
4. Leia as solicitações efetivas por minuto, usuários simultâneos e qual limite é o gargalo.

Erros comuns

Contando apenas tokens de entrada. Os tokens de saída também são cobrados e têm taxa limitada – um modelo tagarela com respostas longas queima o TPM rapidamente. Dimensionamento até o limite de RPM. Se seus prompts forem grandes, o TPM limita você primeiro; o número RPM é irrelevante. Supondo que o limite seja fixo. Os níveis aumentam automaticamente à medida que seus gastos aumentam, portanto, um muro hoje pode desaparecer no próximo mês. Ignorando explosões. Os limites são médias por minuto, mas aplicados em janelas curtas, de modo que o tráfego intenso atinge 429 segundos abaixo da média.

Perguntas frequentes

Como transformo um limite de TPM em solicitações por minuto?

Divida o TPM por tokens por solicitação (entrada + saída). O resultado é o limite máximo de solicitações do lado do token; seu teto verdadeiro é o menor entre isso e o limite de RPM.

Por que recebo erros 429 abaixo do meu limite de RPM?

Porque o limite de token por minuto é vinculativo. Solicitações ou saídas longas esgotam o TPM antes de você atingir a contagem de solicitações. Reduza o comprimento da saída do prompt ou do limite.

Quantos usuários uma chave de API pode servir?

Solicitações efetivas por minuto ÷ solicitações por usuário por minuto. Aumente-o cortando tokens, agrupando em lote, subindo de nível ou distribuindo a carga pelas chaves.

Os endpoints em lote compartilham esses limites?

Não – as APIs em lote assíncrono têm seus próprios limites muito mais altos e um desconto, ao custo da latência. Use-os para trabalhos em massa não interativos.

Estimativa apenas. Os limites de taxas são números de referência e variam de acordo com provedor, modelo e nível de conta – verifique em seu painel.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Calculadora de custos de inatividade de APICalculadora de capacidade de limite de taxaCalculadora de gravação de avaliação gratuita AICalculadora de custo excedente do plano APICusto de solicitações simultâneas