HomeBlog › Por que os aplicativos LLM atingiram limites de taxa de 429

Por que seu aplicativo LLM gera 429 erros – a matemática do TPM ninguém explica

Publicado em 28/06/2026 · limites de referência, verifique no painel do seu provedor

Você leu os documentos. Seu nível permite 500 solicitações por minuto. Você está enviando talvez oito. E ainda assim os registros estão cheios de 429 Too Many Requests. Não há nada de errado com o seu código — você está acertando o outro limite, aquele que a maioria dos tutoriais pula: tokens por minuto (TPM). Todos os principais provedores de LLM medem RPM e TPM ao mesmo tempo e, na verdade, avisam que o limite de token quase sempre é o primeiro.

Dois limites, e aquele que realmente une

Veja o nível de entrada do OpenAI para GPT-4o: aproximadamente 500 rpm e 30.000 TPM (referência, junho de 2026). O número de RPM parece generoso. Mas um prompt de recuperação aumentada com alguns documentos inseridos pode facilmente ser 4.000 fichas dentro e 500 fora – chame de 4.500 tokens por solicitação. Agora faça a divisão que os documentos não fazem:

LimiteValorMáximo de solicitações/min em 4.500 tok
RPM (solicitações/min)500500
TPM (tokens/min)30,0006.7 ◀ liga

Os preços são estimativas de referência, julho de 2026. Informar preço desatualizado →

Então seu teto real é menos de sete solicitações por minuto, não 500. O limite de token limita você a 1,3% do que o limite de solicitação implica. É por isso que os 429 começam com tráfego de um dígito – e por que “enviar mais devagar” ou “adicionar uma nova tentativa” trata o sintoma, não a causa.

Transforme o limite em algo que você pode planejar: usuários simultâneos

Solicitações por minuto são abstratas. O que você realmente quer saber é quantas pessoas podem usar o aplicativo ao mesmo tempo. Se cada usuário ativo disparar aproximadamente duas solicitações por minuto, esse teto de 6,7 RPM será aproximadamente três usuários simultâneos antes que as solicitações comecem a ficar na fila. Ótimo para uma demonstração; uma parede para um lançamento. A correção raramente é um loop mais rápido – é uma das quatro alavancas:

Não é apenas OpenAI

A mesma armadilha existe em todos os lugares, às vezes mais apertada. A entrada do nível Claude da Anthropic está por aí 50 RPM/40.000 TPM; O nível Gemini 2.5 Flash gratuito do Google é generoso em tokens (~250.000 TPM), mas mesquinho em solicitações (~10 RPM). O limite de vinculação varia dependendo se seus prompts são grandes ou se seu tráfego é intenso – e é exatamente por isso que uma única regra prática falha. Você tem que conectar seu tamanho do token.

É isso que nosso novo calculadora de limite de taxa faz: insira uma camada (ou seu TPM/RPM real), seus tokens de entrada e saída e com que frequência cada usuário chama, e informa as solicitações efetivas por minuto, os usuários simultâneos que você pode atender e qual limite é o gargalo. É a maneira mais rápida de descobrir se um lançamento irá falhar antes que seus usuários o façam.

A conclusão

429 errors below your RPM limit are not a bug — they're the token-per-minute limit doing its job. Size capacity on fichas, not request counts; trim context before you reach for retries; and remember the limit rises with spend. Once you know your real ceiling, price the traffic with the Calculadora de custo de token LLM and model the whole app on the Estimador de custos de aplicativos de IA.

Os limites de taxas são valores de referência (junho de 2026) e variam de acordo com provedor, modelo e nível de conta — sempre confirme em seu painel. Relacionado: Calculadora de limite de taxa · Economia de API em lote · API LLM mais barata.