| Métrica | Por dia | Por mês |
|---|
O que realmente custa dinheiro com novas tentativas?
Os próprios erros 429 são gratuitos — nenhum token é cobrado quando uma solicitação tem taxa limitada antes do início do processamento. Os custos reais são:
- Repetir solicitações — cada nova tentativa envia novamente o prompt de entrada completo. Se a nova tentativa for bem-sucedida, você paga pelos tokens. Se sua entrada for 2.000 tokens, 3 novas tentativas em 3% das solicitações adicionam 0,09 entradas extras por solicitação bem-sucedida.
- Duplicatas de tempo limite — quando uma solicitação demora muito e seu código tenta novamente, mas o original foi realmente processado. Você paga por duas conclusões. Isto é especialmente caro com solicitações de grande produção.
- Solicitações com falha — se todas as tentativas forem esgotadas e a solicitação falhar, você desperdiçou latência e qualquer custo parcial do token de entrada se o provedor cobrar no recebimento.
Corrija: Use um limitador de taxa de token por minuto local (por exemplo, LangChain's ContextWindowExceededHandler ou um simples token bucket) para suavizar rajadas antes que elas atinjam a API. Isso elimina a maioria dos 429s sem aumentar o custo.
Relacionado: Planejador de orçamento de API · Previsão de custos · Pista de nível gratuito
Perguntas frequentes
Sou cobrado por chamadas de API que retornam um erro de limite de taxa 429?
Não — erros 429 são rejeitados antes do processamento e você não é cobrado por eles. O custo real é a lógica de nova tentativa, respostas atrasadas e, às vezes, conclusões duplicadas se a lógica de nova tentativa tiver bugs.
O que é espera exponencial e por que aumenta o custo de latência?
Espera exponencial significa esperar 1s, 2s, 4s, 8s... entre novas tentativas. Um único 429 com 2 tentativas adiciona de 3 a 7 segundos de latência. Se os sistemas downstream tiverem SLAs, isso terá um custo operacional real, mesmo que o custo do token seja zero.
Como as novas tentativas causam cobranças duplicadas?
Se uma solicitação for bem-sucedida, mas expirar antes da chegada da resposta, uma nova tentativa ingênua será reenviada – e se a primeira for bem-sucedida, você pagará por duas conclusões. Sempre use chaves de idempotência ou verifique os resultados existentes antes de tentar novamente no tempo limite.
Qual é a taxa média de 429 para APIs LLM?
O tráfego intenso pode atingir taxas de erro de 10 a 30%. O tráfego constante bem abaixo dos limites normalmente atinge menos de 0,1%. A maioria dos provedores agora usa limites de token por minuto, que punem mais as solicitações de grande contexto do que os limites de contagem de solicitações.
Como posso reduzir os custos de novas tentativas de API?
Quatro abordagens: (1) Limite de taxa localmente com um token bucket. (2) Use uma fila com simultaneidade controlada. (3) Configure o processamento assíncrono para que novas tentativas ocorram em segundo plano. (4) Respostas em cache para prompts idênticos.