| Métrico | por dia | Por mes |
|---|
¿Qué cuesta realmente dinero con los reintentos?
Los errores 429 son gratuitos — no se facturan tokens cuando una solicitud tiene una tasa limitada antes de que comience el procesamiento. Los costos reales son:
- Solicitudes de reintento — cada reintento envía nuevamente el mensaje de entrada completo. Si el reintento tiene éxito, pagará los tokens. Si su entrada es de 2000 tokens, 3 reintentos en el 3% de las solicitudes agregan 0,09 entradas adicionales por solicitud exitosa.
- Duplicados de tiempo de espera — cuando una solicitud tarda demasiado y su código lo vuelve a intentar, pero en realidad se procesó el original. Pagas por dos terminaciones. Esto es especialmente costoso con solicitudes de gran producción.
- Solicitudes fallidas — si se agotan todos los reintentos y la solicitud falla, desperdiciarás latencia y cualquier costo del token de entrada parcial si el proveedor cobra al recibirlo.
Arreglarlo: Utilice un limitador de tasa de token por minuto local (por ejemplo, LangChain's ContextWindowExceededHandler o un simple depósito de tokens) para suavizar las ráfagas antes de que lleguen a la API. Esto elimina la mayoría de los 429 sin aumentar el costo.
Relacionado: Planificador de presupuesto API · Previsión de costes · Pista de nivel libre
Preguntas frecuentes
¿Me cobran por las llamadas API que devuelven un error de límite de tarifa 429?
No, los errores 429 se rechazan antes de procesarlos y no se le cobra por ellos. El costo real es la lógica de reintento, las respuestas retrasadas y, a veces, las finalizaciones duplicadas si la lógica de reintento tiene errores.
¿Qué es el retroceso exponencial y por qué aumenta el costo de latencia?
El retroceso exponencial significa esperar 1, 2, 4, 8... entre reintentos. Un solo 429 con 2 reintentos agrega entre 3 y 7 segundos de latencia. Si los sistemas posteriores tienen SLA, esto tiene un costo operativo real incluso si el costo simbólico es cero.
¿Cómo los reintentos provocan cargos duplicados?
Si una solicitud tiene éxito pero se agota el tiempo de espera antes de que llegue la respuesta, se reenvía un reintento ingenuo y, si el primero tuvo éxito, usted paga por dos finalizaciones. Utilice siempre claves de idempotencia o verifique los resultados existentes antes de volver a intentarlo en el tiempo de espera.
¿Cuál es la tasa 429 promedio para las API de LLM?
El tráfico en ráfagas puede alcanzar tasas de error del 10 al 30%. El tráfico constante muy por debajo de los límites suele ser inferior al 0,1%. La mayoría de los proveedores ahora utilizan límites de tokens por minuto, que castigan las solicitudes de contexto grande más que los límites de recuento de solicitudes.
¿Cómo reduzco los costos de reintento de API?
Cuatro enfoques: (1) Límite de tasa local con un depósito de tokens. (2) Utilice una cola con concurrencia controlada. (3) Configure el procesamiento asíncrono para que los reintentos se realicen en segundo plano. (4) Caché de respuestas para mensajes idénticos.