Publicado 2026-06-28 · límites de referencia, verifique en el panel de su proveedor
Lees los documentos. Tu nivel permite 500 solicitudes por minuto. Vas a enviar quizás ocho. Y, sin embargo, los registros están llenos de 429 Too Many Requests. No hay ningún problema con tu código: estás presionando el otro límite, el que la mayoría de los tutoriales omiten: tokens por minuto (TPM). Todos los principales proveedores de LLM le miden RPM y TPM al mismo tiempo y, en el caso de indicaciones reales, el límite de token casi siempre es el primero en aplicarse.
Tomemos como ejemplo el nivel de entrada de OpenAI para GPT-4o: aproximadamente 500 rpm y 30.000 TPM (referencia, junio de 2026). El número de RPM parece generoso. Pero un mensaje de recuperación aumentada con algunos documentos incluidos puede ser fácilmente 4.000 fichas en y 500 fuera - llámelo 4500 tokens por solicitud. Ahora haga la división que los documentos no hacen:
| Límite | Valor | Solicitudes máximas/min a 4500 tok |
|---|---|---|
| RPM (solicitudes/min) | 500 | 500 |
| TPM (tokens/min) | 30,000 | 6.7 ◀ se une |
Los precios son estimaciones de referencia, julio de 2026. Informar precio desactualizado →
Entonces tu verdadero techo es menos de siete solicitudes por minuto, no 500. El límite de token le limita al 1,3% de lo que implicaba el límite de solicitud. Es por eso que los 429 comienzan con un tráfico de un solo dígito, y por qué "enviar más lento" o "agregar un reintento" trata el síntoma, no la causa.
Las solicitudes por minuto son abstractas. Lo que realmente quieres saber es ¿Cuántas personas pueden usar la aplicación a la vez?. Si cada usuario activo envía aproximadamente dos solicitudes por minuto, ese límite de 6,7 RPM es aproximadamente tres usuarios simultáneos antes de que las solicitudes comiencen a ponerse en cola. Bien para una demostración; una pared para un lanzamiento. La solución rara vez es un bucle más rápido: es una de cuatro palancas:
max_tokens quema el presupuesto con respuestas divagaciones.La misma trampa existe en todas partes, a veces más estrecha. El nivel Claude de entrada de Anthropic está cerca 50 RPM / 40 000 TPM; El nivel gratuito Gemini 2.5 Flash de Google es generoso en tokens (~250.000 TPM) pero tacaño en solicitudes (~10 RPM). El límite vinculante cambia dependiendo de si sus mensajes son grandes o su tráfico es elevado, que es exactamente por qué falla una sola regla general. Tienes que enchufar su tamaño de la ficha.
Eso es lo que nuestro nuevo calculadora de límite de tasa lo que hace: ingresa un nivel (o tu TPM/RPM real), tus tokens de entrada y salida, y con qué frecuencia llama cada usuario, y te indica las solicitudes efectivas por minuto, los usuarios simultáneos a los que puedes atender y qué límite es el cuello de botella. Es la forma más rápida de saber si un lanzamiento chocará antes de que lo hagan los usuarios.
Los errores 429 por debajo de su límite de RPM no son un error: son el límite de tokens por minuto haciendo su trabajo. Capacidad de tamaño en fichas, no solicitar recuentos; recorte el contexto antes de intentar reintentar; y recuerde que el límite aumenta con el gasto. Una vez que conozca su límite real, fije el precio del tráfico con el Calculadora de costos de tokens LLM y modelar toda la aplicación en el Estimador de costos de aplicaciones de IA.
Los límites de tarifas son cifras de referencia (junio de 2026) y varían según el proveedor, el modelo y el nivel de cuenta; confírmelo siempre en tu panel de control. Relacionado: Calculadora de límite de tarifa · Ahorros de API por lotes · API LLM más barata.