Límite de RPM vs TPM según el tamaño de su token
La barra más pequeña es la que realmente te estrangula.
| Límite | Valor | Necesidad máx./min. | ¿Se une? |
|---|
Por qué dos límites y por qué son importantes
Todos los principales proveedores de LLM (OpenAI, Anthropic, Google, Mistral) lo miden solicitudes por minuto y fichas por minuto simultáneamente. El problema es que el límite de tokens es el que la mayoría de la gente olvida. Un presupuesto de 30 000 TPM parece grande hasta que envía mensajes de 4000 tokens: eso es solo aproximadamente 7 solicitudes por minuto antes de comenzar a recibir 429 Too Many Requests, aunque el límite de RPM podría permitir cientos. La solución casi nunca es "enviar más rápido": se trata de recortar el contexto, limitar la longitud de salida o subir de nivel de uso.
Esta calculadora hace la división por ti. Toma tanto los límites como sus tokens por solicitud, encuentra el límite más pequeño y lo convierte en algo que puede planificar: usuarios activos simultáneos. Si sabe que cada usuario envía aproximadamente dos solicitudes por minuto, el número de usuario le indica a cuántas personas atiende una clave antes de que las solicitudes se pongan en cola. Cuando te topas con la pared, las opciones honestas son: reducir el mensaje (a menudo la palanca más grande), acortar max_tokens, trabajo por lotes no urgente en el API por lotes asíncrona, o calificar para un nivel superior gastando más.
Una vez dimensionado el rendimiento, póngale precio: el Calculadora de costos de tokens LLM convierte esas fichas en dólares, y el Estimador de costos de aplicaciones de IA modela la factura completa según su recuento de usuarios. ¿Crear un producto de chat? El calculadora de costos de chatbot vincula el volumen de conversaciones con el costo y el rendimiento.
como usarlo
1. Elija un nivel preestablecido o escriba los límites de RPM y TPM desde el panel de su proveedor.
2. Ingrese los tokens de entrada y salida que utiliza una solicitud típica (la salida también cuenta para TPM).
3. Establezca cuántas solicitudes envía un usuario activo por minuto.
4. Lea las solicitudes efectivas por minuto, los usuarios simultáneos y qué límite es el cuello de botella.
Errores comunes
Contando solo tokens de entrada. Los tokens de salida también se facturan y tienen una velocidad limitada: un modelo hablador con respuestas largas quema TPM rápidamente. Dimensionamiento al límite de RPM. Si sus indicaciones son grandes, TPM lo limita primero; el número de RPM es irrelevante. Suponiendo que el límite sea fijo. Los niveles aumentan automáticamente a medida que aumenta su gasto, por lo que es posible que el muro de hoy desaparezca el próximo mes. Haciendo caso omiso de las ráfagas. Los límites son promedios por minuto, pero se aplican en períodos cortos, por lo que el tráfico intenso llega a 429 segundos por debajo del promedio.
Preguntas frecuentes
¿Cómo convierto un límite de TPM en solicitudes por minuto?
Divida TPM por tokens por solicitud (entrada + salida). El resultado es el límite máximo de solicitudes del lado del token; su verdadero techo es el menor entre eso y el límite de RPM.
¿Por qué recibo errores 429 por debajo de mi límite de RPM?
Porque el límite de tokens por minuto es vinculante. Las indicaciones o salidas largas agotan el TPM antes de alcanzar el recuento de solicitudes. Reduzca la longitud de salida del indicador o del límite.
¿A cuántos usuarios puede servir una clave API?
Solicitudes efectivas por minuto ÷ solicitudes por usuario por minuto. Aumentelo recortando tokens, agrupando, subiendo de nivel o distribuyendo la carga entre claves.
¿Los puntos finales por lotes comparten estos límites?
No: las API por lotes asíncronas tienen sus propios límites mucho más altos y un descuento, a costa de la latencia. Úselos para trabajos masivos no interactivos.
Estimación únicamente. Los límites de tarifas son cifras de referencia y varían según el proveedor, el modelo y el nivel de cuenta; verifíquelo en su panel de control.