Cómo funciona esta calculadora
El Calculadora de capacidad de límite de tarifa calcula cuántos usuarios activos simultáneos puede atender su aplicación antes de que un proveedor de API comience a limitar las solicitudes. No estima un costo en dólares: convierte los dos límites máximos de tasas de su cuenta en un número de margen de maniobra. Entras en el límite de token (TPM) y límite de solicitudes (RPM) de su proveedor, más la forma de su carga de trabajo: tokens por solicitud y solicitudes por usuario activo por minuto. La herramienta divide cada techo por su demanda por usuario e informa el más bajo de los dos resultados, ya que la capacidad se establece según el límite que alcance primero: rendimiento del token o recuento de solicitudes.
La compensación clave es que TPM y RPM se agotan a diferentes velocidades, y cuál se vincula depende del tamaño de su solicitud. Las indicaciones grandes o las completaciones prolongadas lo empujan hacia el límite de tokens mientras el recuento de solicitudes permanece inactivo; muchas llamadas pequeñas hacen lo contrario. El consejo práctico es comprobar cual limite las banderas de la calculadora como cuello de botella antes de ampliar. Si los tokens se vinculan primero, recortar el contexto o la longitud de salida compra más capacidad de usuario que una cuota de solicitudes más alta; Si las solicitudes se vinculan primero, lo más útil es agrupar varias operaciones en una sola llamada. El tamaño al límite vinculante evita solicitudes limitadas y respuestas fallidas durante picos de tráfico.
Preguntas frecuentes
¿Cómo interactúan los límites de TPM y RPM?
Los proveedores le limitan tanto los tokens por minuto (TPM) como las solicitudes por minuto (RPM), y usted alcanza lo que ocurra primero. Las llamadas pequeñas y frecuentes suelen alcanzar las RPM; Las llamadas de gran contexto afectan a TPM. Su capacidad real es la menor de las dos, por lo que aumentar sólo el límite no vinculante no cambia nada.
¿Cómo atiendo a más usuarios sin alcanzar los límites de tarifas?
Eleve el límite vinculante: solicite un nivel más alto para el que lo limite, agrupe o combine solicitudes pequeñas para reducir el RPM y recorte el tamaño de la solicitud para reducir el TPM. El almacenamiento en caché del contexto repetido y el enrutamiento del desbordamiento a una segunda clave o modelo también distribuye la carga más allá de un límite único.