—costo estándar
—guardado / mes
—mezclado $/1M
Adónde va el dinero, por nivel
Su tráfico se divide en los tres niveles. Todo lo que no sea aplazable o crítico se mantendrá en el estándar. El lote/flex se cobra con descuento; la prioridad conlleva la prima.
| Nivel | Compartir | Tarifa versus estándar | Costo mensual |
|---|
¿Cuánto puedes lotear? — el dial diferible
La palanca más importante es la proporción de volumen que puede pasar del nivel estándar al nivel con descuento. Cada fila mantiene fija su participación prioritaria y varía la participación diferible; el ahorro es versus ejecutar todo de manera estándar.
| acción diferible | Costo combinado | Guardado / mes | Ahorro |
|---|
El token más barato es aquel por el que estabas dispuesto a esperar
La mayoría de los equipos tratan el precio del modelo como un número único, pero los mismos tokens ahora vienen en niveles, y la brecha entre ellos es enorme: aproximadamente la mitad del precio por cualquier cosa que puedas diferir, una prima por cualquier cosa que insistas en servir al instante. El error en ambas direcciones es la uniformidad: ejecutar todo en modo estándar deja el descuento por lotes sobre la mesa, y ejecutar todo en prioridad paga un impuesto de latencia en las llamadas que ningún usuario está esperando. La victoria casi siempre está en el aburrido punto medio: etiquete su tráfico según la cantidad de retraso que puede absorber, impulse la mitad fuera de línea a lotes o flex, mantenga el trabajo interactivo ordinario en estándar y reserve la prioridad para el estrecho conjunto de caminos donde una respuesta lenta en realidad cuesta dinero. La prima de prioridad es el número que la gente juzga más mal, por lo que esta calculadora la aísla: imprime los dólares adicionales por mes que usted paga únicamente por el nivel de servicio en su parte crítica, aparte de los tokens mismos, por lo que la decisión es una comparación y no un encogimiento de hombros. Dimensione el descuento fuera de línea precisamente en el calculadora de ahorro de API por lotes, apílelo con aciertos de caché en el calculadora de ahorro de almacenamiento en caché rápida, y doble todas las palancas juntas en el Calculadora de optimización de costos de LLM.
Ahorros de API por lotesAhorro de almacenamiento en caché rápidoOptimización de costos de LLMPrecios del nivel LLMLatencia LLM
Cómo funciona esta calculadora
Fija el precio de su volumen mensual completo a las tasas de entrada y salida estándar para obtener la base estándar y luego divide ese costo por participación en tres niveles. La parte diferible se factura con el descuento por lotes/flexible, la parte de latencia crítica a la tarifa estándar más la prima de prioridad, y lo que queda permanece en el estándar. Sumar los tres da el costo mensual combinado; el ahorro es la base menos la cifra combinada, y el $/1 millón combinado efectivo divide el costo combinado por el total de tokens. La tabla de barrido vuelve a ejecutar toda la división en una variedad de acciones diferibles para que pueda ver la recompensa de mover más trabajo fuera de línea.
Preguntas frecuentes
¿Qué son los niveles de servicio LLM y por qué cuestan cantidades diferentes?
El mismo modelo se puede facturar en diferentes niveles de procesamiento que intercambian latencia por precio. Estándar es el precio de lista sincrónico. Los niveles por lotes y flexibles ejecutan la misma solicitud de forma asincrónica o con menor prioridad por aproximadamente la mitad de la tarifa estándar; están diseñados para trabajos que pueden esperar minutos u horas, como clasificación masiva, incrustaciones, resúmenes fuera de línea o generación de informes nocturnos. El procesamiento prioritario va en sentido contrario: usted paga una prima superior al estándar para obtener una latencia más rápida y consistente y una mejor confiabilidad durante los picos de carga, lo cual es importante para las llamadas interactivas de cara al usuario. Las fichas son idénticas; usted está pagando por la rapidez y la confiabilidad en que se sirven.
¿Cuánto puede ahorrar realmente el procesamiento por lotes o flexible?
El descuento suele ser de alrededor del 50% de la tarifa estándar, por lo que cada porción de tráfico que puede mover a un nivel por lotes o flexible cuesta aproximadamente la mitad. El problema es la latencia: los trabajos por lotes pueden tardar hasta un día en regresar y las solicitudes flexibles pueden ser más lentas o ocasionalmente ponerse en cola, por lo que solo califica el trabajo genuinamente aplazable. La palanca es la proporción de su volumen que puede tolerar la espera: una canalización que es 80% por lotes fuera de línea y 20% interactiva aterriza cerca de un ahorro general del 40%, mientras que un producto totalmente interactivo no ahorra nada de esta manera.
¿Vale la pena pagar la prima por el procesamiento prioritario?
Solo para el tráfico donde la latencia tiene un valor real (un flujo de pago, un agente en vivo, cualquier cosa que un usuario esté esperando) y solo para esa porción, no para todo el volumen. La prioridad normalmente cuesta mucho más que el estándar por token, por lo que poner todo el tráfico en ella es la forma más cara de ejecutarla. La prueba honesta es si la respuesta más rápida y confiable vale los dólares adicionales que agrega, que esta calculadora imprime como un número independiente: la prima de prioridad en dólares por mes para la acción crítica que usted seleccionó.
¿Cómo divido el tráfico entre niveles en la práctica?
Comience etiquetando cada ruta de llamada según el retraso que puede tolerar. Todo lo que un usuario no esté esperando activamente (trabajos nocturnos, reposiciones, evaluaciones, enriquecimiento masivo) se procesa por lotes o de forma flexible a una tarifa con descuento. Todo lo que un usuario esté esperando pero que no sea crítico para la latencia permanece en el estándar. Reserve la prioridad para el reducido conjunto de rutas interactivas donde una respuesta lenta o interrumpida le cuesta dinero. Luego, configure esas tres acciones aquí para ver la tasa combinada y el ahorro en comparación con ejecutar todo de forma estándar.