✓ Multiplicativo, no aditivo· Almacenamiento en caché → Lote → Comprometido· reportar un problema →
Almacenamiento en caché rápido, el API por lotes y un descuento por gasto comprometido cada uno reduce su factura, pero, apilados ingenuamente, parecen ahorrar más de lo que gasta. Se agravan: el lote descuenta el precio almacenado en caché, que ya es más barato, y el descuento comprometido se obtiene de lo que queda. Esto pone precio a la verdadero costo combinado por millón de tokens, el verdadero factura mensual, y un cascada de dónde proviene realmente cada dólar ahorrado.
—
apilados / mes
—precio de lista / mes
—ahorro total
—mezclado $/1M
Cascada de ahorro: cada palanca actúa sobre lo que quedó la última
Comience con el precio de lista, aplique el almacenamiento en caché rápido al lado de entrada, luego la API por lotes al recurso compartido por lotes y luego el descuento comprometido a toda la factura restante. La columna de escalones es lo que esa sola palanca eliminó; la columna en ejecución es lo que queda.
Escenario
Guardado este paso
Ejecutando mensualmente
Aditivo versus multiplicativo: la trampa
Agregar los tres descuentos principales exagera el ahorro, a veces más del 100%. La pila real multiplica lo que conservas en cada paso. Esto muestra la brecha de sus números.
Método
Ahorros reclamados
Mensual
Tres descuentos rara vez lo hacen gratis
Cada guía de reducción de costos de LLM enumera las mismas palancas: almacenar en caché sus indicaciones, agrupar lo que puede esperar, comprometerse a gastar para obtener un descuento por volumen, y cada una de ellas cita un porcentaje principal. El error es acumular esos porcentajes sumándolos. Los descuentos no suman, sino que se acumulan: cada uno sólo trabaja con el dinero que dejó el anterior. Un descuento de caché del 90 % que solo afecta al lado de entrada, un descuento por lotes del 50 % en la proporción de tráfico que tolera la latencia y un descuento comprometido del 15 % en la factura no suman un descuento del 155 %: se multiplican hasta un número real que siempre es menos impresionante que la suma y siempre más que cero. Esta calculadora los aplica en el orden en que ocurren (almacenamiento en caché en el momento de la solicitud, lote en el momento del envío, comprometido en la facturación) y recorre la factura en forma de cascada para que pueda ver lo que realmente eliminó cada palanca en lugar de lo que prometía su folleto. También detalla los problemas que ocultan los números de los titulares: el almacenamiento en caché solo descuenta los tokens de entrada, por lo que una carga de trabajo con mucha producción apenas lo siente; el lote sólo se aplica al tráfico que puede esperar, por lo que un producto interactivo dirige una pequeña parte de su volumen a través de él; y algunos proveedores no le permitirán almacenar en caché ni procesar por lotes la misma solicitud. Ponle precio a cada palanca por sí sola con el calculadora de almacenamiento en caché rápida, el calculadora API por lotes y el calculadora de gastos comprometidos - luego ven aquí para ver lo que realmente hacen juntos y comparar el resultado con el completo calculadora de optimización de costos.
El precio de lista comienza a partir de la división de sus tokens: tokens de entrada multiplicados por el precio de entrada más tokens de salida multiplicados por el precio de salida, dividido por un millón, multiplicado por las solicitudes por mes. El almacenamiento en caché rápido actúa solo en el lado de la entrada: el precio de entrada efectivo se convierte en el precio de entrada multiplicado por uno menos la fracción almacenable en caché y reutilizada por el descuento de lectura de caché, por lo que si el 70% de la entrada se reutiliza y las lecturas en caché son un 90% más baratas, se ahorra el 63% del costo de entrada mientras que la salida se mantiene al precio completo. El descuento de la API por lotes se aplica a la parte del volumen por lotes: la parte por lotes de la factura posterior al caché se multiplica por uno menos el descuento por lotes, el resto no se modifica, porque el tráfico en tiempo real no se puede agrupar. Finalmente, el descuento por gasto comprometido es un multiplicador fijo sobre toda la factura restante. El total acumulado es el precio de lista recorrido por los tres en ese orden; El costo combinado por millón de tokens es el total dividido por el total de tokens procesados. La tabla aditiva versus multiplicativa contrasta el honesto ahorro compuesto con la ingenua suma de los porcentajes generales, que puede exceder el 100% y siempre es incorrecta. El almacenamiento en caché solo afecta la entrada, el lote afecta solo el recurso compartido tolerante a la espera y algunos proveedores bloquean el almacenamiento en caché en solicitudes por lotes; por lo tanto, trate la cifra combinada como el mejor caso para el tráfico donde los tres realmente se aplican.
Preguntas frecuentes
¿Por qué los ahorros acumulados de LLM no simplemente se acumulan?
Cada palanca descuenta lo que dejó la última, por lo que se componen en lugar de sumar. Mantenga el 60% después del almacenamiento en caché, el 50% después del lote, el 80% después del descuento comprometido, y estará en el 24% de la lista: un ahorro del 76%, no el 110% que obtiene al agregar 40, 50 y 20. Nunca podrá ahorrar más de lo que gasta, razón por la cual sumar los porcentajes de los titulares siempre es incorrecto.
¿El almacenamiento en caché solo descuenta tokens de entrada?
Sí. El almacenamiento en caché reutiliza un prefijo de tokens que ya envió; La salida se genera nueva cada vez y nunca se almacena en caché. Por lo tanto, una carga de trabajo de RAG con muchas entradas parece difícil de almacenar en caché, mientras que una carga de trabajo de redacción con muchas salidas apenas lo nota. Esta herramienta aplica el descuento de caché únicamente a la parte de entrada y únicamente a la fracción reutilizada.
¿El orden de los descuentos cambia el total?
Para porcentajes fijos, no: la multiplicación es conmutativa, por lo que 0,6 × 0,5 × 0,8 es igual en cualquier orden. El orden sólo cambia la historia que cuenta la cascada. Empieza a importar cuando un descuento no es fijo (un nivel comprometido que se desbloquea por encima de un umbral o una prima de escritura de caché) que esta herramienta marca en lugar de modelar exactamente.
¿Puedo realmente apilar los tres en producción?
El almacenamiento en caché y los descuentos comprometidos se acumulan limpiamente. La API Batch es el truco: los trabajos por lotes son asíncronos, por lo que sólo el tráfico tolerante a la latencia puede utilizarlos, y algunos proveedores no ofrecen almacenamiento en caché en solicitudes por lotes. Establezca la participación del lote por debajo del 100 % para modelar la división y verifique que su proveedor permita que las palancas se unan antes de prometer financiar el número combinado.