HomeToolsLearn › Optimización de costos de LLM
factura mensual optimizada
ahorro mensual
descuento efectivo
ahorrado por año

De donde vienen los ahorros

PalancaSe aplica aGuarda

Las tres palancas y por qué se apilan

La mayoría de los consejos para "reducir los costos de su LLM en un 90%" son reales; solo se aplican a parte de su tráfico, y las cifras de los titulares asumen el mejor de los casos. Esta calculadora hace que la participación sea explícita. Almacenamiento en caché rápido descuenta el prefijo repetido de su entrada (mensaje del sistema, contexto RAG, un documento largo) al 10-50% de la tasa de entrada; no hace nada con los tokens de salida ni con las entradas que cambian en cada llamada. Procesamiento por lotes ofrece un 50% fijo en cualquier solicitud que pueda ejecutarse de forma asincrónica: excelente para clasificación, resúmenes y generación de informes, inútil para un chat en vivo. Enrutamiento modelo envía las solicitudes fáciles a un modelo más pequeño y mucho más barato y mantiene el modelo de frontera para las difíciles. Aplicados a los segmentos de tráfico que cada uno realmente puede alcanzar, se combinan para generar una reducción realmente grande.

Por qué el descuento efectivo es inferior al de los titulares

Si el 90% del almacenamiento en caché, el 50% por lotes y el 85% de enrutamiento llegaran a su factura total, no pagaría casi nada, pero no es así. El almacenamiento en caché sólo toca la entrada almacenable en caché; el lote sólo toca el tráfico asíncrono; el enrutamiento solo toca las solicitudes que un modelo más económico puede manejar. Establezca esas acciones honestamente y la calculadora devolverá el mezclado descuento en toda su carga de trabajo real. Esa cifra combinada (a menudo entre el 40% y el 70% en lugar del 90%) es la que se debe incluir en un presupuesto. Valide las palancas individuales con el calculadora de almacenamiento en caché rápida, el calculadora de ahorro por lotes y el calculadora de enrutamiento de modelos.

El orden de las operaciones importa

Las palancas interactúan: el almacenamiento en caché reduce el costo de los insumos primero, luego el lote y el enrutamiento se aplican a lo que queda, por lo que apilarlos no es una simple suma. Esta herramienta aplica el almacenamiento en caché al segmento de entrada almacenable en caché y luego aplica descuentos por lotes y de enrutamiento a sus partes del restante gastar, razón por la cual el descuento combinado es menor que la suma de las partes. Antes de optimizar, obtenga su línea de base correcta con el Calculadora de costos de tokens LLM y encuentra el modelo base más barato con API LLM más barata.

como usarlo

1. Ingrese su gasto mensual actual en LLM y aproximadamente qué proporción son los tokens de entrada y de salida.
2. Establezca la cantidad de su entrada que se repetirá/almacenará en caché y el precio de acierto en caché de su proveedor (10% antrópico, 25–50% OpenAI).
3. Establezca la proporción de tráfico que puede agrupar y la proporción que puede enrutar a un modelo más económico.
4. Lea la factura optimizada y el descuento efectivo; luego, primero implemente las palancas con las filas de "Ahorros" más grandes.

Preguntas frecuentes

¿Se apilan el almacenamiento en caché y el procesamiento por lotes?

Sí, una solicitud por lotes también puede utilizar un prefijo almacenado en caché. Esta herramienta aplica primero el almacenamiento en caché a la entrada y luego descuentos por lotes/enrutamiento al gasto restante, por lo que el efecto combinado es multiplicativo, no aditivo.

¿Qué precio de acierto de caché debo utilizar?

Lecturas en caché de billetes antrópicos al 10% de la tasa de entrada; OpenAI entre un 25% y un 50% según el modelo; Almacenamiento en caché de contexto de Google a ~10%. Utilice la cifra de su proveedor para el segmento de entrada almacenable en caché.

¿El enrutamiento es riesgoso para la calidad?

Solo si dirige solicitudes difíciles a un modelo débil. El patrón seguro es un clasificador o capa de reglas que envía solicitudes simples/cortas al modelo económico y escala el resto. Modele la división del gasto con el calculadora de enrutamiento.

Estimación únicamente. Los descuentos dependen de su combinación de tráfico exacta y de los precios de los proveedores; verifique las tarifas actuales antes de hacer un presupuesto.

Aloja tu proyecto:Océano Digital — $200 gratis ↗VPS Hostinger
Ahorro de costos de IAAhorro de almacenamiento en caché rápidoPista de nivel libreCalculadora de ahorro de desviación de soporte de IANiveles de API gratuitos