—factura total / mes
—es el preámbulo
—guardado de caché / mes
Adónde van tus tokens de entrada
La factura mensual se divide en el preámbulo fijo que reenvía cada vez, el usuario dinámico y los tokens de contexto, y el resultado. La primera fila es el impuesto: no se reduce cuando los usuarios dicen menos.
| Parte | Fichas / solicitud | Costo / mes | Compartir |
|---|
Cómo el tamaño rápido aumenta el impuesto
Cada fila tiene una longitud diferente según el mensaje del sistema en su volumen actual. La columna sin caché es el costo ingenuo; la columna almacenada en caché aplica su tasa de acierto y descuento. Es por eso que un aviso que creció de 500 a 4000 tokens multiplicó silenciosamente su factura.
| Aviso del sistema | Sin caché / mes | En caché / mes | vs el tuyo |
|---|
El mensaje que escribiste una vez, lo pagas un millón de veces
Un aviso del sistema se siente libre porque lo escribe una vez y lo olvida, pero la API no tiene estado, por lo que el preámbulo se incluye en cada llamada y se factura como tokens de entrada cada vez. La trampa son las solicitudes breves y de gran volumen: un clasificador o un enrutador que recibe veinte tokens de texto de usuario y un bloque de instrucciones de dos mil tokens gasta el 99% de su presupuesto de entrada en palabras que el usuario nunca envió. La solución es aburrida y efectiva: lea el mensaje del sistema como si estuviera pagando por palabra, porque es así, y elimine el relleno cortés, las reglas duplicadas y los esquemas de herramientas que casi nunca invoca. Luego almacene en caché lo que sobrevive, ya que un preámbulo estable es exactamente para lo que se creó el almacenamiento en caché y una lectura en caché cuesta aproximadamente una décima parte de una nueva. La razón por la que el recorte es lo primero es que ayuda incondicionalmente, tanto en los errores como en los aciertos de la caché, mientras que el almacenamiento en caché sólo da resultados en las solicitudes que llegan mientras la caché está caliente y sólo si el prefijo permanece idéntico byte por byte: una marca de tiempo cerca de la parte superior y el descuento se evapora. Dimensione la palanca de almacenamiento en caché con precisión en el calculadora de ahorro de almacenamiento en caché rápida, verifique el punto de equilibrio de escritura versus lectura en el calculadora de equilibrio de escritura en cachéy cuente los tokens en su mensaje actual con el contador de fichas.
Ahorro de almacenamiento en caché rápidoPunto de equilibrio de escritura en cachéCosto de llamada a funciónContador de fichasOptimización de costos de LLM
Cómo funciona esta calculadora
Cuenta sus solicitudes mensuales como solicitudes por día multiplicadas por 30,4. Cada solicitud paga por el aviso del sistema más la entrada dinámica a la tasa de entrada y la salida a la tasa de salida. El costo del sistema es el número de tokens multiplicado por las solicitudes mensuales a la tasa de entrada; El almacenamiento en caché reduce la parte de la tasa de aciertos a la tasa de descuento, mientras que la parte perdida se mantiene en el precio completo. La factura total suma el preámbulo fijo, la entrada dinámica y la salida. El porcentaje es el costo del sistema sobre ese total, y el ahorro de caché es el costo del preámbulo no almacenado en caché menos el almacenado en caché. La tabla de escala vuelve a ejecutar el costo del preámbulo en varias longitudes de aviso para que pueda ver cómo crece, y la cifra de recorte aplica su porcentaje de recorte al aviso actual.
Preguntas frecuentes
¿Por qué el aviso del sistema cuesta dinero en cada solicitud?
Debido a que la API no tiene estado (no recuerda su llamada anterior), todo lo que desee que el modelo sepa cada vez debe enviarse cada vez. El mensaje del sistema, la persona, los ejemplos breves y los esquemas de herramientas se encuentran en ese preámbulo fijo, y cada uno se cuenta como token de entrada en cada solicitud. Un usuario que escribe una sola palabra todavía paga por todo el preámbulo que la acompaña, razón por la cual un mensaje inflado del sistema se comporta como un impuesto fijo cobrado en su totalidad tanto en las solicitudes más pequeñas como en las más grandes.
¿Cuánto de mi factura me indica el sistema?
Depende de la proporción entre su preámbulo fijo y el contenido variable de cada solicitud. Un aviso de dos mil tokens frente a un turno de usuario de quinientos tokens es la mayoría de sus tokens de entrada y puede dominar la factura, especialmente en llamadas cortas y de gran volumen, como las de clasificación, donde apenas hay texto de usuario para diluirlo. Si sus solicitudes contienen documentos extensos o historiales de chat, el preámbulo es una porción más pequeña. El caso peligroso es el de un gran volumen más solicitudes breves más un mensaje largo.
¿El almacenamiento en caché de avisos elimina el costo de avisos del sistema?
Elimina la mayor parte en las llamadas que llegan al caché. El almacenamiento en caché almacena un prefijo estable (el aviso del sistema es el candidato perfecto) y las facturas se leen con un gran descuento, generalmente alrededor del 90%, por lo que un aviso del sistema en caché cuesta aproximadamente una décima parte de uno sin caché. El problema es que solo las solicitudes que llegan mientras el caché está caliente obtienen el descuento, a veces hay una pequeña prima de escritura y el prefijo tiene que ser idéntico byte por byte, por lo que una marca de tiempo cerca de la parte superior lo rompe.
¿Es mejor recortar el mensaje del sistema o almacenarlo en caché?
Haga ambas cosas, pero resuelven problemas diferentes. El recorte elimina los tokens en el preámbulo, lo que reduce el costo de cada solicitud, incluidos los errores de caché, y libera la ventana de contexto. El almacenamiento en caché deja el mensaje largo pero hace que las lecturas repetidas sean económicas en llamadas cálidas. El recorte es la ganancia más sólida porque ayuda incondicionalmente, mientras que el almacenamiento en caché depende de que el tráfico mantenga el caché caliente. Primero elimine todo lo que no gane sus tokens y luego almacene en caché lo que quede.