Almacenamiento en caché rápido

Cómo reutilizar un prefijo de aviso estable reduce la parte repetida de su factura de LLM en aproximadamente un 90 %, cuando vale la pena y cuando no.

HogarAprender › Explicación del almacenamiento en caché rápido

¿Qué es realmente el almacenamiento en caché de avisos?

La mayoría de las aplicaciones LLM envían el mismo bloque de texto al comienzo de cada solicitud: un mensaje largo del sistema, un conjunto de definiciones de herramientas, algunos ejemplos breves o un fragmento de contexto de referencia. Normalmente pagas completo ficha de entrada precio de ese bloque en cada llamada, aunque nunca cambie.

Almacenamiento en caché rápido permite que el proveedor almacene esa estabilidad prefijo después de la primera llamada y, en llamadas posteriores que comiencen exactamente con el mismo mensaje de texto, factúrelo a una pequeña fracción de la tarifa normal, a menudo alrededor de 10% (un ~90% de descuento). Aún paga el precio completo por la parte que cambia cada llamada (la pregunta real del usuario), pero los gastos generales fijos se vuelven casi gratuitos.

Calculadora de ahorro de almacenamiento en caché rápida →

Cómo funciona entre proveedores

Hay dos sabores amplios y la diferencia importa para su factura.

Almacenamiento en caché explícito (por ejemplo, antrópico)

Usted marca dónde termina el prefijo almacenable en caché. la primera llamada escribe el cache y cuesta un poco más que un token de entrada normal, comúnmente alrededor de 1.25× la tasa de entrada, porque el proveedor tiene que almacenar el prefijo procesado. Cada llamada posterior que lo reutiliza es un lectura de caché, facturado aproximadamente 0.1× la tasa de entrada. El caché tiene un tiempo de vida (TTL) (a menudo, unos pocos minutos) que se actualiza cada vez que aparece, por lo que un flujo constante de tráfico lo mantiene activo.

Almacenamiento en caché automático (por ejemplo, OpenAI y otros)

El proveedor detecta prefijos repetidos y aplica un descuento sin prima de escritura en caché ni cambios de código. Es más simple, pero tiene menos control: no puede forzar un caché de larga duración, y las reglas de descuento y elegibilidad las establece el proveedor (generalmente se activan una vez que un prefijo supera una longitud mínima).

Caché explícitoCaché automático
¿Quién decide qué se almacena en caché?Tú (marca el prefijo)Proveedor (detecta repeticiones)
Costo de escritura en caché~1,25× entrada, una vezNinguno
Costo de lectura de caché~0,1× entradaCon descuento (establecido por el proveedor)
Control sobre TTLNo

Los multiplicadores son valores típicos publicados y varían según el modelo y el proveedor; confírmelo siempre en la página de precios del proveedor.

La compensación entre escritura y lectura: cuando vale la pena

Con un caché explícito, usted paga una pequeña prima única por escribir y luego obtiene un gran descuento en cada lectura. Por lo tanto, el almacenamiento en caché vale la pena una vez que reutilice el prefijo suficientes veces para compensar el costo de escritura. El punto de equilibrio es rápido: la prima de escritura es sólo aproximadamente 0,25 veces la entrada adicional, mientras que cada lectura ahorra alrededor de 0,9 veces la entrada, por lo que estará adelante después de aproximadamente dos reutilizaciones del mismo prefijo. Después de eso, cada golpe es casi puro ahorro.

Los ingredientes que hacen que el almacenamiento en caché sea una clara victoria:

Las aplicaciones de recuperación aumentada, los asistentes de codificación con grandes indicaciones del sistema y el chat de varios turnos se ajustan a esta forma. Vea las tácticas más amplias en el guía para reducir su factura de LLM API.

Un ejemplo trabajado

Di que tienes un Aviso del sistema de 2000 tokens (instrucciones + definiciones de herramientas + algunos ejemplos) que sale con cada solicitud, y usted hace 100.000 llamadas. Supongamos un precio de insumo de $3 por millón de tokens, una tasa de lectura de caché de 0,1× ($0,30/M) y una tasa de escritura de caché de 1,25× ($3,75/M). Ignoraremos la pregunta y el resultado del usuario por llamada aquí, ya que el almacenamiento en caché no los cambia.

Sin almacenamiento en caché

Cada llamada paga el precio completo por los 2000 tokens de prefijo:

100.000 × 2.000 = 200.000.000 tokens × $3/M = $600.

Con almacenamiento en caché

El prefijo se escribe una vez y se lee en las otras 99,999 llamadas (en la práctica, se reescribe cada vez que caduca el TTL, pero con un tráfico constante que es insignificante):

Total ≈ $60 versus $600 - un ~90% de reducción en la parte repetida del billete, por el precio de una línea que marca donde termina el prefijo. En cargas de trabajo reales, el prefijo suele ser mayor y las llamadas son más frecuentes, por lo que el ahorro absoluto es aún mayor.

Calculadora de costo de token →Calcula tus ahorros →

Escollos a tener en cuenta

Preguntas frecuentes

¿Cuánto ahorra el almacenamiento en caché?

En una lectura de caché, la mayoría de los proveedores facturan los tokens almacenados en caché a aproximadamente el 10 % de la tarifa de entrada normal: un descuento del 90 % en la parte repetida de su mensaje. La cifra exacta varía según el proveedor, pero un prefijo grande y estable reutilizado en muchas llamadas es donde se obtienen mayores ahorros.

¿La configuración del almacenamiento en caché rápido tiene un costo adicional?

Con cachés explícitos (como el de Anthropic), la primera llamada que escribe el caché cuesta un poco más que un token de entrada normal, comúnmente alrededor de 1,25 veces la tasa de entrada. Recupera esa prima de escritura tan pronto como reutiliza el prefijo un par de veces, después de lo cual cada visita se factura a la tarifa de lectura con gran descuento.

¿Cuándo no vale la pena el almacenamiento en caché rápido?

El almacenamiento en caché solo ayuda cuando un prefijo grande es idéntico en todas las llamadas y se reutiliza antes de que caduque el caché. Un prefijo corto, un mensaje que cambia cada llamada o un volumen de llamadas bajo significan que el costo de escritura nunca se recupera; en esos casos, el almacenamiento en caché agrega gastos generales en lugar de ahorrar dinero.

Solo referencia educativa: las tasas de caché, los TTL y las longitudes mínimas son estimaciones; Confirme los términos actuales en la página de precios de cada proveedor.