¿Qué es realmente el almacenamiento en caché de avisos?
La mayoría de las aplicaciones LLM envían el mismo bloque de texto al comienzo de cada solicitud: un mensaje largo del sistema, un conjunto de definiciones de herramientas, algunos ejemplos breves o un fragmento de contexto de referencia. Normalmente pagas completo ficha de entrada precio de ese bloque en cada llamada, aunque nunca cambie.
Almacenamiento en caché rápido permite que el proveedor almacene esa estabilidad prefijo después de la primera llamada y, en llamadas posteriores que comiencen exactamente con el mismo mensaje de texto, factúrelo a una pequeña fracción de la tarifa normal, a menudo alrededor de 10% (un ~90% de descuento). Aún paga el precio completo por la parte que cambia cada llamada (la pregunta real del usuario), pero los gastos generales fijos se vuelven casi gratuitos.
Calculadora de ahorro de almacenamiento en caché rápida →Cómo funciona entre proveedores
Hay dos sabores amplios y la diferencia importa para su factura.
Almacenamiento en caché explícito (por ejemplo, antrópico)
Usted marca dónde termina el prefijo almacenable en caché. la primera llamada escribe el cache y cuesta un poco más que un token de entrada normal, comúnmente alrededor de 1.25× la tasa de entrada, porque el proveedor tiene que almacenar el prefijo procesado. Cada llamada posterior que lo reutiliza es un lectura de caché, facturado aproximadamente 0.1× la tasa de entrada. El caché tiene un tiempo de vida (TTL) (a menudo, unos pocos minutos) que se actualiza cada vez que aparece, por lo que un flujo constante de tráfico lo mantiene activo.
Almacenamiento en caché automático (por ejemplo, OpenAI y otros)
El proveedor detecta prefijos repetidos y aplica un descuento sin prima de escritura en caché ni cambios de código. Es más simple, pero tiene menos control: no puede forzar un caché de larga duración, y las reglas de descuento y elegibilidad las establece el proveedor (generalmente se activan una vez que un prefijo supera una longitud mínima).
| Caché explícito | Caché automático | |
|---|---|---|
| ¿Quién decide qué se almacena en caché? | Tú (marca el prefijo) | Proveedor (detecta repeticiones) |
| Costo de escritura en caché | ~1,25× entrada, una vez | Ninguno |
| Costo de lectura de caché | ~0,1× entrada | Con descuento (establecido por el proveedor) |
| Control sobre TTL | Sí | No |
Los multiplicadores son valores típicos publicados y varían según el modelo y el proveedor; confírmelo siempre en la página de precios del proveedor.
La compensación entre escritura y lectura: cuando vale la pena
Con un caché explícito, usted paga una pequeña prima única por escribir y luego obtiene un gran descuento en cada lectura. Por lo tanto, el almacenamiento en caché vale la pena una vez que reutilice el prefijo suficientes veces para compensar el costo de escritura. El punto de equilibrio es rápido: la prima de escritura es sólo aproximadamente 0,25 veces la entrada adicional, mientras que cada lectura ahorra alrededor de 0,9 veces la entrada, por lo que estará adelante después de aproximadamente dos reutilizaciones del mismo prefijo. Después de eso, cada golpe es casi puro ahorro.
Los ingredientes que hacen que el almacenamiento en caché sea una clara victoria:
- Un gran prefijo repetido — cuantos más tokens fijos, mayor será el descuento en términos absolutos.
- Alto volumen de llamadas — muchas solicitudes comparten el mismo prefijo dentro de la ventana TTL.
- Un prefijo estable — el bloque reutilizado es idéntico byte por byte en cada llamada.
Las aplicaciones de recuperación aumentada, los asistentes de codificación con grandes indicaciones del sistema y el chat de varios turnos se ajustan a esta forma. Vea las tácticas más amplias en el guía para reducir su factura de LLM API.
Un ejemplo trabajado
Di que tienes un Aviso del sistema de 2000 tokens (instrucciones + definiciones de herramientas + algunos ejemplos) que sale con cada solicitud, y usted hace 100.000 llamadas. Supongamos un precio de insumo de $3 por millón de tokens, una tasa de lectura de caché de 0,1× ($0,30/M) y una tasa de escritura de caché de 1,25× ($3,75/M). Ignoraremos la pregunta y el resultado del usuario por llamada aquí, ya que el almacenamiento en caché no los cambia.
Sin almacenamiento en caché
Cada llamada paga el precio completo por los 2000 tokens de prefijo:
100.000 × 2.000 = 200.000.000 tokens × $3/M = $600.
Con almacenamiento en caché
El prefijo se escribe una vez y se lee en las otras 99,999 llamadas (en la práctica, se reescribe cada vez que caduca el TTL, pero con un tráfico constante que es insignificante):
- 1 escritura: 2000 tokens × $3,75/M ≈ $0.0075
- 99.999 lecturas: ~200.000.000 tokens × $0,30/M ≈ $60
Total ≈ $60 versus $600 - un ~90% de reducción en la parte repetida del billete, por el precio de una línea que marca donde termina el prefijo. En cargas de trabajo reales, el prefijo suele ser mayor y las llamadas son más frecuentes, por lo que el ahorro absoluto es aún mayor.
Calculadora de costo de token →Calcula tus ahorros →Escollos a tener en cuenta
- Todo lo que hay antes de la pieza de cambio debe ser idéntico. Almacenamiento en caché de coincidencias en un prefijo exacto. Una marca de tiempo, un nombre de usuario o una orden de ejemplo barajada cerca de la parte superior invalida la coincidencia y usted paga silenciosamente el precio completo.
- Caducidad del TTL. Si el tráfico es escaso y el intervalo entre llamadas excede la vida útil de la caché, el prefijo caduca y la siguiente llamada paga nuevamente el costo de escritura. Las cargas de trabajo intensas y de bajo volumen son las que menos se benefician.
- Los prefijos pequeños no valen la pena. Por debajo de la longitud mínima de almacenamiento en caché de un proveedor, o cuando el bloque fijo es de solo unos pocos cientos de tokens, los ahorros son mínimos y la prima de escritura puede dejarlo en una situación ligeramente peor.
- Pon las cosas del establo primero. Estructurar los avisos de modo que el aviso invariable del sistema, las herramientas y el contexto se presenten antes que la entrada volátil del usuario; el almacenamiento en caché solo puede cubrir la ejecución principal de tokens idénticos.
Preguntas frecuentes
¿Cuánto ahorra el almacenamiento en caché?
En una lectura de caché, la mayoría de los proveedores facturan los tokens almacenados en caché a aproximadamente el 10 % de la tarifa de entrada normal: un descuento del 90 % en la parte repetida de su mensaje. La cifra exacta varía según el proveedor, pero un prefijo grande y estable reutilizado en muchas llamadas es donde se obtienen mayores ahorros.
¿La configuración del almacenamiento en caché rápido tiene un costo adicional?
Con cachés explícitos (como el de Anthropic), la primera llamada que escribe el caché cuesta un poco más que un token de entrada normal, comúnmente alrededor de 1,25 veces la tasa de entrada. Recupera esa prima de escritura tan pronto como reutiliza el prefijo un par de veces, después de lo cual cada visita se factura a la tarifa de lectura con gran descuento.
¿Cuándo no vale la pena el almacenamiento en caché rápido?
El almacenamiento en caché solo ayuda cuando un prefijo grande es idéntico en todas las llamadas y se reutiliza antes de que caduque el caché. Un prefijo corto, un mensaje que cambia cada llamada o un volumen de llamadas bajo significan que el costo de escritura nunca se recupera; en esos casos, el almacenamiento en caché agrega gastos generales en lugar de ahorrar dinero.
Solo referencia educativa: las tasas de caché, los TTL y las longitudes mínimas son estimaciones; Confirme los términos actuales en la página de precios de cada proveedor.