Publicado 2026-06-21 · números de referencia, verificar antes de presupuestar
Si su aplicación envía el mismo mensaje largo del sistema, los mismos documentos recuperados o el mismo historial de chat en crecimiento en cada llamada, está pagando el precio completo por volver a leer el texto que el modelo ya vio hace unos segundos. Almacenamiento en caché rápido es la solución, y es el mayor descuento en artículos de línea que la mayoría de los equipos nunca activan. Bien hecho, reduce el costo de los insumos 50% a 90%. Así es como funciona, los números de 2026 y dónde silenciosamente no ayuda.
Una factura de LLM es principalmente tokens de entrada × precio + tokens de salida × precio. El almacenamiento en caché ataca la mitad de entrada. Cuando marca una parte del mensaje como almacenable en caché, el proveedor almacena su formulario procesado durante un breve período; en la siguiente llamada que reutilice exactamente el mismo prefijo, se le facturará un fracción de la tasa de entrada normal para esos tokens en lugar del monto total. El precio de salida no se modifica: el almacenamiento en caché solo descuenta la parte que sigue reenviando.
| Proveedor | Precio de entrada en caché | Notas |
|---|---|---|
| AbiertoAI | ~50% de la entrada | Automático en mensajes largos, sin cambio de código |
| Antrópico (Claude) | ~10% de la entrada en lecturas | Hasta un 90 % de descuento, pero ~25 % suscribe una prima la primera vez |
| Google Géminis | ~25% de la entrada | Almacenamiento en caché de contexto; puede agregar una pequeña tarifa de almacenamiento |
Digamos que un asistente de soporte envía un Aviso del sistema de 2000 tokens + base de conocimientos en cada mensaje, más ~200 tokens de la pregunta real del usuario y devuelve ~300 tokens de salida. Con 10.000 conversaciones al mes, el bloque fijo de 2.000 tokens se reenvía 10.000 veces. Usando un modelo a $2,50 / 1 millón de entrada:
Escala eso a 100.000 o 1 millón de conversaciones y el prefijo estático marcará la diferencia entre una factura cómoda y una alarmante. Cuanto más grande y más repetido sea su contexto fijo, más vale el almacenamiento en caché: las aplicaciones RAG y los agentes de avisos prolongados del sistema son los que más se benefician.
Almacene en caché cuando vuelva a enviar un bloque de contexto grande e idéntico con frecuencia y rapidez: mensajes del sistema, definiciones de herramientas, documentos RAG, ejemplos breves, historial de chat extenso. No se preocupe por llamadas únicas, indicaciones muy variables o cargas de trabajo con muchos resultados. Estructurar el mensaje estático-primero, variable-último, y el descuento se acerca al dinero gratis. Ponle un número a tu propio caso con el calculadora de ahorro de almacenamiento en caché rápiday comparar modelos en el Calculadora de costos de API de IA.
Normalmente, entre un 50 % y un 90 % de descuento sobre el precio de entrada de la parte almacenada en caché, según el proveedor. Solo descuenta tokens de entrada repetidos, no salida.
No. Es una optimización de facturación/latencia: el modelo ve los mismos tokens, solo que usted paga menos para volver a enviar el prefijo almacenado en caché. Las respuestas no cambian.
Casi siempre la prima de escritura (por ejemplo, el recargo de ~25% de Anthropic para crear el caché) en prefijos que no se reutilizan lo suficiente antes de su vencimiento, o un prefijo que cambia cada llamada para que nunca llegue. El almacenamiento en caché vale la pena con una reutilización frecuente e idéntica.
Estimaciones de referencia: verifique siempre los descuentos y tarifas en la página de precios oficial del proveedor.