Uso de API de LLM

Costo de caché

Métrico Sin caché Con caché

Cómo funciona el almacenamiento en caché semántico

Cada consulta entrante se convierte en un vector de incrustación. El caché comprueba si existe un vector similar (similitud del coseno ≥ umbral, normalmente 0,92–0,97). En caso afirmativo, la respuesta almacenada se devuelve instantáneamente: no se consumen tokens LLM. En caso negativo, la consulta se envía al LLM y el resultado se almacena para futuras visitas.

De dónde viene la tasa de aciertos: Las consultas repetitivas (bots de preguntas frecuentes, atención al cliente) representan entre un 30% y un 60%. Diversas consultas abiertas (asistentes de codificación, escritura creativa) representan entre un 5% y un 15%. Puede aumentar la tasa de aciertos reduciendo el umbral de similitud, pero esto corre el riesgo de generar respuestas almacenadas en caché ligeramente incorrectas.

Costo de incrustación: Cada consulta (acertada o fallida) cuesta una búsqueda de incrustación. A $0,02/1 millón de tokens, insertar una consulta de 300 tokens cuesta $0,000006, algo insignificante a menos que tengas millones de consultas por día.

Ver también: Ahorros rápidos en caché · Calculadora de costos RAG · Costo de base de datos vectorial

Preguntas frecuentes

¿Qué es un caché semántico para LLM?

Un caché semántico almacena respuestas LLM anteriores y utiliza similitud incrustada para detectar consultas que son semánticamente similares. Cuando la similitud supera el umbral, la respuesta almacenada en caché se devuelve sin llamar al LLM, lo que ahorra el costo total del token para esa consulta.

¿Qué tasa de aciertos de caché es realista?

Los robots de atención al cliente con preguntas repetitivas suelen tener tasas de acierto del 30% al 60%. Los chatbots abiertos o los asistentes de codificación pueden registrar entre un 5% y un 15%. Un buen umbral de similitud (0,92–0,97 coseno) equilibra la tasa de aciertos con la degradación de la calidad.

¿Cuál es la tasa de acierto del punto de equilibrio?

Punto de equilibrio = costo de caché ÷ (consultas/mes × tokens × precio LLM/token). Si su LLM cuesta $0,003/consulta y el caché cuesta $50/mes con 100.000 consultas/mes, solo necesita una tasa de acierto del 1,7% para alcanzar el punto de equilibrio.

¿En qué se diferencia el almacenamiento en caché semántico del almacenamiento en caché rápido?

El almacenamiento en caché rápido (Anthropic cache_control, almacenamiento en caché automático OpenAI) reutiliza el cálculo KV para prefijos de token idénticos. El almacenamiento en caché semántico se encuentra en el nivel de la aplicación: ofrece respuestas almacenadas en caché completas cuando las consultas son semánticamente similares. Son complementarios.

¿Qué herramientas proporcionan almacenamiento en caché semántico para los LLM?

Opciones populares: GPTCache (código abierto), Momento Vector Index (administrado), Zep (capa de memoria), LangChain CacheBackedEmbeddings, Redis con búsqueda vectorial. Las opciones administradas cuestan entre $10 y $200 al mes; Redis autohospedado cuesta entre 5 y 30 dólares al mes en una máquina virtual pequeña.