HomeBlog › OpenAI vs Anthropic vs Gemini después del almacenamiento en caché

OpenAI vs Anthropic vs Gemini después del almacenamiento en caché rápido: diferencia de costo real (2026)

Publicado 15 julio 2026 · precios de referencia, verificar antes de presupuestar

Cada comparación de costos de LLM que haya visto probablemente ignore el almacenamiento en caché. Eso es un error, porque el almacenamiento en caché rápido cambia la clasificación de costos. Claude cobra una tarifa de escritura; OpenAI no lo hace. El almacenamiento en caché del contexto de Gemini cuesta por hora almacenada. Aquí están las verdaderas matemáticas.

Mecanismos de almacenamiento en caché: cómo funciona cada proveedor

Proveedortipo de cachéCache write costCache read costTTL de cachéfichas mínimas
Antrópico (Claude)Caché de prefijo de solicitud1,25× entrada estándar0,10× entrada estándar5 min (ampliable)1,024
OpenAI (GPT-4o)Caché automáticoSin tarifa de escritura0,50× entrada estándar~5 minutos1,024
Google (Géminis)Caché de contextoSin tarifa de escritura0,25× entrada estándarFacturado por hora almacenada32,768

Diferencias estructurales clave:

Los precios base (sin almacenamiento en caché)

ModeloIngrese $/1 millónProducción $/1 millón
Claudio Soneto 4$3.00$15.00
GPT-4o$2.50$10.00
Géminis 2.5 Pro$1.25$10.00

Sin almacenamiento en caché: Gemini 2.5 Pro es el más barato en cuanto a entrada ($1,25 frente a $2,50 frente a $3,00). Pero una vez que se aplica el almacenamiento en caché, la imagen cambia.

El escenario: aviso del sistema de 10,000 tokens, 500 solicitudes/día

A typical production app: you have a 10,000-token system prompt (instructions + context + examples), and you send 500 requests/day. Each request adds 300 tokens of user input and gets 400 tokens back.

Costo sin almacenamiento en caché (mensual, 15 000 solicitudes)

ModeloEntrada/solicitud (10.300 tok)Salida/requisito (400 tok)Mensual (requiere 15k)
GPT-4o$0.02575$0.004$446
Claudio Soneto 4$0.0309$0.006$550
Géminis 2.5 Pro$0.012875$0.004$255

Costo CON almacenamiento en caché aplicado (las mismas 15 000 solicitudes/mes)

El indicador del sistema de 10.000 tokens se almacena en caché. Cada solicitud posterior lee 10 000 tokens almacenados en caché + 300 tokens de entrada nuevos.

ModeloLectura de caché /1MNueva entrada /1MMensualversus sin caché
GPT-4o (caché automático)$1.25$2.50$204−$242 (−54%)
Claude Soneto 4 + caché$0.30$3.00$117−$433 (−79%)
Gemini 2.5 Pro + caché de contexto$0.3125$1.25$58*−$197 (−77%)

*La caché de contexto de Gemini también cobra $4,50 por hora por 10.000 tokens almacenados. En 1 instancia de caché que funciona las 24 horas del día, los 7 días de la semana: +$3,24/mes de costo de almacenamiento. Agregado por separado a continuación.

Espera, ¿Claude es más barato después del almacenamiento en caché? Sí. A esta escala (15k solicitudes/mes con 10k avisos del sistema), Claude Sonnet 4 con almacenamiento en caché cuesta $117/mes frente a los $204/mes de GPT-4o y los ~$61/mes de Gemini. El descuento de lectura de caché del 90% supera el precio base más alto de Claude cuando tiene un prefijo repetido grande.

La prima de escritura en caché (solo Anthropic)

En la primera solicitud, Anthropic cobra 1,25 × por escribir el caché. Para un sistema de 10 000 tokens a $3,00/1 millón: la primera solicitud cuesta $0,0375 frente a $0,030 estándar. Los $0,0075 adicionales se recuperan después de solo 1,14 accesos al caché. Si realiza 500 solicitudes al día, esa prima de suscripción es insignificante. Para un uso intermitente y de bajo volumen, suma.

La trampa de los costos de almacenamiento de Géminis

El caché de contexto de Gemini ofrece un 75 % de descuento en lecturas, el mayor descuento. Pero cobra cada hora por el contenido almacenado independientemente del tráfico. Para una caché de 10 000 tokens que se ejecuta las 24 horas del día, los 7 días de la semana:

Para casos de uso de contexto amplio (asistente de base de código, análisis de documentos), el costo de almacenamiento de Gemini puede erosionar la ventaja del descuento de caché. Calcule ambos términos antes de asumir que Géminis gana.

La nueva clasificación de costos después del almacenamiento en caché

Sin almacenamiento en caché: Gemini 2.5 Pro > GPT-4o > Claude Sonnet (del más barato al más caro)
Con almacenamiento en caché (mensaje del sistema grande, volumen alto): Géminis ≈ Claude > GPT-4o (Claude se pone al día dramáticamente)
Con almacenamiento en caché (ráfagas, volumen bajo): GPT-4o > Claude > Gemini (gana OpenAI sin tarifa de escritura + sin tarifa de almacenamiento)

El proveedor "más barato" depende de su patrón de tráfico y estructura de avisos.

Cuando cada enfoque gana

Caso de usoLa mejor elecciónRazón
Aplicación de gran volumen, mensaje de sistema fijo de gran tamaño (>2.000 tokens, >200 solicitudes/día)Claudio Soneto 490 % de descuento en caché + sin tarifa de almacenamiento = total más bajo a escala
Tráfico variable, solicitudes en ráfagasGPT-4oSin tarifa de escritura, sin tarifa de almacenamiento, automático: lo más indulgente
Contexto muy grande (>32k tokens) a gran volumenGéminis 2.5 Pro75 % de descuento en lectura de caché; El costo de almacenamiento es pequeño en relación con los ahorros en insumos.
Volumen bajo (<50 req/día), pequeño avisoFlash Géminis 2.0Los ahorros de almacenamiento en caché son mínimos; El precio bruto de Flash gana
Desarrollo/pruebas, uso impredecibleGPT-4o miniMás barato a bajo volumen; almacenamiento en caché automático sin gastos generales

La fórmula de cálculo

Para comparar proveedores con almacenamiento en caché para su caso de uso:

# Costo mensual por proveedor con almacenamiento en caché:
tokens_caché = tokens_prompt_su_sistema
nuevos_tokens = tokens_mensaje_usuario
tokens_salida = tokens_respuesta_promedio
requests = daily_requests × 30

# OpenAI (automatic, no write fee):
mensual = solicitudes × (tokens_caché × tasa_caché + tokens_nuevos × tasa_entrada + tokens_salida × tasa_salida) / 1_000_000

# Antrópico (explícito, escribe prima en la primera solicitud):
first_req = tokens_caché × (tasa_entrada × 1,25) / 1_000_000 # write premium
rest = (requests-1) × (cache_tokens × (input_rate × 0.10) + new_tokens × input_rate) / 1_000_000
costo_salida = solicitudes × tokens_salida × tasa_salida / 1_000_000
mensual = primer_requisito + resto + costo_salida

Or just use our calculadora de costos — establezca su recuento de tokens y los resultados reflejarán las tarifas estándar (el almacenamiento en caché se aplica automáticamente en la infraestructura del proveedor).

Precios de referencia, julio de 2026. Los mecanismos y tarifas de almacenamiento en caché cambian con frecuencia; verifíquelos en la documentación de OpenAI, Anthropic y Google. ¿Encontraste un error? Denuncialo →