Publicado 15 julio 2026 · precios de referencia, verificar antes de presupuestar
Cada comparación de costos de LLM que haya visto probablemente ignore el almacenamiento en caché. Eso es un error, porque el almacenamiento en caché rápido cambia la clasificación de costos. Claude cobra una tarifa de escritura; OpenAI no lo hace. El almacenamiento en caché del contexto de Gemini cuesta por hora almacenada. Aquí están las verdaderas matemáticas.
| Proveedor | tipo de caché | Cache write cost | Cache read cost | TTL de caché | fichas mínimas |
|---|---|---|---|---|---|
| Antrópico (Claude) | Caché de prefijo de solicitud | 1,25× entrada estándar | 0,10× entrada estándar | 5 min (ampliable) | 1,024 |
| OpenAI (GPT-4o) | Caché automático | Sin tarifa de escritura | 0,50× entrada estándar | ~5 minutos | 1,024 |
| Google (Géminis) | Caché de contexto | Sin tarifa de escritura | 0,25× entrada estándar | Facturado por hora almacenada | 32,768 |
Diferencias estructurales clave:
| Modelo | Ingrese $/1 millón | Producción $/1 millón |
|---|---|---|
| Claudio Soneto 4 | $3.00 | $15.00 |
| GPT-4o | $2.50 | $10.00 |
| Géminis 2.5 Pro | $1.25 | $10.00 |
Sin almacenamiento en caché: Gemini 2.5 Pro es el más barato en cuanto a entrada ($1,25 frente a $2,50 frente a $3,00). Pero una vez que se aplica el almacenamiento en caché, la imagen cambia.
A typical production app: you have a 10,000-token system prompt (instructions + context + examples), and you send 500 requests/day. Each request adds 300 tokens of user input and gets 400 tokens back.
| Modelo | Entrada/solicitud (10.300 tok) | Salida/requisito (400 tok) | Mensual (requiere 15k) |
|---|---|---|---|
| GPT-4o | $0.02575 | $0.004 | $446 |
| Claudio Soneto 4 | $0.0309 | $0.006 | $550 |
| Géminis 2.5 Pro | $0.012875 | $0.004 | $255 |
El indicador del sistema de 10.000 tokens se almacena en caché. Cada solicitud posterior lee 10 000 tokens almacenados en caché + 300 tokens de entrada nuevos.
| Modelo | Lectura de caché /1M | Nueva entrada /1M | Mensual | versus sin caché |
|---|---|---|---|---|
| GPT-4o (caché automático) | $1.25 | $2.50 | $204 | −$242 (−54%) |
| Claude Soneto 4 + caché | $0.30 | $3.00 | $117 | −$433 (−79%) |
| Gemini 2.5 Pro + caché de contexto | $0.3125 | $1.25 | $58* | −$197 (−77%) |
*La caché de contexto de Gemini también cobra $4,50 por hora por 10.000 tokens almacenados. En 1 instancia de caché que funciona las 24 horas del día, los 7 días de la semana: +$3,24/mes de costo de almacenamiento. Agregado por separado a continuación.
En la primera solicitud, Anthropic cobra 1,25 × por escribir el caché. Para un sistema de 10 000 tokens a $3,00/1 millón: la primera solicitud cuesta $0,0375 frente a $0,030 estándar. Los $0,0075 adicionales se recuperan después de solo 1,14 accesos al caché. Si realiza 500 solicitudes al día, esa prima de suscripción es insignificante. Para un uso intermitente y de bajo volumen, suma.
El caché de contexto de Gemini ofrece un 75 % de descuento en lecturas, el mayor descuento. Pero cobra cada hora por el contenido almacenado independientemente del tráfico. Para una caché de 10 000 tokens que se ejecuta las 24 horas del día, los 7 días de la semana:
Para casos de uso de contexto amplio (asistente de base de código, análisis de documentos), el costo de almacenamiento de Gemini puede erosionar la ventaja del descuento de caché. Calcule ambos términos antes de asumir que Géminis gana.
| Caso de uso | La mejor elección | Razón |
|---|---|---|
| Aplicación de gran volumen, mensaje de sistema fijo de gran tamaño (>2.000 tokens, >200 solicitudes/día) | Claudio Soneto 4 | 90 % de descuento en caché + sin tarifa de almacenamiento = total más bajo a escala |
| Tráfico variable, solicitudes en ráfagas | GPT-4o | Sin tarifa de escritura, sin tarifa de almacenamiento, automático: lo más indulgente |
| Contexto muy grande (>32k tokens) a gran volumen | Géminis 2.5 Pro | 75 % de descuento en lectura de caché; El costo de almacenamiento es pequeño en relación con los ahorros en insumos. |
| Volumen bajo (<50 req/día), pequeño aviso | Flash Géminis 2.0 | Los ahorros de almacenamiento en caché son mínimos; El precio bruto de Flash gana |
| Desarrollo/pruebas, uso impredecible | GPT-4o mini | Más barato a bajo volumen; almacenamiento en caché automático sin gastos generales |
Para comparar proveedores con almacenamiento en caché para su caso de uso:
Or just use our calculadora de costos — establezca su recuento de tokens y los resultados reflejarán las tarifas estándar (el almacenamiento en caché se aplica automáticamente en la infraestructura del proveedor).