HomeBlog › OpenAI vs Anthropic vs Gemini dopo la memorizzazione nella cache

OpenAI vs Anthropic vs Gemini dopo il caching immediato: differenza di costo reale (2026)

Pubblicato il 15 luglio 2026 · prezzi di riferimento, da verificare prima della stesura del budget

Ogni confronto dei costi LLM che hai visto probabilmente ignora la memorizzazione nella cache. Questo è un errore, perché la memorizzazione nella cache tempestiva modifica la classificazione dei costi. Claude addebita una commissione di scrittura; OpenAI no. La memorizzazione nella cache del contesto di Gemini costa per ora archiviata. Ecco i veri calcoli.

Meccanismi di memorizzazione nella cache: come funziona ciascun provider

FornitoreTipo di cacheCosto di scrittura nella cacheCosto di lettura della cacheTTL della cacheGettoni minimi
Antropico (Claude)Cache del prefisso prompt1,25× ingresso standard0,10× ingresso standard5 minuti (estendibile)1,024
OpenAI (GPT-4o)Cache automaticaNessuna commissione di scrittura0.50× standard input~5 minuti1,024
Google (Gemelli)Cache del contestoNessuna commissione di scrittura0,25× ingresso standardFatturato per ora memorizzata32,768

Principali differenze strutturali:

I prezzi base (senza memorizzazione nella cache)

ModelloInserisci $/1 milioneProduzione $/1 milione
Claude Sonetto 4$3.00$15.00
GPT-4o$2.50$10.00
Gemelli 2.5 Pro$1.25$10.00

Senza memorizzazione nella cache: Gemini 2.5 Pro è il più economico in ingresso ($ 1,25 contro $ 2,50 contro $ 3,00). Ma una volta applicata la memorizzazione nella cache, il quadro cambia.

Lo scenario: prompt di sistema da 10.000 token, 500 richieste al giorno

Una tipica app di produzione: hai un prompt di sistema da 10.000 token (istruzioni + contesto + esempi) e invii 500 richieste al giorno. Ogni richiesta aggiunge 300 token di input dell'utente e recupera 400 token.

Costo senza memorizzazione nella cache (mensile, 15.000 richieste)

ModelloIngresso/richiesta (10.300 tok)Produzione/richiesta (400 tok)Mensile (15k richiesti)
GPT-4o$0.02575$0.004$446
Claude Sonetto 4$0.0309$0.006$550
Gemelli 2.5 Pro$0.012875$0.004$255

Costo CON memorizzazione nella cache applicata (stesse 15.000 richieste/mese)

Il prompt del sistema da 10.000 token viene memorizzato nella cache. Ogni richiesta successiva legge 10.000 token memorizzati nella cache + 300 nuovi token di input.

ModelloLettura cache /1MNuovo ingresso /1MMensilecontro nessuna cache
GPT-4o (cache automatica)$1.25$2.50$204−$242 (−54%)
Claude Sonetto 4 + cache$0.30$3.00$117−$433 (−79%)
Gemini 2.5 Pro + cache di contesto$0.3125$1.25$58*−$197 (−77%)

*Anche la cache di contesto Gemini addebita 4,50 USD/ora per 10.000 token archiviati. Con 1 istanza di cache in esecuzione 24 ore su 24, 7 giorni su 7: +$ 3,24/mese di costo di archiviazione. Aggiunto separatamente di seguito.

Aspetta: Claude è più economico dopo la memorizzazione nella cache? SÌ. Su questa scala (15.000 richieste/mese con 10.000 prompt di sistema), Claude Sonnet 4 con memorizzazione nella cache costa $ 117/mese contro i $ 204/mese di GPT-4o e i ~ $ 61/mese di Gemini. Lo sconto sulla lettura della cache del 90% supera il prezzo base più alto di Claude quando si dispone di un prefisso ripetuto di grandi dimensioni.

La cache write premium (solo Anthropic)

Alla prima richiesta, Anthropic addebita 1,25× per scrivere la cache. Per un prompt di sistema da 10.000 token a $ 3,00/1 milione: la prima richiesta costa $ 0,0375 rispetto a $ 0,030 standard. I $ 0,0075 extra vengono recuperati dopo soli 1,14 accessi alla cache. Se esegui 500 richieste al giorno, il premio di scrittura è insignificante. Per un uso intenso e a basso volume, i conti tornano.

La trappola dei costi di archiviazione di Gemini

La cache di contesto di Gemini offre uno sconto del 75% sulle letture: lo sconto più grande. Ma fa pagare ogni ora per i contenuti archiviati indipendentemente dal traffico. Per una cache da 10.000 token in esecuzione 24 ore su 24, 7 giorni su 7:

Per casi d'uso in contesti di grandi dimensioni (assistente codebase, analisi di documenti), il costo di archiviazione di Gemini può erodere il vantaggio dello sconto sulla cache. Calcola entrambi i termini prima di presumere che Gemelli vinca.

La nuova classificazione dei costi dopo la memorizzazione nella cache

Senza memorizzazione nella cache: Gemini 2.5 Pro > GPT-4o > Claude Sonnet (dal più economico al più costoso)
Con memorizzazione nella cache (prompt di sistema di grandi dimensioni, volume elevato): Gemelli ≈ Claude > GPT-4o (Claude recupera drammaticamente)
Con memorizzazione nella cache (raffica, volume basso): GPT-4o > Claude > Gemini (vince OpenAI senza costi di scrittura e senza costi di archiviazione)

The "cheapest" provider depends on your traffic pattern and prompt structure.

Quando ogni approccio vince

Caso d'usoLa scelta miglioreMotivo
App a volume elevato, prompt di sistema fisso di grandi dimensioni (>2.000 token, >200 richieste/giorno)Claude Sonetto 4Sconto cache del 90% + nessuna tariffa di archiviazione = totale più basso su larga scala
Traffico variabile, richieste a rafficaGPT-4oNessun costo di scrittura, nessun costo di archiviazione, automatico: molto indulgente
Very large context (>32k tokens) at high volumeGemelli 2.5 Pro75% cache read discount; storage cost small relative to input savings
Basso volume (<50 richieste/giorno), breve richiestaGemelli 2.0 FlashRisparmio minimo nella memorizzazione nella cache; Il prezzo grezzo di Flash vince
Sviluppo/test, utilizzo imprevedibileGPT-4ominiPiù economico a basso volume; memorizzazione nella cache automatica senza sovraccarico

La formula di calcolo

Per confrontare i fornitori con memorizzazione nella cache per il tuo caso d'uso:

# Costo mensile per provider con memorizzazione nella cache:
cache_tokens = tuo_sistema_prompt_tokens
nuovi_token = utente_messaggio_token
output_tokens = media_risposta_token
richieste = richieste_giornaliere × 30

# OpenAI (automatico, senza costi di scrittura):
mensile = richieste × (cache_token × cache_rate + nuovi_token × input_rate + output_token × output_rate) / 1_000_000

# Anthropic (esplicito, scrivi premium alla prima richiesta):
first_req = cache_tokens × (input_rate × 1,25) / 1_000_000 # scrivi premium
resto = (richieste-1) × (cache_tokens × (input_rate × 0,10) + new_tokens × input_rate) / 1_000_000
costo_output = richieste × token_output × tasso_output / 1_000_000
mensile = prima_richiesta + resto + costo_output

Oppure usa semplicemente il nostro calcolatore dei costi — imposta il conteggio dei token e i risultati rifletteranno le tariffe standard (la memorizzazione nella cache si applica automaticamente sull'infrastruttura del provider).

Prezzi di riferimento, luglio 2026. I meccanismi e le tariffe di memorizzazione nella cache cambiano frequentemente: verifica sulla documentazione di OpenAI, Anthropic e Google. Trovato un errore? Segnalatelo →