Pubblicato il 15 luglio 2026 · prezzi di riferimento, da verificare prima della stesura del budget
Ogni confronto dei costi LLM che hai visto probabilmente ignora la memorizzazione nella cache. Questo è un errore, perché la memorizzazione nella cache tempestiva modifica la classificazione dei costi. Claude addebita una commissione di scrittura; OpenAI no. La memorizzazione nella cache del contesto di Gemini costa per ora archiviata. Ecco i veri calcoli.
| Fornitore | Tipo di cache | Costo di scrittura nella cache | Costo di lettura della cache | TTL della cache | Gettoni minimi |
|---|---|---|---|---|---|
| Antropico (Claude) | Cache del prefisso prompt | 1,25× ingresso standard | 0,10× ingresso standard | 5 minuti (estendibile) | 1,024 |
| OpenAI (GPT-4o) | Cache automatica | Nessuna commissione di scrittura | 0.50× standard input | ~5 minuti | 1,024 |
| Google (Gemelli) | Cache del contesto | Nessuna commissione di scrittura | 0,25× ingresso standard | Fatturato per ora memorizzata | 32,768 |
Principali differenze strutturali:
| Modello | Inserisci $/1 milione | Produzione $/1 milione |
|---|---|---|
| Claude Sonetto 4 | $3.00 | $15.00 |
| GPT-4o | $2.50 | $10.00 |
| Gemelli 2.5 Pro | $1.25 | $10.00 |
Senza memorizzazione nella cache: Gemini 2.5 Pro è il più economico in ingresso ($ 1,25 contro $ 2,50 contro $ 3,00). Ma una volta applicata la memorizzazione nella cache, il quadro cambia.
Una tipica app di produzione: hai un prompt di sistema da 10.000 token (istruzioni + contesto + esempi) e invii 500 richieste al giorno. Ogni richiesta aggiunge 300 token di input dell'utente e recupera 400 token.
| Modello | Ingresso/richiesta (10.300 tok) | Produzione/richiesta (400 tok) | Mensile (15k richiesti) |
|---|---|---|---|
| GPT-4o | $0.02575 | $0.004 | $446 |
| Claude Sonetto 4 | $0.0309 | $0.006 | $550 |
| Gemelli 2.5 Pro | $0.012875 | $0.004 | $255 |
Il prompt del sistema da 10.000 token viene memorizzato nella cache. Ogni richiesta successiva legge 10.000 token memorizzati nella cache + 300 nuovi token di input.
| Modello | Lettura cache /1M | Nuovo ingresso /1M | Mensile | contro nessuna cache |
|---|---|---|---|---|
| GPT-4o (cache automatica) | $1.25 | $2.50 | $204 | −$242 (−54%) |
| Claude Sonetto 4 + cache | $0.30 | $3.00 | $117 | −$433 (−79%) |
| Gemini 2.5 Pro + cache di contesto | $0.3125 | $1.25 | $58* | −$197 (−77%) |
*Anche la cache di contesto Gemini addebita 4,50 USD/ora per 10.000 token archiviati. Con 1 istanza di cache in esecuzione 24 ore su 24, 7 giorni su 7: +$ 3,24/mese di costo di archiviazione. Aggiunto separatamente di seguito.
Alla prima richiesta, Anthropic addebita 1,25× per scrivere la cache. Per un prompt di sistema da 10.000 token a $ 3,00/1 milione: la prima richiesta costa $ 0,0375 rispetto a $ 0,030 standard. I $ 0,0075 extra vengono recuperati dopo soli 1,14 accessi alla cache. Se esegui 500 richieste al giorno, il premio di scrittura è insignificante. Per un uso intenso e a basso volume, i conti tornano.
La cache di contesto di Gemini offre uno sconto del 75% sulle letture: lo sconto più grande. Ma fa pagare ogni ora per i contenuti archiviati indipendentemente dal traffico. Per una cache da 10.000 token in esecuzione 24 ore su 24, 7 giorni su 7:
Per casi d'uso in contesti di grandi dimensioni (assistente codebase, analisi di documenti), il costo di archiviazione di Gemini può erodere il vantaggio dello sconto sulla cache. Calcola entrambi i termini prima di presumere che Gemelli vinca.
| Caso d'uso | La scelta migliore | Motivo |
|---|---|---|
| App a volume elevato, prompt di sistema fisso di grandi dimensioni (>2.000 token, >200 richieste/giorno) | Claude Sonetto 4 | Sconto cache del 90% + nessuna tariffa di archiviazione = totale più basso su larga scala |
| Traffico variabile, richieste a raffica | GPT-4o | Nessun costo di scrittura, nessun costo di archiviazione, automatico: molto indulgente |
| Very large context (>32k tokens) at high volume | Gemelli 2.5 Pro | 75% cache read discount; storage cost small relative to input savings |
| Basso volume (<50 richieste/giorno), breve richiesta | Gemelli 2.0 Flash | Risparmio minimo nella memorizzazione nella cache; Il prezzo grezzo di Flash vince |
| Sviluppo/test, utilizzo imprevedibile | GPT-4omini | Più economico a basso volume; memorizzazione nella cache automatica senza sovraccarico |
Per confrontare i fornitori con memorizzazione nella cache per il tuo caso d'uso:
Oppure usa semplicemente il nostro calcolatore dei costi — imposta il conteggio dei token e i risultati rifletteranno le tariffe standard (la memorizzazione nella cache si applica automaticamente sull'infrastruttura del provider).