Pubblicato il 21-06-2026 · numeri di riferimento, verificare prima di definire il budget
Se la tua app invia lo stesso lungo messaggio di sistema, gli stessi documenti recuperati o la stessa cronologia chat in crescita a ogni chiamata, stai pagando il prezzo intero per rileggere il testo che il modello ha già visto pochi secondi fa. Memorizzazione nella cache immediata è la soluzione ed è lo sconto più grande per voce che la maggior parte dei team non attiva mai. Fatto bene riduce i costi di input Dal 50% al 90%. Ecco come funziona, i numeri del 2026 e dove silenziosamente non aiuta.
Una fattura LLM è per lo più token di input × prezzo + token di output × prezzo. La memorizzazione nella cache attacca la metà dell'input. Quando contrassegni una parte del prompt come memorizzabile nella cache, il provider memorizza il modulo elaborato per una breve finestra; alla prossima chiamata che riutilizza esattamente lo stesso prefisso, ti verrà addebitato un frazione del normale tasso di input per quei token invece dell'intero importo. Il prezzo di output rimane invariato: la memorizzazione nella cache sconta solo la parte che continui a inviare nuovamente.
| Fornitore | Prezzo di input memorizzato nella cache | Note |
|---|---|---|
| OpenAI | ~50% dell'input | Automatico su richieste lunghe, nessuna modifica del codice |
| Antropico (Claude) | ~10% dell'input in lettura | Fino al 90% di sconto, ma circa il 25% scrive premium la prima volta |
| Google Gemelli | ~25% dell'input | Caching del contesto; potrebbe aggiungere una piccola tariffa di deposito |
Supponiamo che un assistente di supporto invii un file Prompt di sistema da 2.000 token + knowledge base su ogni messaggio, più circa 200 token della domanda effettiva dell'utente e restituisce circa 300 token di output. A 10.000 conversazioni al mese, il blocco fisso di 2.000 token viene inviato nuovamente 10.000 volte. Utilizzando un modello con input di $ 2,50 / 1 milione:
Scalalo a 100.000 o 1 milione di conversazioni e il prefisso statico fa la differenza tra una fattura comoda e una allarmante. Più grande e ripetuto è il contesto fisso, maggiore è il valore della memorizzazione nella cache: le app RAG e gli agenti con prompt di sistema lunghi ne traggono i maggiori vantaggi.
Memorizza nella cache quando invii di nuovo un blocco di contesto ampio e identico frequentemente e rapidamente: prompt di sistema, definizioni di strumenti, documenti RAG, esempi di poche riprese, lunga cronologia della chat. Non preoccuparti di chiamate una tantum, richieste altamente variabili o carichi di lavoro pesanti. Strutturare il prompt statico-prima, variabile-ultimae lo sconto è vicino al denaro gratuito. Metti un numero sulla tua custodia con il calcolatore rapido del risparmio di memorizzazione nella cachee confronta i modelli su Calcolatore dei costi dell'API AI.
In genere viene applicato uno sconto del 50–90% sul prezzo di input per la parte memorizzata nella cache, a seconda del fornitore. Sconta solo i token di input ripetuti, non l'output.
No. Si tratta di un'ottimizzazione della fatturazione/latenza: il modello vede gli stessi token, paghi solo meno per inviare nuovamente il prefisso memorizzato nella cache. Le risposte restano invariate.
Quasi sempre il premio di scrittura (ad esempio il supplemento di circa il 25% di Anthropic per creare la cache) sui prefissi che non vengono riutilizzati abbastanza prima della scadenza, o un prefisso che cambia ogni chiamata in modo che non venga mai raggiunto. La memorizzazione nella cache ripaga con un riutilizzo frequente e identico.
Stime di riferimento: verifica sempre sconti e commissioni sulla pagina dei prezzi ufficiali del fornitore.