HomeBlog › Memorizzazione rapida nella cache

In che modo la memorizzazione nella cache tempestiva riduce la bolletta LLM fino al 90%

Pubblicato il 21-06-2026 · numeri di riferimento, verificare prima di definire il budget

Se la tua app invia lo stesso lungo messaggio di sistema, gli stessi documenti recuperati o la stessa cronologia chat in crescita a ogni chiamata, stai pagando il prezzo intero per rileggere il testo che il modello ha già visto pochi secondi fa. Memorizzazione nella cache immediata è la soluzione ed è lo sconto più grande per voce che la maggior parte dei team non attiva mai. Fatto bene riduce i costi di input Dal 50% al 90%. Ecco come funziona, i numeri del 2026 e dove silenziosamente non aiuta.

Cosa fa effettivamente la memorizzazione nella cache

Una fattura LLM è per lo più token di input × prezzo + token di output × prezzo. La memorizzazione nella cache attacca la metà dell'input. Quando contrassegni una parte del prompt come memorizzabile nella cache, il provider memorizza il modulo elaborato per una breve finestra; alla prossima chiamata che riutilizza esattamente lo stesso prefisso, ti verrà addebitato un frazione del normale tasso di input per quei token invece dell'intero importo. Il prezzo di output rimane invariato: la memorizzazione nella cache sconta solo la parte che continui a inviare nuovamente.

Gli sconti 2026 (riferimento)

FornitorePrezzo di input memorizzato nella cacheNote
OpenAI~50% dell'inputAutomatico su richieste lunghe, nessuna modifica del codice
Antropico (Claude)~10% dell'input in letturaFino al 90% di sconto, ma circa il 25% scrive premium la prima volta
Google Gemelli~25% dell'inputCaching del contesto; potrebbe aggiungere una piccola tariffa di deposito
⚠️ Dati di riferimento, giugno 2026: sconti esatti, durata della cache ed eventuali tariffe di archiviazione cambiano. Conferma sulla pagina dei prezzi di ciascun fornitore. Anthropic e Gemini utilizzano marcatori di cache espliciti; OpenAI lo applica automaticamente ai prefissi qualificanti. · Segnala prezzo obsoleto →

Un esempio pratico

Supponiamo che un assistente di supporto invii un file Prompt di sistema da 2.000 token + knowledge base su ogni messaggio, più circa 200 token della domanda effettiva dell'utente e restituisce circa 300 token di output. A 10.000 conversazioni al mese, il blocco fisso di 2.000 token viene inviato nuovamente 10.000 volte. Utilizzando un modello con input di $ 2,50 / 1 milione:

Scalalo a 100.000 o 1 milione di conversazioni e il prefisso statico fa la differenza tra una fattura comoda e una allarmante. Più grande e ripetuto è il contesto fisso, maggiore è il valore della memorizzazione nella cache: le app RAG e gli agenti con prompt di sistema lunghi ne traggono i maggiori vantaggi.

Quando la memorizzazione nella cache NON aiuta (i trucchi)

La regola pratica

Memorizza nella cache quando invii di nuovo un blocco di contesto ampio e identico frequentemente e rapidamente: prompt di sistema, definizioni di strumenti, documenti RAG, esempi di poche riprese, lunga cronologia della chat. Non preoccuparti di chiamate una tantum, richieste altamente variabili o carichi di lavoro pesanti. Strutturare il prompt statico-prima, variabile-ultimae lo sconto è vicino al denaro gratuito. Metti un numero sulla tua custodia con il calcolatore rapido del risparmio di memorizzazione nella cachee confronta i modelli su Calcolatore dei costi dell'API AI.

Domande frequenti

Quanto può risparmiare la memorizzazione nella cache dei prompt?

In genere viene applicato uno sconto del 50–90% sul prezzo di input per la parte memorizzata nella cache, a seconda del fornitore. Sconta solo i token di input ripetuti, non l'output.

La memorizzazione nella cache dei prompt modifica le risposte del modello?

No. Si tratta di un'ottimizzazione della fatturazione/latenza: il modello vede gli stessi token, paghi solo meno per inviare nuovamente il prefisso memorizzato nella cache. Le risposte restano invariate.

Perché la memorizzazione nella cache ha fatto aumentare la mia fattura?

Quasi sempre il premio di scrittura (ad esempio il supplemento di circa il 25% di Anthropic per creare la cache) sui prefissi che non vengono riutilizzati abbastanza prima della scadenza, o un prefisso che cambia ogni chiamata in modo che non venga mai raggiunto. La memorizzazione nella cache ripaga con un riutilizzo frequente e identico.

Stime di riferimento: verifica sempre sconti e commissioni sulla pagina dei prezzi ufficiali del fornitore.