Tasso di successo = quota di richieste che trovano il prompt già memorizzato nella cache. Le app di lunga durata e ad alto volume si attestano all'85-98%.
costo di input/mese (nessuna memorizzazione nella cache)
con memorizzazione nella cache
salvi / mo
riduzione dei costi

Ogni modello, classificato in base al costo con memorizzazione nella cache

Stesso carico di lavoro, tutti i modelli fianco a fianco. "Lettura nella cache" è il prezzo di un token riutilizzato; "write" è il costo una tantum per archiviarlo.

ModelloIngressoLettura memorizzata nella cacheNessuna cache/meseCon cache /moSalvato
⚠️ Stima utilizzando tariffe di riferimento per milione di token (giugno 2026). I prezzi reali cambiano spesso e variano in base al modello, al livello e alla regione. Anthropic addebita un premio di scrittura di circa il 25% sulla creazione della cache, ma letture più economiche di circa il 90%; La memorizzazione nella cache di OpenAI è automatica senza alcun sovrapprezzo di scrittura; Gemini aggiunge una piccola tariffa di archiviazione oraria non modellata qui. Conferma sempre sulla pagina dei prezzi ufficiali di ciascun fornitore. · Segnala prezzo obsoleto →

Cos'è la memorizzazione nella cache immediata

La maggior parte delle app LLM inviano il file lo stesso grosso pezzo di testo ad ogni chiamata — un lungo prompt di sistema, definizioni di strumenti, una guida di stile o documenti recuperati in una pipeline RAG. Normalmente paghi l'intero prezzo di input per quei token ogni volta. Memorizzazione nella cache immediata consente al fornitore di memorizzare il prefisso fisso dopo la prima chiamata e di addebitare una tariffa fortemente scontata per riutilizzarlo. Su Claude un token memorizzato nella cache si legge all'incirca 10% del normale prezzo di input; sull'input memorizzato nella cache GPT e Gemini riguarda 25–50% più economico. L'unico requisito è che la parte memorizzata nella cache rimanga identico e nella parte anteriore del prompt: inserisci per ultima la parte variabile (la domanda dell'utente).

Come funziona la matematica

Il calcolatore divide ogni richiesta in due parti. IL token prompt riutilizzati può essere memorizzato nella cache: su una cache colpo fatturano alla tariffa di lettura economica, su a mancare fatturano alla velocità di scrittura (leggermente più costosa) per aggiornare la cache. IL gettoni freschi - l'input effettivo dell'utente che è diverso ogni volta - paga sempre l'intero prezzo dell'input e non può essere memorizzato nella cache. Tuo tasso di riscontro nella cache decide il mix: le cache scadono dopo alcuni minuti di inattività (il TTL predefinito di Anthropic è ~5 minuti), quindi le app costanti ad alto traffico mantengono la cache calda e raggiungono il 90% +, mentre le app a raffica o a basso volume si aggiornano più spesso e colpiscono meno. Prova a ridurre il tasso di successo al 50% e osserva i risparmi ridursi: memorizzando nella cache principalmente i premi volume e un prefisso stabile.

Quando vale la pena memorizzare nella cache (e quando non lo è)

La memorizzazione nella cache è più remunerativa quando a il contesto ampio e immutabile si ripete in molte chiamate: chatbot RAG che inviano nuovamente gli stessi documenti, agenti che riproducono lunghe definizioni e cronologie degli strumenti o qualsiasi prodotto con un prompt di sistema pesante. In questi casi taglia regolarmente ingresso costo del 50-90%. Lo fa Niente per richieste una tantum che non si ripetono mai e poco se il prefisso riutilizzato è minuscolo. Inoltre non si tocca produzione costo del token: la memorizzazione nella cache sconta solo l'input. Per modellare l'immagine completa incluso l'output, utilizzare il file Stima dei costi delle app AI o il modello per modello Claudio / GPT-4o / Gemelli calcolatrici.

Domande frequenti

Quanto risparmia effettivamente la memorizzazione nella cache dei prompt?

Se l'80-90% dell'input è un prompt fisso o un contesto che si ripete, la memorizzazione nella cache riduce in genere il costo totale dell'input del 50-90%. I risparmi aumentano con il volume e con la stabilità del prefisso riutilizzato e sono prossimi allo zero per i prompt che non si ripetono mai.

Scrivere la cache ha un costo aggiuntivo?

Su Claude, scrivere la cache costa circa il 25% in più rispetto a un normale token di input una volta, ma ogni lettura successiva costa circa il 90% in meno: si ripaga dopo circa due colpi. La memorizzazione nella cache di OpenAI è automatica senza alcun sovrapprezzo di scrittura. Gemini aggiunge una piccola tariffa di archiviazione oraria per il contenuto memorizzato nella cache.

Cos'è la percentuale di riscontri nella cache?

La quota di richieste che trovano il tuo prompt già archiviato. Le cache scadono dopo alcuni minuti di inattività, quindi le app ad alto traffico le mantengono calde (oltre il 90%) mentre le app a raffica o a basso volume si aggiornano più spesso e colpiscono meno.

La memorizzazione nella cache riduce il costo dei token di output?

No. La memorizzazione nella cache immediata sconta solo il ingresso lato (sollecito). I token di output/completamento vengono sempre fatturati alla tariffa normale, quindi un'app loquace e a risposta lunga risparmia complessivamente meno di un'app con contesto pesante e a risposta breve.

Strumenti e guide correlati

Stima dei costi delle app AI · Calcolatore dei costi RAG · Calcolatore dei costi Claude · Calcolatore dei costi GPT-4o · Prezzi OpenAI vs Claude vs Gemini · i costi API che raddoppiano la bolletta

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
Risparmio sui costi dell'intelligenza artificialeOttimizzazione dei costi LLMPista di livello gratuitoCalcolatore del risparmio di deflessione del supporto AILivelli API gratuiti