Una cache aiuta solo se la richiesta successiva batte il tempo. Se il divario di inattività medio tra le richieste è G minuti e il TTL della cache è T minuti, il tasso di successo in stato stazionario è 1 - e−T/g. Una cache da 5 minuti e una cache da 1 ora sullo stesso identico codice possono avere tassi di successo molto diversi semplicemente a causa della tempistica - e un fallimento paga il premio di scrittura invece della lettura economica.

livello più economico
costo/richiesta
costo/mese
salvato vs nessuna cache

Nessuna cache rispetto a TTL di 5 minuti rispetto a 1 ora

Stesso traffico, tre strategie. Il tasso di successo viene calcolato dal tuo gap inattivo; un errore paga il premio di scrittura (1,25× per 5 minuti, 2,0× per 1 ora), un successo paga il tasso di lettura.

StrategiaPercentuale di riscontri nella cacheCosto/richiestaCosto/mesevs nessuna cache
⚠️ Modello di riferimento, luglio 2026. Utilizza moltiplicatori di caching dei prompt standard: cache scrivere = 1,25× base per un TTL di 5 minuti e 2,0× base per un TTL di 1 ora; cache Leggere = 0,10× base (regolabile sopra). Il tasso di successo presuppone richieste con un intervallo di inattività distribuito in modo esponenziale (arrivi senza memoria): il traffico a raffica o perfettamente periodico sarà diverso e la primissima richiesta dopo un avvio a freddo è sempre una scrittura. Conferma i moltiplicatori in tempo reale sui documenti di memorizzazione nella cache del tuo provider. · Segnala prezzo obsoleto →

Perché il tasso di successo è un problema di tempistica, non un'ipotesi

Pronta memorizzazione nella cache delle fatture in tre stati: a scrittura nella cache (first time a prefix is seen, or after it expired) at a premium over the base token price, a lettura della cache (il prefisso è ancora vivo) con un forte sconto e token semplici non memorizzati nella cache a prezzo pieno. Lo stato in cui ti trovi per ogni determinata richiesta è deciso da una cosa: la richiesta precedente è avvenuta abbastanza di recente da far sì che il prefisso memorizzato nella cache sia ancora attivo? Modella il divario inattivo tra le richieste come senza memoria (l'ipotesi standard per arrivi indipendenti) e la probabilità che il divario sia inferiore al TTL T è esattamente 1 - e−T/g, Dove G è il tuo divario medio. Questo è il tuo tasso di successo. È per questo motivo che un bot di supporto che gestisce un messaggio ogni pochi minuti ottiene un ottimo tasso di successo su una cache di 1 ora ma uno scarso su una cache di 5 minuti, eseguendo lo stesso codice.

Il compromesso tra 5 minuti e 1 ora

La cache di 1 ora non è strettamente migliore: costa di più scrivere (circa 2,0× base contro 1,25× per il livello da 5 minuti). La domanda è se la durata più lunga consente di risparmiare abbastanza errori costosi da pagare le scritture più costose. Quando il tuo intervallo di inattività è piccolo rispetto a cinque minuti (raffici stretti), la scrittura economica di 5 minuti ti dà già un tasso di successo vicino al 100% e il premio di 1 ora è puro spreco. Quando il tuo intervallo dura pochi minuti, la cache da 5 minuti scade costantemente e ripaga la scrittura su quasi ogni richiesta, mentre la cache da 1 ora rimane calda, quindi nonostante il moltiplicatore di scrittura più alto, il livello da 1 ora risulta più economico. Il crossover dipende interamente dal tuo G, motivo per cui indovinare un tasso di successo forfettario ti inganna. Questo strumento trova il crossover per i tuoi numeri.

Cosa è cambiato nel 2026 e come rispondere

Quando un provider accorcia la durata della cache predefinita (il passaggio ampiamente sentito da circa un'ora a cinque minuti) qualsiasi carico di lavoro con richieste distanziate scivola silenziosamente da per lo più letture a per lo più scritture, e le fatture aumentano del 30-60% senza alcuna modifica del codice. Due risposte funzionano: mantenere la cache calda con una richiesta di heartbeat leggera all'interno della finestra più breve o optare esplicitamente per un livello TTL più lungo quando il premio di scrittura si ripaga da solo. Decidi quale eseguendo il tuo gap di inattività reale e richiedi il volume sopra, quindi confronta con calcolatore rapido del risparmio di memorizzazione nella cache per la visualizzazione flat-hit-rate e il calcolatore del pareggio di scrittura della cache per il caso di riutilizzo one-shot.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
Risparmio immediato nella cachePareggio di scrittura della cacheCosto della finestra di contestoCosto del token LLM

Strumenti e hosting

📈TradingView🔒NordVPN💳 RivoluzioneHostingerIA intricata

Come funziona questa calcolatrice

Calcola il tasso di riscontri della cache allo stato stazionario come 1 − e^(−T/g) dal gap di inattività medio g e dal TTL T di ciascun livello (5 minuti o 60 minuti), quindi valuta ogni richiesta come una combinazione di letture (riscontri) e scritture (mancati) della cache sul prefisso memorizzato nella cache, oltre a token non memorizzati nella cache a prezzo pieno. Confronta senza cache, il livello da 5 minuti e il livello da 1 ora e segnala il livello più economico per traffico e volume.

Domande frequenti

Come faccio a sapere la mia reale percentuale di riscontri nella cache dei prompt?

Lo deriva dalla frequenza con cui arrivano le richieste rispetto alla durata della cache. Con un intervallo di inattività medio di g minuti e un TTL della cache di T minuti, il tasso di successo in stato stazionario è 1 − e^(−T/g). Lo stesso codice può avere una percentuale di successo del 10% su una cache di 5 minuti e una percentuale di successo del 95% su una cache di 1 ora semplicemente a causa della tempistica.

La cache dei prompt di 1 ora vale il costo di scrittura più elevato?

Dipende dal tuo intervallo di inattività. La cache da 1 ora scrive a ~2× base contro ~1,25× per 5 minuti, ma un TTL più lungo evita costosi errori. Le richieste a distanza di minuti solitamente privilegiano il livello di 1 ora; raffiche strette a pochi secondi di distanza vanno bene per la scrittura più economica di 5 minuti.

Perché la mia fattura per la memorizzazione nella cache è aumentata nel 2026?

Perché la durata della cache predefinita si è ridotta. Spostando il TTL standard da ~1 ora a ~5 minuti, qualsiasi traffico con intervalli di inattività superiori a pochi minuti perde la cache e ripaga il premio di scrittura, aumentando silenziosamente le bollette del 30-60% per carichi di lavoro distanziati.

Impara e confronta
Richiesta memorizzazione nella cache →Confronta 387 modelli →Prezzo per modello →