Una cache aiuta solo se la richiesta successiva batte il tempo. Se il divario di inattività medio tra le richieste è G minuti e il TTL della cache è T minuti, il tasso di successo in stato stazionario è 1 - e−T/g. Una cache da 5 minuti e una cache da 1 ora sullo stesso identico codice possono avere tassi di successo molto diversi semplicemente a causa della tempistica - e un fallimento paga il premio di scrittura invece della lettura economica.
Nessuna cache rispetto a TTL di 5 minuti rispetto a 1 ora
Stesso traffico, tre strategie. Il tasso di successo viene calcolato dal tuo gap inattivo; un errore paga il premio di scrittura (1,25× per 5 minuti, 2,0× per 1 ora), un successo paga il tasso di lettura.
| Strategia | Percentuale di riscontri nella cache | Costo/richiesta | Costo/mese | vs nessuna cache |
|---|
Perché il tasso di successo è un problema di tempistica, non un'ipotesi
Pronta memorizzazione nella cache delle fatture in tre stati: a scrittura nella cache (first time a prefix is seen, or after it expired) at a premium over the base token price, a lettura della cache (il prefisso è ancora vivo) con un forte sconto e token semplici non memorizzati nella cache a prezzo pieno. Lo stato in cui ti trovi per ogni determinata richiesta è deciso da una cosa: la richiesta precedente è avvenuta abbastanza di recente da far sì che il prefisso memorizzato nella cache sia ancora attivo? Modella il divario inattivo tra le richieste come senza memoria (l'ipotesi standard per arrivi indipendenti) e la probabilità che il divario sia inferiore al TTL T è esattamente 1 - e−T/g, Dove G è il tuo divario medio. Questo è il tuo tasso di successo. È per questo motivo che un bot di supporto che gestisce un messaggio ogni pochi minuti ottiene un ottimo tasso di successo su una cache di 1 ora ma uno scarso su una cache di 5 minuti, eseguendo lo stesso codice.
Il compromesso tra 5 minuti e 1 ora
La cache di 1 ora non è strettamente migliore: costa di più scrivere (circa 2,0× base contro 1,25× per il livello da 5 minuti). La domanda è se la durata più lunga consente di risparmiare abbastanza errori costosi da pagare le scritture più costose. Quando il tuo intervallo di inattività è piccolo rispetto a cinque minuti (raffici stretti), la scrittura economica di 5 minuti ti dà già un tasso di successo vicino al 100% e il premio di 1 ora è puro spreco. Quando il tuo intervallo dura pochi minuti, la cache da 5 minuti scade costantemente e ripaga la scrittura su quasi ogni richiesta, mentre la cache da 1 ora rimane calda, quindi nonostante il moltiplicatore di scrittura più alto, il livello da 1 ora risulta più economico. Il crossover dipende interamente dal tuo G, motivo per cui indovinare un tasso di successo forfettario ti inganna. Questo strumento trova il crossover per i tuoi numeri.
Cosa è cambiato nel 2026 e come rispondere
Quando un provider accorcia la durata della cache predefinita (il passaggio ampiamente sentito da circa un'ora a cinque minuti) qualsiasi carico di lavoro con richieste distanziate scivola silenziosamente da per lo più letture a per lo più scritture, e le fatture aumentano del 30-60% senza alcuna modifica del codice. Due risposte funzionano: mantenere la cache calda con una richiesta di heartbeat leggera all'interno della finestra più breve o optare esplicitamente per un livello TTL più lungo quando il premio di scrittura si ripaga da solo. Decidi quale eseguendo il tuo gap di inattività reale e richiedi il volume sopra, quindi confronta con calcolatore rapido del risparmio di memorizzazione nella cache per la visualizzazione flat-hit-rate e il calcolatore del pareggio di scrittura della cache per il caso di riutilizzo one-shot.
Strumenti e hosting
Come funziona questa calcolatrice
Calcola il tasso di riscontri della cache allo stato stazionario come 1 − e^(−T/g) dal gap di inattività medio g e dal TTL T di ciascun livello (5 minuti o 60 minuti), quindi valuta ogni richiesta come una combinazione di letture (riscontri) e scritture (mancati) della cache sul prefisso memorizzato nella cache, oltre a token non memorizzati nella cache a prezzo pieno. Confronta senza cache, il livello da 5 minuti e il livello da 1 ora e segnala il livello più economico per traffico e volume.
Domande frequenti
Come faccio a sapere la mia reale percentuale di riscontri nella cache dei prompt?
Lo deriva dalla frequenza con cui arrivano le richieste rispetto alla durata della cache. Con un intervallo di inattività medio di g minuti e un TTL della cache di T minuti, il tasso di successo in stato stazionario è 1 − e^(−T/g). Lo stesso codice può avere una percentuale di successo del 10% su una cache di 5 minuti e una percentuale di successo del 95% su una cache di 1 ora semplicemente a causa della tempistica.
La cache dei prompt di 1 ora vale il costo di scrittura più elevato?
Dipende dal tuo intervallo di inattività. La cache da 1 ora scrive a ~2× base contro ~1,25× per 5 minuti, ma un TTL più lungo evita costosi errori. Le richieste a distanza di minuti solitamente privilegiano il livello di 1 ora; raffiche strette a pochi secondi di distanza vanno bene per la scrittura più economica di 5 minuti.
Perché la mia fattura per la memorizzazione nella cache è aumentata nel 2026?
Perché la durata della cache predefinita si è ridotta. Spostando il TTL standard da ~1 ora a ~5 minuti, qualsiasi traffico con intervalli di inattività superiori a pochi minuti perde la cache e ripaga il premio di scrittura, aumentando silenziosamente le bollette del 30-60% per carichi di lavoro distanziati.