Costi espliciti per la memorizzazione nella cache del contesto a tariffa di deposito oraria finché il contenuto memorizzato nella cache è vivo, oltre alle letture più economiche, una tassa che i soliti calcolatori di memorizzazione nella cache ignorano. Questo costa il tassa di deposito, lo mette in rete contro il leggi risparmio, e ti dice il letture minime e il durata massima al minimo prima che lo stoccaggio consumi l'intero vantaggio.
—
risparmio netto rispetto a nessuna cache
—tassa di deposito
—letture in pareggio
—durata massima al minimo
Risparmio netto mantenendo la cache attiva più a lungo
Il risparmio in lettura è fissato in base al numero di letture servite; solo la tariffa di stoccaggio aumenta con la durata. Ogni riga mantiene le stesse letture ma un time-to-live più lungo: osserva la rete passare dal verde al rosso una volta che lo spazio di archiviazione supera il risparmio. La vita che hai scelto è segnata; l'ultima riga redditizia è il punto debole.
Tutta la vita
Tassa di deposito
Leggi il risparmio
Netto
La tassa che i calcolatori della cache tralasciano
Ogni guida alla memorizzazione nella cache ti vende lo stesso titolo: le letture nella cache costano un decimo dell'input normale, quindi la memorizzazione nella cache riduce la bolletta del 90%. Questo è vero per le letture. Non è l'intero conto. La memorizzazione nella cache esplicita del contesto, il tipo in cui carichi deliberatamente un contesto di grandi dimensioni e ottieni un handle da riutilizzare, prevede una tariffa di archiviazione che viene eseguita in base a un orologio, non in base all'utilizzo. Gemini addebita circa 4,50 dollari per milione di token all'ora per mantenere nella cache i contenuti di 2.5 Pro, quindi un contesto di 100.000 token lasciato in vita per un giorno costa circa 10,80 dollari di spazio di archiviazione prima che qualcuno lo legga. Su una cache ben utilizzata va bene, perché il risparmio in lettura lo fa impallidire. Su una cache che rimane per lo più inattiva - un documento su cui qualcuno potrebbe chiedere, un contesto collegato a un generoso time-to-live "per ogni evenienza" - la linea di archiviazione diventa silenziosamente il numero più grande sulla fattura, e la cache perde denaro anche se ogni lettura sembra un affare. Le due domande che in realtà lo decidono sono quante letture sono necessarie prima che i risparmi coprano lo spazio di archiviazione e per quanto tempo puoi lasciare in vita la cache prima che il contatore superi tali risparmi. Questa calcolatrice risponde ad entrambi. Se il tuo contesto si ripete ad ogni chiamata anziché vivere in una cache esplicita, valuta il caso implicito con il calcolatore rapido del risparmio di memorizzazione nella cache; per valutare una vita breve rispetto a una vita lunga rispetto al tasso di successo, utilizzare il cache TTL e calcolatore del tasso di successo; e per vedere se il premio di scrittura viene mai ripagato, esegui il file calcolatore del pareggio di scrittura della cache.
Suddivide il costo in tre righe. Magazzinaggio viene memorizzato nella cache di token (in milioni) per la durata in ore moltiplicata per la velocità di archiviazione: funziona in base all'orologio, indipendentemente dal fatto che tu legga o meno. IL percorso senza cache è ciò che pagheresti senza memorizzazione nella cache: ogni lettura paga l'intero prezzo di input per l'intero contesto. IL percorso della cache è una scrittura al prezzo di input completo, più ciascuna lettura al prezzo memorizzato nella cache più economico, più la tariffa di archiviazione. Il risparmio netto corrisponde al percorso senza cache meno il percorso della cache. IL letture in pareggio è il numero minimo di letture in corrispondenza del quale il risparmio di lettura copre la tariffa di archiviazione; IL durata massima al minimo è il periodo più lungo in cui puoi mantenere attiva la cache al numero di letture prima che lo spazio di archiviazione superi i risparmi. Presuppone una scrittura nella cache sulla finestra e ignora i token di output della richiesta, che sono gli stessi su entrambi i percorsi; I prezzi reali della cache esplicita e i livelli minimi di token variano in base al fornitore, quindi confermalo nella pagina dei prezzi ufficiali.
Domande frequenti
Qual è il costo di archiviazione della cache di contesto e perché esiste?
La memorizzazione nella cache esplicita ti consente di caricare un contesto grande e stabile una volta e di riutilizzarlo a un prezzo di lettura conveniente invece di inviarlo nuovamente a ogni chiamata. Ma paghi anche una tariffa di archiviazione oraria per tutta la durata della cache, utilizzata o meno. Gemini fattura circa $ 4,50 per milione di token all'ora su 2.5 Pro, quindi una cache da 100.000 token attiva al giorno costa ~ $ 10,80 in spazio di archiviazione prima di qualsiasi lettura. Quella linea di archiviazione è l'imposta che i normali calcolatori di memorizzazione nella cache tralasciano.
Qual è il prezzo dell'archiviazione della cache di contesto?
Tariffa in dollari per milione di token all'ora, per numero di token memorizzati nella cache (in milioni), per numero di ore di vita. Gemini 2.5 Pro costa ~$4,50/M/ora, Flash ~$1,00. Una cache di token da 100.000 (0,1 M) per 24 ore su Pro è 0,1 × 24 × 4,50 = $ 10,80. È guidato dal tempo e dalle dimensioni, non dall'utilizzo: una cache inattiva esegue ancora il contatore, al contrario delle letture, che costano solo se utilizzate.
Quante letture prima che la memorizzazione nella cache di un grande contesto ripaghi?
È sufficiente che il risparmio per lettura (prezzo di input completo meno il prezzo memorizzato nella cache) superi la tariffa di archiviazione fissa. Per un contesto Gemini Pro da 100.000 token in vita al giorno, si tratta di circa 117 letture prima che il risparmio copra lo spazio di archiviazione di $ 10,80; al di sotto di tale cifra, la memorizzazione nella cache costa di più rispetto al pagamento del prezzo intero per ogni chiamata. Il calcolatore risolve questo minimo per la tua taglia, i tuoi prezzi e la tua durata.
Quando una cache di contesto inattiva inizia a perdere denaro?
Una volta che la tariffa di archiviazione supera i risparmi di lettura già accumulati. Lo spazio di archiviazione si accumula ogni ora, quindi per un determinato conteggio di letture esiste una durata massima oltre la quale la cache passa dal salvataggio alla masterizzazione. Con 200 letture su una cache Gemini Pro da 100.000, il risparmio assorbe circa 41 ore di spazio di archiviazione; mantienilo in vita più a lungo e paghi per archiviare i contenuti di cui hai già raccolto i benefici. Abbina il time-to-live della cache al traffico reale, non alla cautela.