Nettoeinsparungen vs. kein Cache
Lagergebühr
Break-Even-Werte
maximale Lebensdauer im Leerlauf

Nettoeinsparungen, da Sie den Cache länger am Leben halten

Die Leseeinsparungen hängen davon ab, wie viele Lesevorgänge Sie bedienen. Lediglich die Lagergebühr wächst mit der Lebensdauer. In jeder Zeile bleiben die gleichen Lesevorgänge erhalten, die Lebensdauer ist jedoch länger. Beobachten Sie, wie das Netto von Grün auf Rot wechselt, sobald der Speicher die Einsparungen übersteigt. Ihr gewähltes Leben ist markiert; Die letzte gewinnbringende Reihe ist der Sweet Spot.

LebensdauerLagergebührLesen Sie EinsparungenNetto

Die Steuer, die die Caching-Rechner weglassen

Jeder Prompt-Caching-Leitfaden verkauft Ihnen die gleiche Überschrift: Zwischengespeicherte Lesevorgänge kosten ein Zehntel der normalen Eingabe, sodass Caching Ihre Rechnung um 90 % senkt. Das gilt für die Lesungen. Es ist nicht die ganze Rechnung. Explizites Kontext-Caching – die Art, bei der Sie absichtlich einen großen Kontext hochladen und ein Handle zur Wiederverwendung zurückerhalten – ist mit einer Speichergebühr verbunden, die auf der Uhr und nicht auf der Nutzung basiert. Gemini berechnet etwa 4,50 Dollar pro Million Token pro Stunde, um 2,5 Pro-Inhalte zwischenzuspeichern, sodass ein 100.000-Token-Kontext, der einen Tag lang am Leben bleibt, etwa 10,80 Dollar an Speicher kostet, bevor ihn jemand liest. Bei einem gut genutzten Cache ist das in Ordnung, da die Leseeinsparungen ihn in den Schatten stellen. Bei einem Cache, der größtenteils ungenutzt bleibt – ein Dokument, nach dem jemand fragen könnte, ein Kontext, der mit einer großzügigen Lebensdauer „nur für den Fall“ verbunden ist – wird die Speicherzeile stillschweigend zur größten Zahl auf der Rechnung, und der Cache verliert Geld, obwohl jeder Lesevorgang wie ein Schnäppchen aussieht. Die beiden Fragen, die tatsächlich darüber entscheiden, sind, wie viele Lesevorgänge Sie benötigen, bevor die Einsparungen den Speicher decken, und wie lange Sie den Cache am Leben lassen können, bevor der Zähler diese Einsparungen übersteigt. Dieser Rechner beantwortet beides. Wenn sich Ihr Kontext bei jedem Aufruf wiederholt und nicht in einem expliziten Cache gespeichert ist, bewerten Sie den impliziten Fall mit dem Rechner für schnelle Caching-Einsparungen; Um eine kurze oder eine lange Lebensdauer gegen Ihre Trefferquote abzuwägen, verwenden Sie die Cache-TTL- und Trefferratenrechner; und um zu sehen, ob sich die Schreibprämie jemals auszahlt, führen Sie das aus Cache-Schreib-Break-Even-Rechner.

Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS
Sofortige Caching-EinsparungenCache-TTL und TrefferrateCache-Write-BreakevenSofortige SystemkostenRAG-Kosten