✓ Zuletzt überprüft: 28.07.2026· Explizites Caching von Gemini/OpenAI· ein Problem melden →
Gebühren für explizites Kontext-Caching a Lagergebühr pro Stunde solange der zwischengespeicherte Inhalt aktiv ist – zusätzlich zu den günstigeren Lesevorgängen – eine Steuer, die die üblichen Caching-Rechner ignorieren. Dies kostet die Lagergebühr, netzt es gegen die Lesen Sie Einsparungen, und sagt dir das Mindestanzahl an Lesevorgängen und die maximale Leerlaufzeit bevor die Lagerung den ganzen Nutzen auffrisst.
—
Nettoeinsparungen vs. kein Cache
—Lagergebühr
—Break-Even-Werte
—maximale Lebensdauer im Leerlauf
Nettoeinsparungen, da Sie den Cache länger am Leben halten
Die Leseeinsparungen hängen davon ab, wie viele Lesevorgänge Sie bedienen. Lediglich die Lagergebühr wächst mit der Lebensdauer. In jeder Zeile bleiben die gleichen Lesevorgänge erhalten, die Lebensdauer ist jedoch länger. Beobachten Sie, wie das Netto von Grün auf Rot wechselt, sobald der Speicher die Einsparungen übersteigt. Ihr gewähltes Leben ist markiert; Die letzte gewinnbringende Reihe ist der Sweet Spot.
Lebensdauer
Lagergebühr
Lesen Sie Einsparungen
Netto
Die Steuer, die die Caching-Rechner weglassen
Jeder Prompt-Caching-Leitfaden verkauft Ihnen die gleiche Überschrift: Zwischengespeicherte Lesevorgänge kosten ein Zehntel der normalen Eingabe, sodass Caching Ihre Rechnung um 90 % senkt. Das gilt für die Lesungen. Es ist nicht die ganze Rechnung. Explizites Kontext-Caching – die Art, bei der Sie absichtlich einen großen Kontext hochladen und ein Handle zur Wiederverwendung zurückerhalten – ist mit einer Speichergebühr verbunden, die auf der Uhr und nicht auf der Nutzung basiert. Gemini berechnet etwa 4,50 Dollar pro Million Token pro Stunde, um 2,5 Pro-Inhalte zwischenzuspeichern, sodass ein 100.000-Token-Kontext, der einen Tag lang am Leben bleibt, etwa 10,80 Dollar an Speicher kostet, bevor ihn jemand liest. Bei einem gut genutzten Cache ist das in Ordnung, da die Leseeinsparungen ihn in den Schatten stellen. Bei einem Cache, der größtenteils ungenutzt bleibt – ein Dokument, nach dem jemand fragen könnte, ein Kontext, der mit einer großzügigen Lebensdauer „nur für den Fall“ verbunden ist – wird die Speicherzeile stillschweigend zur größten Zahl auf der Rechnung, und der Cache verliert Geld, obwohl jeder Lesevorgang wie ein Schnäppchen aussieht. Die beiden Fragen, die tatsächlich darüber entscheiden, sind, wie viele Lesevorgänge Sie benötigen, bevor die Einsparungen den Speicher decken, und wie lange Sie den Cache am Leben lassen können, bevor der Zähler diese Einsparungen übersteigt. Dieser Rechner beantwortet beides. Wenn sich Ihr Kontext bei jedem Aufruf wiederholt und nicht in einem expliziten Cache gespeichert ist, bewerten Sie den impliziten Fall mit dem Rechner für schnelle Caching-Einsparungen; Um eine kurze oder eine lange Lebensdauer gegen Ihre Trefferquote abzuwägen, verwenden Sie die Cache-TTL- und Trefferratenrechner; und um zu sehen, ob sich die Schreibprämie jemals auszahlt, führen Sie das aus Cache-Schreib-Break-Even-Rechner.
Es teilt die Kosten in drei Zeilen auf. Lagerung ist zwischengespeicherte Token (in Millionen) mal Lebensdauer in Stunden mal Speicherrate – es läuft auf der Uhr, unabhängig davon, ob Sie es lesen oder nicht. Der Pfad ohne Cache is what you would pay without caching: every read pays the full input price for the whole context. Der Cache-Pfad ist ein Schreibvorgang zum vollen Eingabepreis plus jeder Lesevorgang zum günstigeren Cache-Preis plus der Speichergebühr. Die Nettoeinsparungen sind der Nicht-Cache-Pfad abzüglich des Cache-Pfads. Der Break-Even-Werte ist die kleinste Anzahl von Lesevorgängen, bei der die Leseeinsparungen die Speichergebühr decken; Die maximale Leerlaufzeit ist die längste Zeit, die Sie den Cache bei Ihrer Leseanzahl am Leben halten können, bevor der Speicher die Einsparungen übersteigt. Es geht von einem Cache-Schreibvorgang über das Fenster aus und ignoriert Anforderungsausgabetokens, die auf beiden Pfaden gleich sind. Die tatsächlichen Preise für expliziten Cache und die Mindest-Token-Untergrenzen variieren je nach Anbieter. Informieren Sie sich daher auf der offiziellen Preisseite.
Häufig gestellte Fragen
Was kostet der Kontext-Cache-Speicher und warum gibt es ihn?
Durch explizites Caching können Sie einen großen, stabilen Kontext einmal hochladen und ihn zu einem günstigen Lesepreis wiederverwenden, anstatt ihn bei jedem Aufruf erneut zu senden. Sie zahlen aber auch eine Speichergebühr pro Stunde, solange der Cache aktiv ist, unabhängig davon, ob er genutzt wird oder nicht. Gemini berechnet auf 2.5 Pro etwa 4,50 US-Dollar pro Million Token pro Stunde, sodass ein aktiver Cache mit 100.000 Token pro Tag vor dem Lesen etwa 10,80 US-Dollar an Speicherplatz kostet. Diese Speicherzeile ist die Steuer, die normale Caching-Rechner weglassen.
Wie ist der Preis für den Kontext-Cache-Speicher?
Rate in Dollar pro Million Token pro Stunde, mal zwischengespeicherte Token (in Millionen), mal lebendige Stunden. Gemini 2.5 Pro kostet ca. 4,50 $/M/Stunde, Flash ca. 1,00 $. Ein 100.000-Token-Cache (0,1 Mio.) für 24 Stunden auf Pro beträgt 0,1 × 24 × 4,50 = 10,80 $. Es hängt von Zeit und Größe ab, nicht von der Nutzung – ein Leerlauf-Cache führt weiterhin den Zähler aus, das Gegenteil von Lesevorgängen, die nur bei Nutzung Kosten verursachen.
Wie viele Lesevorgänge lohnt sich, bevor sich das Zwischenspeichern eines großen Kontexts auszahlt?
Ausreichend, dass die Einsparungen pro Lesevorgang (vollständiger Eingabepreis minus zwischengespeicherter Preis) die feste Speichergebühr übersteigen. Für einen Gemini Pro-Kontext mit 100.000 Token pro Tag sind das ungefähr 117 Lesevorgänge, bevor die Einsparungen den Speicherplatz von 10,80 US-Dollar decken – darunter kostet das Caching mehr als die Zahlung des vollen Preises pro Aufruf. Der Rechner berechnet dieses Minimum für Ihre eigene Größe, Preise und Lebensdauer.
Ab wann verliert ein inaktiver Kontextcache Geld?
Sobald die Speichergebühr die bereits eingezahlten Leseeinsparungen übersteigt. Der Speicherplatz nimmt stündlich zu, sodass es für eine bestimmte Leseanzahl eine maximale Lebensdauer gibt, nach deren Ablauf der Cache vom Speichern zum Brennen wechselt. Bei 200 Lesevorgängen in einem 100-KByte-Gemini-Pro-Cache absorbieren die Einsparungen etwa 41 Stunden Speicherplatz; Halten Sie es länger am Leben und Sie zahlen für die Speicherung von Inhalten, deren Nutzen Sie bereits gesammelt haben. Passen Sie die Lebensdauer des Caches an den tatsächlichen Datenverkehr an, nicht an Vorsicht.