Veröffentlicht am 15. Juli 2026 · Referenzpreise, vor der Budgetierung überprüfen
Bei jedem LLM-Kostenvergleich, den Sie gesehen haben, wird Caching wahrscheinlich ignoriert. Das ist ein Fehler, denn schnelles Caching verändert die Kostenrangfolge. Claude erhebt eine Schreibgebühr; OpenAI nicht. Die Kontext-Caching-Kosten von Gemini pro gespeicherter Stunde. Hier ist die wahre Mathematik.
| Anbieter | Cache-Typ | Cache-Schreibkosten | Cache-Lesekosten | Cache-TTL | Min. Token |
|---|---|---|---|---|---|
| Anthropisch (Claude) | Prompt-Präfix-Cache | 1,25× Standardeingang | 0,10× Standardeingabe | 5 Min. (verlängerbar) | 1,024 |
| OpenAI (GPT-4o) | Automatischer Cache | Keine Schreibgebühr | 0,50× Standardeingabe | ~5 Min | 1,024 |
| Google (Zwillinge) | Kontext-Cache | Keine Schreibgebühr | 0,25× Standardeingabe | Abrechnung pro gespeicherter Stunde | 32,768 |
Wesentliche strukturelle Unterschiede:
| Modell | Geben Sie 1 Mio. $ ein | Ausgabe $/1 Mio |
|---|---|---|
| Claude Sonett 4 | $3.00 | $15.00 |
| GPT-4o | $2.50 | $10.00 |
| Gemini 2.5 Pro | $1.25 | $10.00 |
Ohne Caching: Gemini 2.5 Pro ist bei der Eingabe am günstigsten (1,25 $ vs. 2,50 $ vs. 3,00 $). Sobald jedoch Caching angewendet wird, ändert sich das Bild.
Eine typische Produktions-App: Sie haben eine Systemaufforderung mit 10.000 Token (Anweisungen + Kontext + Beispiele) und senden 500 Anfragen pro Tag. Jede Anfrage fügt 300 Tokens der Benutzereingabe hinzu und erhält 400 Tokens zurück.
| Modell | Eingabe/Anforderung (10.300 Token) | Output/req (400 tok) | Monatlich (15.000 erforderlich) |
|---|---|---|---|
| GPT-4o | $0.02575 | $0.004 | $446 |
| Claude Sonett 4 | $0.0309 | $0.006 | $550 |
| Gemini 2.5 Pro | $0.012875 | $0.004 | $255 |
Die 10.000-Token-Systemaufforderung wird zwischengespeichert. Jede nachfolgende Anfrage liest 10.000 zwischengespeicherte Token + 300 neue Eingabetoken.
| Modell | Cache-Lesung /1M | Neue Eingabe /1M | Monatlich | vs. kein Cache |
|---|---|---|---|---|
| GPT-4o (Auto-Cache) | $1.25 | $2.50 | $204 | −$242 (−54%) |
| Claude Sonnet 4 + cache | $0.30 | $3.00 | $117 | −433 $ (−79 %) |
| Gemini 2.5 Pro + Kontextcache | $0.3125 | $1.25 | 58 $* | −197 $ (−77 %) |
*Der Gemini-Kontext-Cache berechnet außerdem 4,50 $/Stunde für 10.000 gespeicherte Token. Bei 1 Cache-Instanz, die rund um die Uhr läuft: +3,24 $/Monat Speicherkosten. Unten separat hinzugefügt.
Bei der ersten Anfrage berechnet Anthropic 1,25x für das Schreiben des Caches. Für eine 10.000-Token-Systemaufforderung zu 3,00 $/1 Mio.: Die erste Anfrage kostet 0,0375 $ gegenüber 0,030 $ Standard. Die zusätzlichen 0,0075 $ werden nach nur 1,14 Cache-Treffern wiederhergestellt. Wenn Sie 500 Anfragen pro Tag bearbeiten, ist dieser Schreibaufschlag unbedeutend. Bei stoßweisem Gebrauch mit geringem Volumen summiert es sich.
Der Kontext-Cache von Gemini bietet 75 % Rabatt auf Lesevorgänge – der größte Rabatt. Für gespeicherte Inhalte werden jedoch unabhängig vom Datenverkehr stündlich Gebühren berechnet. Für einen 10.000-Token-Cache, der rund um die Uhr läuft:
Bei Anwendungsfällen mit großem Kontext (Codebasis-Assistent, Dokumentenanalyse) können die Speicherkosten von Gemini den Vorteil des Cache-Rabatts zunichtemachen. Berechnen Sie beide Terme, bevor Sie davon ausgehen, dass Zwillinge gewinnen.
| Anwendungsfall | Beste Wahl | Grund |
|---|---|---|
| App mit großem Volumen, große feste Systemaufforderung (>2.000 Token, >200 Anforderungen/Tag) | Claude Sonett 4 | 90 % Cache-Rabatt + keine Speichergebühr = niedrigster Gesamtbetrag im Maßstab |
| Variabler Datenverkehr, stoßartige Anfragen | GPT-4o | Keine Schreibgebühr, keine Speichergebühr, automatisch – äußerst fehlerverzeihend |
| Sehr großer Kontext (>32.000 Token) bei hohem Volumen | Gemini 2.5 Pro | 75 % Cache-Leserabatt; Die Lagerkosten sind im Verhältnis zu den Input-Einsparungen gering |
| Geringes Volumen (<50 Anforderungen/Tag), kleine Eingabeaufforderung | Gemini 2.0 Flash | Caching-Einsparungen minimal; Der Rohpreis von Flash gewinnt |
| Entwicklung/Tests, unvorhersehbare Nutzung | GPT-4o mini | Am günstigsten bei geringem Volumen; Automatisches Caching ohne Overhead |
So vergleichen Sie Anbieter mit Caching für Ihren Anwendungsfall:
Oder nutzen Sie einfach unsere Kostenrechner — Legen Sie Ihre Token-Anzahl fest und die Ergebnisse spiegeln Standardtarife wider (Caching wird automatisch auf die Infrastruktur des Anbieters angewendet).