HomeBlog › OpenAI vs. Anthropic vs. Gemini nach dem Caching

OpenAI vs. Anthropic vs. Gemini nach sofortigem Caching: tatsächlicher Kostenunterschied (2026)

Veröffentlicht am 15. Juli 2026 · Referenzpreise, vor der Budgetierung überprüfen

Bei jedem LLM-Kostenvergleich, den Sie gesehen haben, wird Caching wahrscheinlich ignoriert. Das ist ein Fehler, denn schnelles Caching verändert die Kostenrangfolge. Claude erhebt eine Schreibgebühr; OpenAI nicht. Die Kontext-Caching-Kosten von Gemini pro gespeicherter Stunde. Hier ist die wahre Mathematik.

Caching-Mechanismen – wie jeder Anbieter funktioniert

AnbieterCache-TypCache-SchreibkostenCache-LesekostenCache-TTLMin. Token
Anthropisch (Claude)Prompt-Präfix-Cache1,25× Standardeingang0,10× Standardeingabe5 Min. (verlängerbar)1,024
OpenAI (GPT-4o)Automatischer CacheKeine Schreibgebühr0,50× Standardeingabe~5 Min1,024
Google (Zwillinge)Kontext-CacheKeine Schreibgebühr0,25× StandardeingabeAbrechnung pro gespeicherter Stunde32,768

Wesentliche strukturelle Unterschiede:

Die Grundpreise (ohne Caching)

ModellGeben Sie 1 Mio. $ einAusgabe $/1 Mio
Claude Sonett 4$3.00$15.00
GPT-4o$2.50$10.00
Gemini 2.5 Pro$1.25$10.00

Ohne Caching: Gemini 2.5 Pro ist bei der Eingabe am günstigsten (1,25 $ vs. 2,50 $ vs. 3,00 $). Sobald jedoch Caching angewendet wird, ändert sich das Bild.

Das Szenario: Systemaufforderung mit 10.000 Token, 500 Anfragen/Tag

Eine typische Produktions-App: Sie haben eine Systemaufforderung mit 10.000 Token (Anweisungen + Kontext + Beispiele) und senden 500 Anfragen pro Tag. Jede Anfrage fügt 300 Tokens der Benutzereingabe hinzu und erhält 400 Tokens zurück.

Cost without caching (monthly, 15,000 requests)

ModellEingabe/Anforderung (10.300 Token)Output/req (400 tok)Monatlich (15.000 erforderlich)
GPT-4o$0.02575$0.004$446
Claude Sonett 4$0.0309$0.006$550
Gemini 2.5 Pro$0.012875$0.004$255

Kosten MIT angewendetem Caching (gleiche 15.000 Anfragen/Monat)

Die 10.000-Token-Systemaufforderung wird zwischengespeichert. Jede nachfolgende Anfrage liest 10.000 zwischengespeicherte Token + 300 neue Eingabetoken.

ModellCache-Lesung /1MNeue Eingabe /1MMonatlichvs. kein Cache
GPT-4o (Auto-Cache)$1.25$2.50$204−$242 (−54%)
Claude Sonnet 4 + cache$0.30$3.00$117−433 $ (−79 %)
Gemini 2.5 Pro + Kontextcache$0.3125$1.2558 $*−197 $ (−77 %)

*Der Gemini-Kontext-Cache berechnet außerdem 4,50 $/Stunde für 10.000 gespeicherte Token. Bei 1 Cache-Instanz, die rund um die Uhr läuft: +3,24 $/Monat Speicherkosten. Unten separat hinzugefügt.

Moment – ​​Claude ist nach dem Caching am günstigsten? Ja. Bei diesem Maßstab (15.000 Anforderungen/Monat mit 10.000 Systemaufforderungen) kostet Claude Sonnet 4 mit Caching 117 $/Monat im Vergleich zu GPT-4o mit 204 $/Monat und Gemini mit ca. 61 $/Monat. Der Rabatt von 90 % für Cache-Lesevorgänge übertrifft den höheren Grundpreis von Claude, wenn Sie ein großes wiederholtes Präfix haben.

Die Cache-Schreibprämie (nur Anthropic)

Bei der ersten Anfrage berechnet Anthropic 1,25x für das Schreiben des Caches. Für eine 10.000-Token-Systemaufforderung zu 3,00 $/1 Mio.: Die erste Anfrage kostet 0,0375 $ gegenüber 0,030 $ Standard. Die zusätzlichen 0,0075 $ werden nach nur 1,14 Cache-Treffern wiederhergestellt. Wenn Sie 500 Anfragen pro Tag bearbeiten, ist dieser Schreibaufschlag unbedeutend. Bei stoßweisem Gebrauch mit geringem Volumen summiert es sich.

Geminis Lagerkostenfalle

Der Kontext-Cache von Gemini bietet 75 % Rabatt auf Lesevorgänge – der größte Rabatt. Für gespeicherte Inhalte werden jedoch unabhängig vom Datenverkehr stündlich Gebühren berechnet. Für einen 10.000-Token-Cache, der rund um die Uhr läuft:

Bei Anwendungsfällen mit großem Kontext (Codebasis-Assistent, Dokumentenanalyse) können die Speicherkosten von Gemini den Vorteil des Cache-Rabatts zunichtemachen. Berechnen Sie beide Terme, bevor Sie davon ausgehen, dass Zwillinge gewinnen.

Das neue Kostenranking nach dem Caching

Ohne Caching: Gemini 2.5 Pro > GPT-4o > Claude Sonnet (vom günstigsten zum teuersten)
Mit Caching (große Systemaufforderung, hohes Volumen): Zwillinge ≈ Claude > GPT-4o (Claude holt dramatisch auf)
Mit Caching (burstig, geringe Lautstärke): GPT-4o > Claude > Gemini (OpenAIs No-Write-Fee + No-Storage-Fee gewinnt)

Der „günstigste“ Anbieter hängt von Ihrem Verkehrsmuster und Ihrer Prompt-Struktur ab.

Wenn jeder Ansatz gewinnt

AnwendungsfallBeste WahlGrund
App mit großem Volumen, große feste Systemaufforderung (>2.000 Token, >200 Anforderungen/Tag)Claude Sonett 490 % Cache-Rabatt + keine Speichergebühr = niedrigster Gesamtbetrag im Maßstab
Variabler Datenverkehr, stoßartige AnfragenGPT-4oKeine Schreibgebühr, keine Speichergebühr, automatisch – äußerst fehlerverzeihend
Sehr großer Kontext (>32.000 Token) bei hohem VolumenGemini 2.5 Pro75 % Cache-Leserabatt; Die Lagerkosten sind im Verhältnis zu den Input-Einsparungen gering
Geringes Volumen (<50 Anforderungen/Tag), kleine EingabeaufforderungGemini 2.0 FlashCaching-Einsparungen minimal; Der Rohpreis von Flash gewinnt
Entwicklung/Tests, unvorhersehbare NutzungGPT-4o miniAm günstigsten bei geringem Volumen; Automatisches Caching ohne Overhead

Die Berechnungsformel

So vergleichen Sie Anbieter mit Caching für Ihren Anwendungsfall:

# Monatliche Kosten pro Anbieter mit Caching:
Cache_tokens = your_system_prompt_tokens
new_tokens = user_message_tokens
Output_tokens = Average_response_tokens
Anfragen = daily_requests × 30

# OpenAI (automatisch, keine Schreibgebühr):
monatlich = Anfragen × (Cache-Tokens × Cache-Rate + neue_Tokens × Eingabe-Rate + Ausgabe-Tokens × Ausgabe-Rate) / 1_000_000

# Anthropic (explizit, Premium auf erste Anfrage schreiben):
first_req = cache_tokens × (input_rate × 1,25) / 1_000_000 # Prämie schreiben
rest = (requests-1) × (cache_tokens × (input_rate × 0,10) + new_tokens × input_rate) / 1_000_000
Ausgabekosten = Anfragen × Ausgabetokens × Ausgaberate / 1_000_000
monatlich = erste_Anforderung + Rest + Ausgabekosten

Oder nutzen Sie einfach unsere Kostenrechner — Legen Sie Ihre Token-Anzahl fest und die Ergebnisse spiegeln Standardtarife wider (Caching wird automatisch auf die Infrastruktur des Anbieters angewendet).

Referenzpreise, Juli 2026. Caching-Mechanismen und -Raten ändern sich häufig – überprüfen Sie die Dokumentation zu OpenAI, Anthropic und Google. Fehler gefunden? Melde es →