HomeBlog › Sofortiges Caching

Wie schnelles Caching Ihre LLM-Rechnung um bis zu 90 % senkt

Veröffentlicht am 21.06.2026 · Referenznummern, vor der Budgetierung überprüfen

Wenn Ihre App bei jedem Anruf dieselbe lange Systemaufforderung, dieselben abgerufenen Dokumente oder denselben wachsenden Chatverlauf sendet, zahlen Sie den vollen Preis für das erneute Lesen von Text, den das Modell bereits vor Sekunden gesehen hat. Sofortiges Caching ist die Lösung und der größte Einzelpostenrabatt, den die meisten Teams nie in Anspruch nehmen. Richtig gemacht, werden die Inputkosten um ein Vielfaches gesenkt 50 % bis 90 %. Hier erfahren Sie, wie es funktioniert, die Zahlen für 2026 und wo es stillschweigend nicht hilft.

Was Prompt-Caching tatsächlich bewirkt

Eine LLM-Rechnung ist meistens Eingabe-Token × Preis + Ausgabe-Token × Preis. Caching greift die Eingabehälfte an. Wenn Sie einen Teil der Eingabeaufforderung als zwischenspeicherbar markieren, speichert der Anbieter das verarbeitete Formular für ein kurzes Fenster. Beim nächsten Anruf, bei dem genau dasselbe Präfix wiederverwendet wird, wird Ihnen a in Rechnung gestellt Fraktion des normalen Eingabesatzes für diese Token anstelle des vollen Betrags. Der Ausgabepreis bleibt unverändert – durch die Zwischenspeicherung wird nur der Teil reduziert, den Sie weiterhin erneut senden.

Die Rabatte 2026 (Referenz)

AnbieterZwischengespeicherter EingabepreisNotizen
OpenAI~50 % des InputsAutomatisch bei langen Eingabeaufforderungen, keine Codeänderung
Anthropisch (Claude)~10 % der Eingaben bei LesevorgängenBis zu 90 % Rabatt – aber ca. 25 % zahlen beim ersten Mal eine Prämie
Google Gemini~25 % des InputsKontext-Caching; Möglicherweise fällt eine geringe Lagergebühr an
⚠️ Referenzzahlen, Juni 2026 – genaue Rabatte, Cache-Lebensdauer und etwaige Änderungen der Speichergebühren. Bestätigen Sie dies auf der Preisseite jedes Anbieters. Anthropic und Gemini verwenden explizite Cache-Marker; OpenAI wendet es automatisch auf qualifizierende Präfixe an.

Ein gelungenes Beispiel

Angenommen, ein Support-Assistent sendet eine 2.000-Token-Systemaufforderung + Wissensdatenbank für jede Nachricht, plus ca. 200 Token der tatsächlichen Frage des Benutzers und gibt ca. 300 Ausgabe-Tokens zurück. Bei 10.000 Gesprächen pro Monat wird der feste 2.000-Token-Block 10.000 Mal erneut gesendet. Verwendung eines Modells mit einem Input von 2,50 $/1 Mio.:

Skalieren Sie das auf 100.000 oder 1 Million Gespräche, und das statische Präfix macht den Unterschied zwischen einer komfortablen und einer alarmierenden Rechnung aus. Je größer und wiederholter Ihr fester Kontext ist, desto mehr lohnt sich das Caching – RAG-Apps und Agents mit langen Systemaufforderungen profitieren am meisten.

Wenn Caching NICHT hilft (die Fallstricke)

Die Faustregel

Zwischenspeichern, wenn Sie einen großen, identischen Kontextblock häufig und schnell erneut senden: Systemaufforderungen, Tooldefinitionen, RAG-Dokumente, Beispiele für wenige Aufnahmen, langer Chatverlauf. Machen Sie sich keine Gedanken über einmalige Anrufe, sehr variable Eingabeaufforderungen oder ausgabeintensive Arbeitslasten. Strukturieren Sie die Eingabeaufforderung statisch-zuerst, variabel-zuletzt, und der Rabatt liegt nahe am kostenlosen Geld. Geben Sie mit dem eine Nummer in Ihren eigenen Fall ein Rechner für schnelle Caching-Einsparungen, und vergleichen Sie Modelle auf der KI-API-Kostenrechner.

FAQ

Wie viel kann Prompt-Caching einsparen?

Typischerweise 50–90 % Rabatt auf den Eingabepreis für den zwischengespeicherten Teil, je nach Anbieter. Es werden nur wiederholte Eingabe-Tokens rabattiert, nicht die Ausgabe.

Verändert Prompt-Caching die Antworten des Modells?

Nein. Es handelt sich um eine Abrechnungs-/Latenzoptimierung – das Modell erkennt dieselben Token, Sie zahlen lediglich weniger für das erneute Senden des zwischengespeicherten Präfixes. Die Antworten sind unverändert.

Warum ist meine Rechnung durch Caching gestiegen?

Fast immer die Schreibprämie (z. B. Anthropics ~25 % Aufpreis für die Erstellung des Caches) für Präfixe, die vor Ablauf nicht ausreichend wiederverwendet werden, oder ein Präfix, das sich bei jedem Aufruf ändert, sodass es nie zuschlägt. Caching zahlt sich bei häufiger, identischer Wiederverwendung aus.

Referenzschätzungen – überprüfen Sie Rabatte und Gebühren immer auf der offiziellen Preisseite des Anbieters.