Jedes Modell, sortiert nach Kosten mit Caching
Gleicher Arbeitsaufwand, alle Modelle nebeneinander. „Zwischengespeicherter Lesevorgang“ ist der Preis eines wiederverwendeten Tokens; „write“ sind die einmaligen Kosten für die Speicherung.
| Modell | Eingang | Zwischengespeicherter Lesevorgang | Kein Cache/Monat | Mit Cache /mo | Gespeichert |
|---|
Was ist Prompt-Caching?
Die meisten LLM-Apps senden das Bei jedem Anruf derselbe große Textblock – eine lange Systemeingabeaufforderung, Tooldefinitionen, ein Styleguide oder abgerufene Dokumente in einer RAG-Pipeline. Normalerweise zahlen Sie jedes Mal den vollen Eingabepreis für diese Token. Sofortiges Caching ermöglicht es dem Anbieter, diese feste Vorwahl nach dem ersten Anruf zu speichern und für die Wiederverwendung einen stark ermäßigten Tarif zu berechnen. Auf Claude lautet ein zwischengespeicherter Token ungefähr 10% des normalen Inputpreises; Bei GPT und Gemini geht es um zwischengespeicherte Eingaben 25–50% billiger. Die einzige Voraussetzung ist, dass der zwischengespeicherte Teil erhalten bleibt identisch und vorne der Eingabeaufforderung – setzen Sie den variablen Teil (die Frage des Benutzers) an die letzte Stelle.
Wie die Mathematik funktioniert
Der Rechner teilt jede Anfrage in zwei Teile. Der wiederverwendete Prompt-Tokens kann zwischengespeichert werden: in einem Cache Schlag Sie rechnen zum günstigen Lesetarif ab, auf a vermissen Für die Aktualisierung des Caches berechnen sie die (etwas teurere) Schreibrate. Der frische Token – die tatsächlichen Eingaben des Benutzers, die jedes Mal anders sind – zahlen immer den vollen Eingabepreis und können nicht zwischengespeichert werden. Dein Cache-Trefferquote entscheidet über die Mischung: Caches laufen nach ein paar Minuten Inaktivität ab (die Standard-TTL von Anthropic beträgt ~5 Minuten), daher halten Apps mit hohem Datenverkehr den Cache konstant warm und erreichen 90 %+, während Apps mit hohem Datenaufkommen oder mit geringem Datenvolumen häufiger aktualisiert werden und weniger Treffer erzielen. Versuchen Sie, die Trefferquote auf 50 % zu senken, und beobachten Sie, wie die Einsparungen schrumpfen – wobei hauptsächlich Belohnungen zwischengespeichert werden Lautstärke und ein stabiles Präfix.
Wann sich Caching lohnt (und wann nicht)
Caching zahlt sich am meisten aus, wenn a Große, unveränderliche Kontextwiederholungen über viele Anrufe hinweg: RAG-Chatbots, die dieselben Dokumente erneut senden, Agenten, die lange Tooldefinitionen und -verläufe abspielen, oder jedes Produkt mit einer umfangreichen Systemaufforderung. In diesen Fällen schneidet es routinemäßig Eingang Kosten um 50–90 %. Das tut es Nichts für einmalige Eingabeaufforderungen, die sich nie wiederholen, und wenig, wenn Ihr wiederverwendetes Präfix winzig ist. Es berührt auch nicht Ausgabe Token-Kosten – Zwischenspeicherung nur der Rabatteingaben. Um das Gesamtbild einschließlich der Ausgabe zu modellieren, verwenden Sie die Kostenschätzer für KI-Apps oder das Pro-Modell Claude / GPT-4o / Zwillinge Taschenrechner.
FAQ
Wie viel spart Prompt-Caching tatsächlich?
Wenn 80–90 % Ihrer Eingabe eine feste Eingabeaufforderung oder ein Kontext ist, der sich wiederholt, werden durch Caching die Gesamteingabekosten im Allgemeinen um 50–90 % gesenkt. Die Einsparungen skalieren mit der Lautstärke und der Stabilität des wiederverwendeten Präfixes und liegen bei Eingabeaufforderungen, die sich nie wiederholen, nahe Null.
Kostet das Schreiben des Caches zusätzliche Kosten?
Bei Claude kostet das einmalige Schreiben des Caches ca. 25 % mehr als ein normales Eingabetoken, aber jedes spätere Lesen ist ca. 90 % günstiger – es amortisiert sich nach etwa zwei Treffern. Das OpenAI-Caching erfolgt automatisch und ohne Schreibzuschlag. Gemini erhebt eine geringe Speichergebühr pro Stunde für die zwischengespeicherten Inhalte.
Was ist eine Cache-Trefferquote?
Der Anteil der Anfragen, bei denen Ihre Eingabeaufforderung bereits gespeichert ist. Caches laufen nach ein paar Minuten Inaktivität ab, sodass Apps mit hohem Datenverkehr sie warm halten (über 90 %), während Apps mit hohem Datenaufkommen oder mit geringem Datenvolumen häufiger aktualisiert werden und weniger Zugriffe benötigen.
Reduziert Caching die Ausgabe-Token-Kosten?
Nein. Prompt-Caching vergünstigt nur die Eingang (prompte) Seite. Ausgabe-/Abschluss-Tokens werden immer zum normalen Tarif abgerechnet, sodass eine gesprächige App mit langen Antworten insgesamt weniger spart als eine kontextintensive App mit kurzen Antworten.
Verwandte Tools und Anleitungen
Kostenschätzer für KI-Apps · RAG-Kostenrechner · Claude Kostenrechner · GPT-4o-Kostenrechner · Preise für OpenAI vs. Claude vs. Gemini · Die API-Kosten verdoppeln Ihre Rechnung