✓ Multiplikativ, nicht additiv· Caching → Batch → Festgeschrieben· ein Problem melden →
Sofortiges Caching, Die Batch-API und a Rabatt für zugesagte Ausgaben Jeder von ihnen senkt Ihre Rechnung – aber naiv gestapelt scheinen sie mehr zu sparen, als Sie ausgeben. Sie verstärken sich: Stapelrabatte auf den bereits günstigeren, zwischengespeicherten Preis, und der zugesagte Rabatt ergibt sich aus dem, was übrig bleibt. Dies kostet die echte gemischte Kosten pro Million Token, das Echte monatliche Rechnung, und a Wasserfall woher jeder Dollar Ersparnis tatsächlich kommt.
—
gestapelt / Mo
—Listenpreis / Mo
—Gesamtersparnis
—gemischt $/1 Mio
Spar-Wasserfall – jeder Hebel wirkt auf das, was der letzte Hebel übrig ließ
Beginnen Sie mit dem Listenpreis, wenden Sie Prompt-Caching auf die Eingabeseite an, dann die Batch-API auf den gestapelten Anteil und dann den zugesagten Rabatt auf die gesamte verbleibende Rechnung. Die Trittsäule wurde allein durch diesen Hebel entfernt; Was übrig bleibt, ist die Laufspalte.
Bühne
Dieser Schritt wurde gespeichert
Läuft monatlich
Additiv vs. Multiplikativ – die Falle
Durch die Addition der drei Schlagzeilenrabatte wird die Ersparnis überbewertet, manchmal sogar über 100 %. Der echte Stapel vervielfacht das, was Sie bei jedem Schritt behalten. Dies zeigt die Lücke für Ihre Zahlen.
Verfahren
Ersparnisse geltend gemacht
Monatlich
Drei Rabatte machen es selten kostenlos
Jeder LLM-Leitfaden zur Kostensenkung listet die gleichen Hebel auf – speichern Sie Ihre Eingabeaufforderungen, stapeln Sie, was warten kann, verpflichten Sie sich, für einen Mengenrabatt auszugeben – und jeder von ihnen gibt einen Schlagzeilenprozentsatz an. Der Fehler besteht darin, diese Prozentsätze zu stapeln, indem man sie addiert. Rabatte addieren sich nicht, sie verstärken sich: Jeder kann nur mit dem Geld arbeiten, das der vorherige zurückgelassen hat. Ein Cache-Rabatt von 90 %, der nur die Eingabeseite betrifft, ein Batch-Rabatt von 50 % auf den Anteil des Datenverkehrs, der Latenz toleriert, und ein festgeschriebener Rabatt von 15 % auf der Rechnung summieren sich nicht zu 155 % Rabatt – sie multiplizieren sich zu einer reellen Zahl, die immer weniger beeindruckend ist als die Summe und immer größer als Null ist. Dieser Rechner wendet sie in der Reihenfolge an, in der sie auftreten – Zwischenspeicherung zum Zeitpunkt der Anfrage, Batch bei der Übermittlung, Festschreibung bei der Abrechnung – und führt die Rechnung einen Wasserfall hinunter, sodass Sie sehen können, was jeder Hebel tatsächlich entfernt hat, und nicht, was in der Broschüre versprochen wurde. Es verdeutlicht auch die Haken, die hinter den Schlagzeilen verborgen sind: Durch das Zwischenspeichern werden nur Input-Tokens reduziert, so dass eine ausgabeintensive Arbeitslast kaum spürbar ist; Batch gilt nur für Datenverkehr, der warten kann, daher leitet ein interaktives Produkt nur einen kleinen Teil seines Volumens darüber weiter. und bei einigen Anbietern können Sie die gleiche Anfrage überhaupt nicht zwischenspeichern und stapeln. Bewerten Sie jeden Hebel einzeln mit dem Prompt-Caching-Rechner, Die Batch-API-Rechner und die Rechner für zugesagte Ausgaben – dann kommen Sie hierher, um zu sehen, was sie wirklich zusammen machen, und vergleichen Sie das Ergebnis mit dem Gesamtergebnis Kostenoptimierungsrechner.
Der Listenpreis beginnt mit Ihrer Token-Aufteilung: Input-Tokens mal Input-Preis plus Output-Tokens mal Output-Preis, dividiert durch eine Million, mal Anfragen pro Monat. Prompt-Caching wirkt nur auf der Eingabeseite – der effektive Eingabepreis wird zum Eingabepreis mal eins minus dem zwischenspeicherbaren und wiederverwendeten Bruchteil mal dem Cache-Leserabatt. Wenn also 70 % der Eingabe wiederverwendet werden und zwischengespeicherte Lesevorgänge 90 % günstiger sind, sparen Sie 63 % der Eingabekosten, während die Ausgabe zum vollen Preis bleibt. Der Batch-API-Rabatt gilt für den Batch-Anteil des Volumens: Der Batch-Anteil der Post-Cache-Rechnung wird mit eins minus dem Batch-Rabatt multipliziert, der Rest bleibt unberührt, da Echtzeitverkehr nicht gestapelt werden kann. Schließlich ist der Rabatt für zugesagte Ausgaben ein Pauschalmultiplikator auf die gesamte verbleibende Rechnung. Die gestapelte Summe ist der Listenpreis, der alle drei in dieser Reihenfolge durchläuft; Die Gesamtkosten pro Million Token sind die Summe dividiert durch die Gesamtzahl der verarbeiteten Token. Die Additiv-gegen-Multiplikativ-Tabelle stellt die ehrliche zusammengesetzte Ersparnis der naiven Summe der Headline-Prozentsätze gegenüber, die 100 % überschreiten kann und immer falsch ist. Caching berührt nur die Eingabe, Batch berührt nur die wartetolerante Freigabe und einige Anbieter blockieren das Caching bei Batch-Anfragen – betrachten Sie die kombinierte Zahl also als den besten Fall für Datenverkehr, bei dem alle drei tatsächlich zutreffen.
Häufig gestellte Fragen
Warum summieren sich die gestapelten LLM-Einsparungen nicht einfach?
Bei jedem Hebel wird das reduziert, was beim letzten Hebel übrig geblieben ist, so dass sie sich addieren statt addieren. Behalten Sie 60 % nach dem Caching, 50 % davon nach dem Batch, 80 % davon nach dem zugesagten Rabatt, und Sie sind bei 24 % der Liste – eine Ersparnis von 76 % und nicht die 110 %, die Sie durch die Addition von 40, 50 und 20 erhalten. Sie können nie mehr sparen, als Sie ausgeben, weshalb die Summierung der Überschriftenprozentsätze immer falsch ist.
Reduziert das Prompt-Caching nur Eingabe-Tokens?
Ja. Beim Caching wird ein Präfix bereits gesendeter Token wiederverwendet. Die Ausgabe wird jedes Mal neu generiert und niemals zwischengespeichert. Bei einer eingabeintensiven RAG-Arbeitslast fühlt sich das Caching also als schwierig an, während bei einer ausgabelastigen Entwurfs-Arbeitslast dies kaum auffällt. Dieses Tool wendet den Cache-Rabatt nur auf den Eingabeanteil und nur auf den wiederverwendeten Anteil an.
Ändert die Reihenfolge der Rabatte die Gesamtsumme?
Bei flachen Prozentsätzen nein – die Multiplikation ist kommutativ, sodass 0,6 × 0,5 × 0,8 in jeder Reihenfolge gleich ist. Ordnung verändert nur die Geschichte, die der Wasserfall erzählt. Es spielt eine Rolle, wenn ein Rabatt nicht pauschal ist – eine festgelegte Stufe, die oberhalb eines Schwellenwerts freigeschaltet wird, oder eine Cache-Schreibprämie –, die dieses Tool kennzeichnet, anstatt genau zu modellieren.
Kann ich in der Produktion wirklich alle drei stapeln?
Caching und zugesagte Rabatte lassen sich sauber stapeln. Die Batch-API ist der Haken: Batch-Jobs sind asynchron, sodass sie nur latenztoleranter Datenverkehr nutzen kann, und einige Anbieter bieten kein Caching für Batch-Anfragen an. Stellen Sie den Batch-Anteil auf unter 100 % ein, um die Aufteilung zu modellieren, und stellen Sie sicher, dass Ihr Anbieter die Kombination der Hebel zulässt, bevor Sie die Finanzierung der kombinierten Anzahl versprechen.