—Gesamtrechnung / Monat
—ist die Präambel
—Cache-Speicherungen / Monat
Wohin Ihre Eingabe-Tokens gehen
Die monatliche Rechnung unterteilt sich in die feste Präambel, die Sie jedes Mal erneut senden, die dynamischen Benutzer- und Kontext-Tokens und die Ausgabe. Die erste Zeile ist die Steuer – sie schrumpft nicht, wenn Benutzer weniger sagen.
| Teil | Token / Anfrage | Kosten/Mo | Aktie |
|---|
Wie schnell die Größe die Steuer skaliert
Jede Zeile hat bei Ihrer aktuellen Lautstärke eine andere vom System vorgegebene Länge. Die nicht zwischengespeicherte Spalte ist der naive Preis; In der zwischengespeicherten Spalte werden Ihre Trefferquote und Ihr Rabatt angewendet. Aus diesem Grund hat eine Aufforderung, die von 500 auf 4.000 Token angewachsen ist, Ihre Rechnung stillschweigend vervielfacht.
| Systemaufforderung | Nicht zwischengespeichert / Mo | Zwischengespeichert / Mo | gegen deins |
|---|
Für die Eingabeaufforderung, die Sie einmal geschrieben haben, zahlen Sie eine Million Mal
Ein System-Prompt fühlt sich kostenlos an, weil man ihn einmal schreibt und dann vergisst, aber die API ist zustandslos, sodass die Präambel bei jedem einzelnen Aufruf mitläuft und jedes Mal als Eingabe-Token abgerechnet wird. Die Falle sind kurze Anfragen mit hohem Volumen: Ein Klassifikator oder Router, der zwanzig Tokens an Benutzertext und einen Befehlsblock mit zweitausend Tokens empfängt, gibt 99 % seines Eingabebudgets für Wörter aus, die der Benutzer nie gesendet hat. Die Lösung ist langweilig und effektiv – lesen Sie Ihre Systemaufforderung so, als ob Sie pro Wort zahlen würden, denn das stimmt, und verzichten Sie auf den höflichen Füller, die duplizierten Regeln und die Toolschemata, die Sie fast nie aufrufen. Anschließend wird zwischengespeichert, was übrig bleibt, da eine stabile Präambel genau das ist, wofür Prompt-Caching entwickelt wurde und ein zwischengespeicherter Lesevorgang etwa ein Zehntel eines neuen Lesevorgangs kostet. Der Grund dafür, dass das Trimmen an erster Stelle steht, ist, dass es bedingungslos hilft, sowohl bei Cache-Fehltreffern als auch bei Cache-Treffern, während sich Caching nur bei Anfragen auszahlt, die eintreffen, während der Cache warm ist, und nur dann, wenn das Präfix Byte für Byte identisch bleibt – ein Zeitstempel oben und der Rabatt verflüchtigt sich. Passen Sie den Caching-Hebel genau an Rechner für schnelle Caching-Einsparungen, überprüfen Sie die Schreib-gegen-Lese-Breakeven auf der Cache-Schreib-Break-Even-Rechner, und zählen Sie die Token in Ihrer aktuellen Eingabeaufforderung mit Token-Zähler.
Sofortige Caching-EinsparungenCache-Schreib-BreakevenKosten für FunktionsaufrufeToken-ZählerLLM-Kostenoptimierung
So funktioniert dieser Rechner
Es zählt Ihre monatlichen Anfragen als Anfragen pro Tag mal 30,4. Bei jeder Anfrage werden die Systemeingabeaufforderung plus die dynamische Eingabe mit der Eingaberate und die Ausgabe mit der Ausgaberate bezahlt. Die System-Prompt-Kosten sind die Anzahl der Token multipliziert mit den monatlichen Anfragen bei der Eingaberate. Durch das Caching wird der Anteil der Trefferquote auf den ermäßigten Preis reduziert, während der Anteil der Fehlschläge beim vollen Preis bleibt. Die Gesamtrechnung summiert die feste Präambel, die dynamische Eingabe und die Ausgabe. Der Anteil ist der vom System verursachte Aufwand an dieser Gesamtsumme, und die Cache-Einsparung ist der nicht zwischengespeicherte Präambelaufwand abzüglich des zwischengespeicherten. Die Skalierungstabelle führt die Präambelkosten bei mehreren Eingabeaufforderungslängen erneut durch, sodass Sie sehen können, wie sie wachsen, und die Trimmzahl wendet Ihre prozentuale Kürzung auf die aktuelle Eingabeaufforderung an.
Häufig gestellte Fragen
Warum kostet die Systemaufforderung bei jeder Anfrage Geld?
Da die API zustandslos ist und sich nicht an Ihren vorherigen Aufruf erinnert, muss alles, was das Modell jedes Mal wissen soll, jedes Mal gesendet werden. Die Systemeingabeaufforderung, die Persona, die wenigen Beispiele und die Toolschemata befinden sich alle in dieser festen Präambel, und jedes einzelne wird bei jeder Anfrage als Eingabetoken gezählt. Ein Benutzer, der ein einzelnes Wort eingibt, zahlt immer noch für die gesamte damit verbundene Präambel, weshalb sich eine aufgeblähte Systemaufforderung wie eine feste Steuer verhält, die sowohl auf die kleinsten als auch auf die größten Anfragen vollständig erhoben wird.
Wie viel von meiner Rechnung wird vom System abgefragt?
Es hängt vom Verhältnis Ihrer festen Präambel zum variablen Inhalt jeder Anfrage ab. Eine 2000-Token-Eingabeaufforderung gegenüber einem 500-Token-Benutzerzug macht den größten Teil Ihrer Eingabetokens aus und kann die Rechnung dominieren – insbesondere bei kurzen, hochvolumigen Anrufen wie der Klassifizierung, bei denen es kaum Benutzertext gibt, der sie verwässert. Wenn Ihre Anfragen lange Dokumente oder Chatverläufe enthalten, ist die Präambel ein kleinerer Abschnitt. Der gefährliche Fall ist ein hohes Volumen plus kurze Anfragen plus lange Aufforderung.
Entfernt Prompt-Caching die System-Prompt-Kosten?
Das meiste davon wird bei den Aufrufen entfernt, die im Cache landen. Beim Caching wird ein stabiles Präfix gespeichert – Ihr System-Prompt ist der perfekte Kandidat – und die Abrechnung erfolgt mit einem erheblichen Rabatt, üblicherweise etwa 90 %, sodass ein zwischengespeicherter System-Prompt etwa ein Zehntel eines nicht zwischengespeicherten Präfixes kostet. Der Haken daran ist, dass nur Anfragen, die eingehen, während der Cache warm ist, den Rabatt erhalten, es manchmal einen kleinen Schreibaufschlag gibt und das Präfix Byte für Byte identisch sein muss, sodass ein Zeitstempel oben den Rabatt unterbricht.
Ist es besser, die Systemaufforderung zu kürzen oder zwischenzuspeichern?
Machen Sie beides, aber sie lösen unterschiedliche Probleme. Durch das Trimmen werden die Token in der Präambel gekürzt, was die Kosten für jede Anfrage, einschließlich Cache-Fehler, senkt und das Kontextfenster freigibt. Durch das Caching bleibt die Eingabeaufforderung lange, aber wiederholte Lesevorgänge sind bei warmen Anrufen kostengünstiger. Das Trimmen ist der robustere Gewinn, da es bedingungslos hilft, während das Caching davon abhängt, dass Ihr Datenverkehr den Cache warm hält. Entferne zuerst alles, was seine Token nicht verdient, und speichere dann den Rest im Cache.