Systemaufforderung / Mo
Gesamtrechnung / Monat
ist die Präambel
Cache-Speicherungen / Monat

Wohin Ihre Eingabe-Tokens gehen

Die monatliche Rechnung unterteilt sich in die feste Präambel, die Sie jedes Mal erneut senden, die dynamischen Benutzer- und Kontext-Tokens und die Ausgabe. Die erste Zeile ist die Steuer – sie schrumpft nicht, wenn Benutzer weniger sagen.

TeilToken / AnfrageKosten/MoAktie

Wie schnell die Größe die Steuer skaliert

Jede Zeile hat bei Ihrer aktuellen Lautstärke eine andere vom System vorgegebene Länge. Die nicht zwischengespeicherte Spalte ist der naive Preis; In der zwischengespeicherten Spalte werden Ihre Trefferquote und Ihr Rabatt angewendet. Aus diesem Grund hat eine Aufforderung, die von 500 auf 4.000 Token angewachsen ist, Ihre Rechnung stillschweigend vervielfacht.

SystemaufforderungNicht zwischengespeichert / MoZwischengespeichert / Mogegen deins

Für die Eingabeaufforderung, die Sie einmal geschrieben haben, zahlen Sie eine Million Mal

Ein System-Prompt fühlt sich kostenlos an, weil man ihn einmal schreibt und dann vergisst, aber die API ist zustandslos, sodass die Präambel bei jedem einzelnen Aufruf mitläuft und jedes Mal als Eingabe-Token abgerechnet wird. Die Falle sind kurze Anfragen mit hohem Volumen: Ein Klassifikator oder Router, der zwanzig Tokens an Benutzertext und einen Befehlsblock mit zweitausend Tokens empfängt, gibt 99 % seines Eingabebudgets für Wörter aus, die der Benutzer nie gesendet hat. Die Lösung ist langweilig und effektiv – lesen Sie Ihre Systemaufforderung so, als ob Sie pro Wort zahlen würden, denn das stimmt, und verzichten Sie auf den höflichen Füller, die duplizierten Regeln und die Toolschemata, die Sie fast nie aufrufen. Anschließend wird zwischengespeichert, was übrig bleibt, da eine stabile Präambel genau das ist, wofür Prompt-Caching entwickelt wurde und ein zwischengespeicherter Lesevorgang etwa ein Zehntel eines neuen Lesevorgangs kostet. Der Grund dafür, dass das Trimmen an erster Stelle steht, ist, dass es bedingungslos hilft, sowohl bei Cache-Fehltreffern als auch bei Cache-Treffern, während sich Caching nur bei Anfragen auszahlt, die eintreffen, während der Cache warm ist, und nur dann, wenn das Präfix Byte für Byte identisch bleibt – ein Zeitstempel oben und der Rabatt verflüchtigt sich. Passen Sie den Caching-Hebel genau an Rechner für schnelle Caching-Einsparungen, überprüfen Sie die Schreib-gegen-Lese-Breakeven auf der Cache-Schreib-Break-Even-Rechner, und zählen Sie die Token in Ihrer aktuellen Eingabeaufforderung mit Token-Zähler.

Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS
Sofortige Caching-EinsparungenCache-Schreib-BreakevenKosten für FunktionsaufrufeToken-ZählerLLM-Kostenoptimierung