—Letzte Runde alleine
—vs. Pauschalkosten
—mit Fenster/Cache
Die Kosten steigen mit der Anzahl der Runden
Mit zunehmender Historie steigt der Aufwand pro Runde weiter an, sodass die Kurve der kumulierten Kosten nach oben verläuft – eine Verdoppelung der Runden verdoppelt die Rechnung mehr als.
| An der Reihe | Dieser Zug kostet | Kumulativ |
|---|
Sie zahlen bei jeder Runde für die Geschichte
Ein Sprachmodell ist zustandslos: Es merkt sich nichts zwischen API-Aufrufen. Um also eine Konversation fortzusetzen, sendet Ihre Anwendung das gesamte Transkript – Systemeingabeaufforderung, jede frühere Benutzernachricht und jede frühere Antwort – als Eingabe für jede neue Anfrage erneut. Das bedeutet, dass der Input mit jedem Austausch zunimmt und die Kosten für das gesamte Gespräch ungefähr im Quadrat mit der Anzahl der Gesprächsrunden steigen, nicht linear. Die letzte Runde eines langen Chats ist die teuerste, da sie die meiste Historie enthält und die feste Systemansage einmal pro Runde zusätzlich in Rechnung gestellt wird. Drei Hebel bringen es wieder nach unten: a Schiebefenster das nur die letzten Runden behält (Kosten werden linear, auf Kosten des Speichers), sofortiges Caching Dadurch wird das wiederholte Präfix mit einem erheblichen Rabatt abgerechnet, und die Zusammenfassung des Alten ergibt eine kurze Zusammenfassung. Vergleichen Sie ein einzelnes Fenster auf dem Kostenrechner für Kontextfenster, Größe des Caching-Gewinns auf der Rechner für schnelle Caching-Einsparungen, und kostet einen vollwertigen Assistenten Chatbot-Kostenrechner.
Rechner für bereitgestellten Durchsatz (PTU).AI Gateway Markup-RechnerPreisrechner für Sitzplatz vs. NutzungKostenkalkulator für KI-AppsAI Wrapper-Preise
So funktioniert dieser Rechner
Kostenloser Rechner für die Chat-Kosten für mehrere Runden – da bei jeder Runde der gesamte Verlauf erneut gesendet wird, steigen die LLM-Gesprächskosten mit dem Quadrat der Rundenanzahl und nicht linear.
Häufig gestellte Fragen
Warum kostet ein langer Chat mehr, als die Anzahl der Nachrichten vermuten lässt?
Da ein LLM zwischen Aufrufen keinen Speicher hat, muss bei jedem Zug die gesamte vorherige Konversation erneut als Eingabe gesendet werden, damit das Modell den Kontext sehen kann. In der zehnten Runde liest das Modell alle neun vorherigen Austausche plus die Systemaufforderung erneut, in der zwanzigsten Runde liest es neunzehn erneut und so weiter. Die Eingabetokens wachsen daher mit jeder Runde, und die kumulierten Kosten des gesamten Gesprächs wachsen ungefähr im Quadrat der Anzahl der Runden und nicht linear. Ein Gespräch mit hundert Durchgängen kann weit mehr kosten als hundert Einzelanrufe derselben Nachrichtengröße – Sie zahlen immer wieder für den Verlauf.
Wie kann ich verhindern, dass die Gesprächskosten explodieren?
Drei Hebel. Ein Schiebefenster behält nur die letzten paar Windungen des Verlaufs bei und begrenzt die Eingabe auf eine feste Größe, sodass die Kosten linear statt quadratisch steigen – auf Kosten des Modells, das älteren Kontext vergisst. Durch das Prompt-Caching kann der Anbieter das wiederholte Präfix speichern und ihm bei jeder Wiederverwendung einen großen Rabatt in Rechnung stellen. Dies ist ideal, wenn der frühe Verlauf und die Systemaufforderung identisch bleiben. Und die Zusammenfassung komprimiert alte Wendungen zu einer kurzen Zusammenfassung, sodass Sie die Bedeutung behalten, ohne die Token zu behalten. Dieser Rechner zeigt die naiven Kosten für den gesamten Verlauf zusammen mit einer Fenster- und einer zwischengespeicherten Version an, sodass Sie sehen können, welcher Hebel sich für Ihre Gesprächsdauer auszahlt.
Spielt eine größere Systemaufforderung in einem langen Gespräch eine Rolle?
Ja, mehr als erwartet, da die Systemaufforderung bei jeder einzelnen Runde erneut gesendet wird. Eine Systemaufforderung mit 2.000 Token in einem Gespräch mit fünfzig Runden wird fünfzig Mal in Rechnung gestellt – hunderttausend Eingabe-Tokens, bevor eine Benutzernachricht gezählt wird. Bei langen oder hochvolumigen Chats macht der feste System-Prompt oft einen größeren Teil der Rechnung aus als das eigentliche Gespräch, und das ist genau die Art von Kosten, die durch Prompt-Caching vermieden werden soll. Der Rechner trennt den systemprompten Beitrag, sodass Sie sehen können, ob sich das Trimmen oder Caching lohnt.