—Letzte Runde alleine
—vs. Pauschalkosten
—mit Fenster/Cache
Die Kosten steigen mit der Anzahl der Runden
Mit zunehmender Historie steigt der Aufwand pro Runde weiter an, sodass die Kurve der kumulierten Kosten nach oben verläuft – eine Verdoppelung der Runden verdoppelt die Rechnung mehr als.
| An der Reihe | Dieser Zug kostet | Kumulativ |
|---|
Sie zahlen bei jeder Runde für die Geschichte
Ein Sprachmodell ist zustandslos: Es merkt sich nichts zwischen API-Aufrufen. Um also eine Konversation fortzusetzen, sendet Ihre Anwendung das gesamte Transkript – Systemeingabeaufforderung, jede frühere Benutzernachricht und jede frühere Antwort – als Eingabe für jede neue Anfrage erneut. Das bedeutet, dass der Input mit jedem Austausch zunimmt und die Kosten für das gesamte Gespräch ungefähr im Quadrat mit der Anzahl der Gesprächsrunden steigen, nicht linear. Die letzte Runde eines langen Chats ist die teuerste, da sie die meiste Historie enthält und die feste Systemansage einmal pro Runde zusätzlich in Rechnung gestellt wird. Drei Hebel bringen es wieder nach unten: a Schiebefenster das nur die letzten Runden behält (Kosten werden linear, auf Kosten des Speichers), sofortiges Caching Dadurch wird das wiederholte Präfix mit einem erheblichen Rabatt abgerechnet, und die Zusammenfassung des Alten ergibt eine kurze Zusammenfassung. Vergleichen Sie ein einzelnes Fenster auf dem Kostenrechner für Kontextfenster, Größe des Caching-Gewinns auf der Rechner für schnelle Caching-Einsparungen, und kostet einen vollwertigen Assistenten Chatbot-Kostenrechner.
Rechner für bereitgestellten Durchsatz (PTU).AI Gateway Markup-RechnerPreisrechner für Sitzplatz vs. NutzungKostenkalkulator für KI-AppsAI Wrapper-Preise
So funktioniert dieser Rechner
Der Multi-Turn-Gesprächskostenrechner schätzt die gesamten Token-Kosten einer vollständigen Chat-Sitzung, nicht einer einzelnen Anfrage. Da die meisten Chat-APIs zustandslos sind, wird bei jeder neuen Runde der gesamte vorherige Verlauf erneut gesendet, sodass der Rechner Ihren vervielfacht Systemaufforderung, Token pro Benutzernachricht, Und Token pro Assistentenantwort über das wachsende Transkript für jedes der angegebenen dreht sich, wendet dann Ihre Ein- und Ausgabepreise pro Million Token an. Der Hauptkostentreiber besteht darin, dass sich durch das erneute Senden des Verlaufs Eingabe-Tokens ansammeln quadratisch mit der Anzahl der Runden, weshalb ein langes Gespräch weitaus mehr kosten kann, als die einzelnen Nachrichten vermuten lassen.
Der wichtigste Kompromiss besteht darin, dieses Wachstum zu kontrollieren. Einstellung a Schiebefenster Behält nur die letzten Runden und begrenzt, wie viel Verlauf erneut gesendet wird, während a Cache-Rabatt reduziert den Preis des wiederholten Präfixes. Beide sind kostengünstiger, aber ein schmaleres Fenster bedeutet das Modell vergisst Achten Sie also darauf, wie aggressiv Sie trimmen, bevor die Qualität darunter leidet.
Häufig gestellte Fragen
Warum kostet ein langer Chat mehr, als die Anzahl der Nachrichten vermuten lässt?
Da ein LLM zwischen Aufrufen keinen Speicher hat, muss bei jedem Zug die gesamte vorherige Konversation erneut als Eingabe gesendet werden, damit das Modell den Kontext sehen kann. In der zehnten Runde liest das Modell alle neun vorherigen Austausche plus die Systemaufforderung erneut, in der zwanzigsten Runde liest es neunzehn erneut und so weiter. Die Eingabetokens wachsen daher mit jeder Runde, und die kumulierten Kosten des gesamten Gesprächs wachsen ungefähr im Quadrat der Anzahl der Runden und nicht linear. Ein Gespräch mit hundert Durchgängen kann weit mehr kosten als hundert Einzelanrufe derselben Nachrichtengröße – Sie zahlen immer wieder für den Verlauf.
Wie kann ich verhindern, dass die Gesprächskosten explodieren?
Drei Hebel. Ein Schiebefenster behält nur die letzten paar Windungen des Verlaufs bei und begrenzt die Eingabe auf eine feste Größe, sodass die Kosten linear statt quadratisch steigen – auf Kosten des Modells, das älteren Kontext vergisst. Durch das Prompt-Caching kann der Anbieter das wiederholte Präfix speichern und ihm bei jeder Wiederverwendung einen großen Rabatt in Rechnung stellen. Dies ist ideal, wenn der frühe Verlauf und die Systemaufforderung identisch bleiben. Und die Zusammenfassung komprimiert alte Wendungen zu einer kurzen Zusammenfassung, sodass Sie die Bedeutung behalten, ohne die Token zu behalten. Dieser Rechner zeigt die naiven Kosten für den gesamten Verlauf zusammen mit einer Fenster- und einer zwischengespeicherten Version an, sodass Sie sehen können, welcher Hebel sich für Ihre Gesprächsdauer auszahlt.
Spielt eine größere Systemaufforderung in einem langen Gespräch eine Rolle?
Ja, mehr als erwartet, da die Systemaufforderung bei jeder einzelnen Runde erneut gesendet wird. Eine Systemaufforderung mit 2.000 Token in einem Gespräch mit fünfzig Runden wird fünfzig Mal in Rechnung gestellt – hunderttausend Eingabe-Tokens, bevor eine Benutzernachricht gezählt wird. Bei langen oder hochvolumigen Chats macht der feste System-Prompt oft einen größeren Teil der Rechnung aus als das eigentliche Gespräch, und das ist genau die Art von Kosten, die durch Prompt-Caching vermieden werden soll. Der Rechner trennt den systemprompten Beitrag, sodass Sie sehen können, ob sich das Trimmen oder Caching lohnt.