HomeBlog › Kosten für den Gesprächsverlauf

Warum Nachricht 30 fast siebenmal mehr kostet als Nachricht 1

Veröffentlicht am 08.07.2026 · Referenznummern, vor der Budgetierung überprüfen

Wenn Sie einen Chatbot mit einer beliebigen LLM-API erstellen, enthält jede von Ihnen gesendete Nachricht das Vollständiger Gesprächsverlauf als Eingabe. Nicht nur die letzte Benutzerfrage – alle vorherigen Runden, jede Antwort des Assistenten, alles. Auf diese Weise bewahren LLMs den Kontext. Es geht auch darum, wie sich Ihre Kosten still und heimlich zu etwas Überraschendem summieren.

Bis zur Nachricht 30 in einer einzelnen Konversation ist die Anzahl der eingegebenen Token von etwa 1.150 Token auf über 11.000 gestiegen. Bei Eingabetoken im Wert von 5 $/1 Mio. USD (GPT-4o-Preisgestaltung), kostet Sie diese eine Antwort fast siebenmal mehr als die erste.

Die Mathematik dahinter

Angenommen, Ihr Chatbot verfügt über eine Systemaufforderung mit 1.000 Token, Benutzer senden Nachrichten mit durchschnittlich 150 Token und das Modell antwortet jedes Mal mit etwa 200 Token. An der Reihe k:

Eingabe(k) = 1.000 (System) + (k−1) × (150 + 200) (vorherige Runden) + 150 (aktuelle Nachricht)

Das vereinfacht 800 + 350.000. Die Kosten steigen linear mit jeder Runde – denn jede Runde fügt jedem zukünftigen Anruf für immer 350 Token hinzu.

DrehenEingabe-TokensInputkosten (5 USD/1 Mio.)Gesamtkosten der Runde
11,150$0.0058$0.009
52,550$0.0128$0.016
104,300$0.0215$0.025
207,800$0.039$0.042
3011,300$0.0565$0.060

Bei den Preisen handelt es sich um Referenzschätzungen, Juli 2026. Veralteten Preis melden →

Ausgabe: 200 Token × 15 $/1 Mio. = 0,003 $ pro Runde. Modell: GPT-4o (Referenzpreis 5 $/15 $).

Runde 30 kostet 0,060 $, Runde 1 kostet 0,009 $ – a 6,8-facher Unterschied für die gleiche 150-Token-Benutzerfrage und 200-Token-Antwort.

Was ein 30-Runden-Gespräch eigentlich kostet

Addiert man alle 30 Runden, beträgt der gesamte Input im gesamten Gespräch 186.750 Token. Gesamtkosten:

Wenn die API zustandslos wäre und jeder Aufruf nur die aktuelle Runde (1.150 Tokens) senden würde, würden dieselben 30 Runden 30 × 0,009 $ = kosten $0.27. Der Gesprächsverlauf wird hinzugefügt Zusätzliche Inputkosten in Höhe von 0,75 $ – Geld, das für das erneute Lesen dessen aufgewendet wird, was das Modell bereits verarbeitet hat.

Im Maßstab ist dies die Rechnung

10.000 Benutzer pro Tag, jeder mit durchschnittlich 15 Runden:

Tägliche KostenMonatliche Kosten
15-Runden-Gespräche (mit Verlauf)$1,840$55,200
Staatenlos (hypothetisch, keine Geschichte)$810$24,300
Geschichte über Kopf$1,030$30,900

Der Verlaufsaufwand ist kein Abrechnungsfehler. Es sind die strukturellen Kosten für den Aufbau einer Konversations-KI auf einer API, die für jeden Token bei jedem Aufruf einen Preis festlegt. Die meisten Teams entdecken es, wenn die Monatsendrechnung eintrifft.

Vier Möglichkeiten, damit umzugehen

1. Alte Nachrichten löschen. Behalten Sie nur die letzten N Umdrehungen bei (z. B. 5–8). Funktioniert gut für sachliche Frage-und-Antwort-Assistenten, bei denen der alte Kontext selten von Bedeutung ist. Günstigste Lösung, an einem Nachmittag implementiert. Kompromiss: Das Modell vergisst den frühen Kontext.

2. Komprimieren Sie mit einer Zusammenfassung. Rufen Sie das Modell alle 5–10 Runden einmal an, um das bisherige Gespräch zusammenzufassen. Ersetzen Sie den Rohverlauf durch die Zusammenfassung. Kosten: ein zusätzlicher Anruf pro N Runden. Vorteil: Der Verlaufsaufwand bleibt unabhängig von der Gesprächslänge nahezu gleich.

3. Schiebefenster mit semantischer Filterung. Behalten Sie stets die letzten Abzweigungen bei und schließen Sie mithilfe von Einbettungen selektiv nur semantisch relevante ältere Abzweigungen ein. Komplexer, aber der Schlüsselkontext bleibt ohne volle Verlaufskosten erhalten. Für Support- oder Forschungsassistenten lohnt sich die Implementierung in großem Maßstab.

4. Sofortiges Caching. Wenn Sie bei Claude und Gemini die statische Systemeingabeaufforderung als zwischenspeicherbar markieren, erhalten Sie 50–90 % Rabatt auf diesen Teil. Hilft nicht bei der wachsenden Historie (die immer einzigartig ist), reduziert aber den festen Overhead. Bei 0,0050 US-Dollar aus einer 1.000-Token-Systemaufforderung pro Anruf spart die Zwischenspeicherung etwa 0,0045 US-Dollar pro Runde – sinnvoll über Millionen von Anrufen hinweg. Siehe die Rechner für schnelle Caching-Einsparungen.

Die praktische Basis

Die meisten Produktions-Chatbots sollten ein rollierendes Fenster von 6–10 Runden plus einen Komprimierungsdurchlauf bei einem bestimmten Schwellenwert verwenden. „Gesamten Verlauf für immer senden“ ist eine sinnvolle Standardeinstellung für Prototypen. Es handelt sich um einen teuren Produktionsausfall.

Geben Sie Ihre eigenen Zahlen ein Kostenrechner für den Gesprächsverlauf um genau zu sehen, wo sich Ihre Kosten über die einzelnen Runden hinweg bewegen, Modelle zu vergleichen und Komprimierungseinsparungen abzuschätzen. Der Unterschied zwischen einer 30-Turn-Historie und einem 5-Turn-Fenster besteht oft in 60–70 % geringeren Kosten bei gleichem Produkterlebnis.

FAQ

Warum kostet jede Chatbot-Nachricht mehr als die letzte?

Bei jedem API-Aufruf wird der gesamte Konversationsverlauf als Eingabetoken erneut gesendet. Bei jeder Runde werden die Benutzernachricht und die Antwort des Assistenten zu allem, was folgt, hinzugefügt – die Eingabegröße wächst also linear mit der Anzahl der Runden.

Wie verhindere ich, dass die Gesprächskosten explodieren?

Die praktischste Lösung ist ein rollierendes Fenster: Behalten Sie nur die letzten 5–10 Runden statt des gesamten Verlaufs. Für Assistenten, bei denen der Kontext wichtig ist, können Sie durch regelmäßige Zusammenfassungen alte Wendungen in einem kurzen Absatz komprimieren und so die Kosten niedrig halten. Benutzen Sie die Kostenrechner für den Gesprächsverlauf um die Einsparungen zu modellieren.

Hilft sofortiges Caching bei den Kosten für den Gesprächsverlauf?

Nur für den statischen Teil (Systemeingabeaufforderung, Tooldefinitionen). Der wachsende Verlauf ist pro Konversation eindeutig und kann daher nicht zwischengespeichert werden. Caching trägt dazu bei, den festen Overhead zu reduzieren – den variablen Verlaufsteil, für den Sie unabhängig davon bezahlen.

Wie hoch sind die Gesamtkosten für ein 30-Runden-Chatbot-Gespräch?

Mit GPT-4o zu 5 $/15 $ pro 1 Mio. Token, einer Systemaufforderung mit 1.000 Token, Benutzerrunden mit 150 Token und Assistentenantworten mit 200 Token: insgesamt etwa 1,02 $. Der erste Zug kostet 0,009 $, der letzte kostet 0,060 $ – fast siebenmal mehr.

Referenzzahlen basieren auf den GPT-4o-Preisen, Juni 2026 – überprüfen Sie die aktuellen Tarife auf der Preisseite des Anbieters.

Stellen Sie Ihr Chatbot-Projekt bereit

DigitalOcean – 200 $ kostenloses Guthaben → Hostinger VPS →