Veröffentlicht am 15. Juli 2026 · Referenzpreise, vor der Budgetierung überprüfen
„Wie viel wird unser Chatbot zur KI-Unterstützung kosten?“ ist eine der häufigsten Fragen, die wir sehen. Die Antwort variiert je nach Modell um das 23-Fache – und wächst mit zunehmendem Gesprächsverlauf schneller als erwartet.
| Modell | $/1 Mio. in | $/1 Mio. ausgegeben | Kosten pro Chat | 100.000 Chats/Monat | Jährlich |
|---|---|---|---|---|---|
| Gemini 2.0 Flash | $0.10 | $0.40 | $0.0043 | $432 | $5,184 |
| GPT-4o mini | $0.15 | $0.60 | $0.0065 | $648 | $7,776 |
| Claude Haiku 4.5 | $0.80 | $4.00 | $0.0374 | $3,744 | $44,928 |
| GPT-4o | $2.50 | $10.00 | $0.1013 | $10,125 | $121,500 |
| Claude Sonett 4 | $3.00 | $15.00 | $0.1258 | $12,576 | $150,912 |
Hier gehen die meisten Kostenschätzungen für Chatbots schief. Sie modellieren die Kosten pro Nachricht bei einer festen Token-Anzahl – aber in Wirklichkeit trägt jede Nachricht den vollständigen Verlauf.
| Nachricht # | Eingabe-Tokens (inkl. Verlauf) | Ausgabetoken | Flash-Kosten | GPT-4o-Kosten |
|---|---|---|---|---|
| 1 | 550 | 280 | $0.000167 | $0.00418 |
| 2 | 900 | 280 | $0.000202 | $0.00505 |
| 4 | 1,400 | 280 | $0.000252 | $0.00630 |
| 6 | 1,950 | 280 | $0.000307 | $0.00768 |
| 8 (endgültig) | 2,500 | 280 | $0.000362 | $0.00905 |
| Gesamt (8 Nachrichten) | ~10.800 | ~2.240 | $0.0043 | $0.101 |
Nicht alle Supportanfragen benötigen dasselbe Modell. Leiten Sie Abfragen an verschiedene Ebenen weiter:
Ein einfacher Absichtsklassifizierer (selbst günstig – Flash kostet etwa 0,002 US-Dollar pro Routing-Anruf) kann bestimmen, welche Ebene die einzelnen Konversationen abwickelt.
Anstatt das vollständige Transkript in jede Nachricht aufzunehmen, fassen Sie die Konversation nach Nachricht 4 zusammen und übergeben Sie eine komprimierte Zusammenfassung (≈200 Token) für Nachrichten ab 5. Dadurch bleibt der Kontext stabil und wächst nicht linear.
Wirkung: Reduziert den durchschnittlichen Input pro Nachricht von 1.350 auf ~600 Token – eine Reduzierung der Inputkosten um 55 %. Auf GPT-4o: 10.125 $ → ~5.400 $/Monat.
Ihre Systemaufforderung und Ihr FAQ-Kontext (400 Token in unserem Modell) werden in jeder einzelnen Nachricht wiederholt. Sowohl Anthropic als auch OpenAI bieten sofortiges Caching – wiederholte Präfix-Tokens werden nach der ersten Anfrage mit 10–50 % des normalen Tarifs in Rechnung gestellt.
Wenn Ihre Systemaufforderung 1.000 Token umfasst und Sie sie zwischenspeichern, sparen Sie bei allen nachfolgenden Nachrichten 90 % dieser 1.000 Token. Bei 100.000 Chats × 8 Nachrichten = 800.000 Nachrichten sind das 800 Mio. Token × 0,10 $/1 Mio. × 90 % = 72 $/Monat allein durch Flash gespart. Bei GPT-4o ist die Ersparnis in absoluten Zahlen größer.
| Skala | Blitz | Gemischt (Routing) | GPT-4o |
|---|---|---|---|
| 10.000 Chats/Monat (Startup) | $43 | $164 | $1,013 |
| 100.000 Chats/Monat (Wachstum) | $432 | $1,639 | $10,125 |
| 500.000 Chats/Monat (Skala) | $2,160 | $8,195 | $50,625 |
| 1 Mio. Chats/Monat (Unternehmen) | $4,320 | $16,390 | $101,250 |
Bei 1 Million Chats/Monat beträgt der Unterschied zwischen Flash und GPT-4o 97.000 US-Dollar/Monat – 1,16 Millionen US-Dollar pro Jahr. Auch wenn Flash 15 % mehr Eskalationen an menschliche Agenten erfordert, begünstigt die Rechnung fast immer die günstigere Modellstufe.
Das ist die eigentliche Frage, und sie hängt ganz von Ihrem Anwendungsfall ab. Für FAQ-Beantwortung, Bestellstatus, Rückgabebedingungen, Versandinformationen — Flash schneidet in kontrollierten Auswertungen vergleichbar mit GPT-4o ab. Für differenzierte Beschwerdebearbeitung, mehrstufige Fehlerbehebung oder Situationen, die echte Überlegungen zu Randfällen erfordern — Grenzmodelle haben einen messbaren Vorteil.
Der praktische Ansatz: Führen Sie Flash 30 Tage lang aus, messen Sie die Eskalationsrate und den CSAT und vergleichen Sie sie dann mit Ihrem Ausgangswert. Wenn der CSAT um < 1 Punkt sinkt und die Eskalation um < 5 % ansteigt, ist der Modellwechsel durch die Kosteneinsparung gerechtfertigt.
Bei 100.000 Chats/Monat mit durchschnittlich 8 Nachrichten: Gemini Flash ~432 $, GPT-4o mini ~648 $, Claude Haiku ~3.744 $, GPT-4o ~10.125 $. Die Modellwahl ist der größte Kostenhebel.
Jede Nachricht enthält den vollständigen Verlauf als Eingabetoken. Nachricht 1 kostet ca. 400 Eingabe-Tokens; Nachricht 8 kostet ca. 2.500 – eine 6-fache Steigerung bei gleicher Leistung. Ohne Konversationszusammenfassung steigen die Kosten linear mit der Chatlänge.
Für die Beantwortung häufig gestellter Fragen, den Bestellstatus und Fragen zu Richtlinien – normalerweise ja. Für eine differenzierte Beschwerdebearbeitung oder komplexe Fehlerbehebung: Benchmark zuerst. Viele Teams betreiben Flash für 60–70 % des Volumens und eskalieren für Randfälle auf ein Grenzmodell.
Drei Haupthebel: (1) Modellrouting – verwenden Sie Flash für einfache Abfragen, GPT-4o nur für komplexe; (2) Konversationszusammenfassung – komprimieren Sie den alten Verlauf in ~200 Token; (3) Prompt-Caching – sowohl Anthropic als auch OpenAI bieten 50–90 % Rabatt auf wiederholte Prompt-Präfixe.