HomeBlog › Kosten für 100.000 Support-Chats

Was 100.000 Kundensupport-Chats mit verschiedenen LLMs kosten

Veröffentlicht am 15. Juli 2026 · Referenzpreise, vor der Budgetierung überprüfen

„Wie viel wird unser Chatbot zur KI-Unterstützung kosten?“ ist eine der häufigsten Fragen, die wir sehen. Die Antwort variiert je nach Modell um das 23-Fache – und wächst mit zunehmendem Gesprächsverlauf schneller als erwartet.

Die Annahmen

Es handelt sich hierbei um realistische Durchschnittswerte. Ihre tatsächliche Token-Nutzung hängt von der Länge der Systemaufforderung, dem FAQ-Kontext, der Eskalationsrichtlinie und der Häufigkeit der Zusammenfassung des Verlaufs ab.

Kosten pro Chat und monatlicher Gesamtbetrag

Modell$/1 Mio. in$/1 Mio. ausgegebenKosten pro Chat100.000 Chats/MonatJährlich
Gemini 2.0 Flash$0.10$0.40$0.0043$432$5,184
GPT-4o mini$0.15$0.60$0.0065$648$7,776
Claude Haiku 4.5$0.80$4.00$0.0374$3,744$44,928
GPT-4o$2.50$10.00$0.1013$10,125$121,500
Claude Sonett 4$3.00$15.00$0.1258$12,576$150,912
Zwillinge Flash/Monat
$432
GPT-4o/Monat
$10,125
Unterschied
23×
Jährliche Flash-Einsparung im Vergleich zu GPT-4o
116.000 $

Der Effekt des Gesprächsverlaufs

Hier gehen die meisten Kostenschätzungen für Chatbots schief. Sie modellieren die Kosten pro Nachricht bei einer festen Token-Anzahl – aber in Wirklichkeit trägt jede Nachricht den vollständigen Verlauf.

Nachricht #Eingabe-Tokens (inkl. Verlauf)AusgabetokenFlash-KostenGPT-4o-Kosten
1550280$0.000167$0.00418
2900280$0.000202$0.00505
41,400280$0.000252$0.00630
61,950280$0.000307$0.00768
8 (endgültig)2,500280$0.000362$0.00905
Gesamt (8 Nachrichten)~10.800~2.240$0.0043$0.101
Nachricht 8 kostet 2,2× mehr als Nachricht 1 auf jedem Modell – rein aus der Kontextakkumulation. Bei langen Supportabläufen (Zurücksetzen des Passworts + Kontosuche + Bestellverlauf = 15+ Nachrichten) steigen die Kosten weiter. Ein Chat mit 15 Nachrichten auf GPT-4o kostet etwa 0,22 US-Dollar pro Konversation.

Drei Hebel zur Kostensenkung

1. Modellrouting (größter Hebel)

Nicht alle Supportanfragen benötigen dasselbe Modell. Leiten Sie Abfragen an verschiedene Ebenen weiter:

Ein einfacher Absichtsklassifizierer (selbst günstig – Flash kostet etwa 0,002 US-Dollar pro Routing-Anruf) kann bestimmen, welche Ebene die einzelnen Konversationen abwickelt.

2. Zusammenfassung des Gesprächs

Anstatt das vollständige Transkript in jede Nachricht aufzunehmen, fassen Sie die Konversation nach Nachricht 4 zusammen und übergeben Sie eine komprimierte Zusammenfassung (≈200 Token) für Nachrichten ab 5. Dadurch bleibt der Kontext stabil und wächst nicht linear.

Wirkung: Reduziert den durchschnittlichen Input pro Nachricht von 1.350 auf ~600 Token – eine Reduzierung der Inputkosten um 55 %. Auf GPT-4o: 10.125 $ → ~5.400 $/Monat.

3. Sofortiges Caching

Ihre Systemaufforderung und Ihr FAQ-Kontext (400 Token in unserem Modell) werden in jeder einzelnen Nachricht wiederholt. Sowohl Anthropic als auch OpenAI bieten sofortiges Caching – wiederholte Präfix-Tokens werden nach der ersten Anfrage mit 10–50 % des normalen Tarifs in Rechnung gestellt.

Wenn Ihre Systemaufforderung 1.000 Token umfasst und Sie sie zwischenspeichern, sparen Sie bei allen nachfolgenden Nachrichten 90 % dieser 1.000 Token. Bei 100.000 Chats × 8 Nachrichten = 800.000 Nachrichten sind das 800 Mio. Token × 0,10 $/1 Mio. × 90 % = 72 $/Monat allein durch Flash gespart. Bei GPT-4o ist die Ersparnis in absoluten Zahlen größer.

Was das für Ihr Budget bedeutet

SkalaBlitzGemischt (Routing)GPT-4o
10.000 Chats/Monat (Startup)$43$164$1,013
100.000 Chats/Monat (Wachstum)$432$1,639$10,125
500.000 Chats/Monat (Skala)$2,160$8,195$50,625
1 Mio. Chats/Monat (Unternehmen)$4,320$16,390$101,250

Bei 1 Million Chats/Monat beträgt der Unterschied zwischen Flash und GPT-4o 97.000 US-Dollar/Monat – 1,16 Millionen US-Dollar pro Jahr. Auch wenn Flash 15 % mehr Eskalationen an menschliche Agenten erfordert, begünstigt die Rechnung fast immer die günstigere Modellstufe.

Ist die Qualität bei Flash gut genug?

Das ist die eigentliche Frage, und sie hängt ganz von Ihrem Anwendungsfall ab. Für FAQ-Beantwortung, Bestellstatus, Rückgabebedingungen, Versandinformationen — Flash schneidet in kontrollierten Auswertungen vergleichbar mit GPT-4o ab. Für differenzierte Beschwerdebearbeitung, mehrstufige Fehlerbehebung oder Situationen, die echte Überlegungen zu Randfällen erfordern — Grenzmodelle haben einen messbaren Vorteil.

Der praktische Ansatz: Führen Sie Flash 30 Tage lang aus, messen Sie die Eskalationsrate und den CSAT und vergleichen Sie sie dann mit Ihrem Ausgangswert. Wenn der CSAT um < 1 Punkt sinkt und die Eskalation um < 5 % ansteigt, ist der Modellwechsel durch die Kosteneinsparung gerechtfertigt.

Referenzpreise, Juli 2026. Hierbei wird von öffentlichen Standardtarifen ausgegangen – die Unternehmenspreise können abweichen. Überprüfen Sie auf LLM-Preisvergleich oder auf der Preisseite des Anbieters. Fehler gefunden? Melde es →

FAQ

Wie viel kostet ein KI-Kundensupport-Chatbot pro Monat?

Bei 100.000 Chats/Monat mit durchschnittlich 8 Nachrichten: Gemini Flash ~432 $, GPT-4o mini ~648 $, Claude Haiku ~3.744 $, GPT-4o ~10.125 $. Die Modellwahl ist der größte Kostenhebel.

Warum macht der Gesprächsverlauf Chatbots teuer?

Jede Nachricht enthält den vollständigen Verlauf als Eingabetoken. Nachricht 1 kostet ca. 400 Eingabe-Tokens; Nachricht 8 kostet ca. 2.500 – eine 6-fache Steigerung bei gleicher Leistung. Ohne Konversationszusammenfassung steigen die Kosten linear mit der Chatlänge.

Ist Gemini Flash gut genug für den Kundensupport?

Für die Beantwortung häufig gestellter Fragen, den Bestellstatus und Fragen zu Richtlinien – normalerweise ja. Für eine differenzierte Beschwerdebearbeitung oder komplexe Fehlerbehebung: Benchmark zuerst. Viele Teams betreiben Flash für 60–70 % des Volumens und eskalieren für Randfälle auf ein Grenzmodell.

Wie reduziere ich die Kosten für KI-Chatbots?

Drei Haupthebel: (1) Modellrouting – verwenden Sie Flash für einfache Abfragen, GPT-4o nur für komplexe; (2) Konversationszusammenfassung – komprimieren Sie den alten Verlauf in ~200 Token; (3) Prompt-Caching – sowohl Anthropic als auch OpenAI bieten 50–90 % Rabatt auf wiederholte Prompt-Präfixe.