Veröffentlicht am 2. August 2026 · Referenzpreise aus unserem 387-Modell-Register, vor der Budgetierung überprüfen
„Einfach das kleine Modell verwenden“ lautet der übliche Kostenhinweis. Endlich habe ich in unserem gesamten Modellverzeichnis den richtigen Preis festgelegt, und der Ratschlag erweist sich für sich genommen als nahezu bedeutungslos. Durch die Herabstufung um eine Stufe innerhalb der Anthropic-Reihe sparen Sie Geld 40%. Der exakt gleiche Schritt innerhalb der Google-Produktpalette spart 96%. Gleiche Entscheidung, gleicher Entwicklungsaufwand, gänzlich unterschiedliche Auszahlung – denn der Abstand zwischen dem Flaggschiff eines Anbieters und seinem Billigmodell ist keine Konstante. Der Bereich reicht von 1,7× bis 24×.
Einen Monat, 200 Millionen Eingabe-Tokens und 40 Millionen Ausgabe-Tokens. Das sind ungefähr 250.000 Anfragen bei 800 eingehenden und 160 ausgegebenen Token – ein echtes Produkt, das Klassifizierungen, Zusammenfassungen und kurze Chat-Antworten durchführt. Kein Caching, kein Chargenrabatt, sodass die Zahlen vergleichbar bleiben. Jeder unten aufgeführte Preis stammt aus unserem nachverfolgten Register (387 Modelle, Referenzpreise für Juli–August 2026).
| Familie | Stufe | $/1 Mio. in | $/1 Mio. ausgegeben | Monat |
|---|---|---|---|---|
| OpenAI | GPT-5.5 | $5.00 | $30.00 | $2,200 |
| GPT-5 | $1.25 | $10.00 | $650 | |
| GPT-5 mini | $0.40 | $1.60 | $144 | |
| GPT-5 Nano am günstigsten | $0.10 | $0.40 | $36 | |
| Anthropisch | Claude Opus 4.8 | $5.00 | $25.00 | $2,000 |
| Claude Sonett 4.6 | $3.00 | $15.00 | $1,200 | |
| Claude Haiku 4.5 | $1.00 | $5.00 | $400 | |
| Gemini 3.1 Pro | $2.00 | $12.00 | $880 | |
| Gemini 3.1 Flash | $0.10 | $0.40 | $36 | |
| Gemini 3.1 Flash-Lite | $0.05 | $0.20 | $18 | |
| xAI | Grok 4 | $3.00 | $15.00 | $1,200 |
| Grok 4 Mini | $0.50 | $2.50 | $200 | |
| DeepSeek | DeepSeek V4 | $0.27 | $1.10 | $98 |
| DeepSeek V4 Flash | $0.14 | $0.28 | $39 | |
| Mistral | Mistral Groß | $2.00 | $6.00 | $640 |
| Mistral Klein | $0.10 | $0.30 | $32 |
Streichen Sie alles außer dem Schritt, den die meisten Teams tatsächlich in Betracht ziehen – Flaggschiff zur direkt darunter liegenden Stufe:
| Bewegen | Vorher → Nachher | Gespeichert |
|---|---|---|
| Opus 4.8 → Sonett 4.6 | 2.000 $ → 1.200 $ | 40% |
| DeepSeek V4 → V4 Flash | 98 $ → 39 $ | 60% |
| GPT-5.5 → GPT-5 | 2.200 $ → 650 $ | 70% |
| Grok 4 → Grok 4 Mini | 1.200 $ → 200 $ | 83% |
| Mistral Groß → Klein | 640 $ → 32 $ | 95% |
| Gemini 3.1 Pro → Flash | 880 $ → 36 $ | 96% |
Vierzig Prozent gegenüber sechsundneunzig Prozent. Bei beiden gilt „das kleinere Modell verwenden“. Einer davon ist einen Sprint an Evaluierungsarbeit und eine Routing-Schicht wert; Das andere ist bestenfalls einen Nachmittag wert, weil Sie mehr Ingenieurstunden damit verbringen werden, zu beweisen, dass Sonnet gut genug ist, als die 800 Dollar, die Sie sparen.
Das ist nicht so, dass Anthropic mit Rabatten geizt. Im Gegenteil: Ihr Flaggschiff ist deutlich günstiger geworden. Claude Opus 4.1 steht in unserer Registry unter $15/$75. Opus 4.5, 4.6 und 4.8 sitzen alle auf $5/$25 – ein 3-facher Schnitt an der Spitze des Sortiments ohne Änderung des Sonnet- oder Haiku-Preises. In meinem 240-Millionen-Token-Monat stieg Opus von 6.000 $ auf 2.000 $.
Der Nebeneffekt: Die Lücke zwischen Opus und Sonett schrumpfte von 5× auf 1,67×. Die Grenzsteuer bei Anthropic existierte größtenteils nicht mehr. OpenAI hat das Gleiche auf einer anderen Achse getan – o1 zu 15 $/60 $ wurde durch GPT-5 zu 1,25 $/10 $ ersetzt, sodass die für 2025 budgetierten teuren Grenzmodell-Werbebuchungen jetzt eine andere Größenordnung haben.
Google ist den umgekehrten Weg gegangen. Sie beließen den Pro-Preis bei 2 $/12 $ und reduzierten Flash-Lite auf 0,05 $/0,20 $, so dass ihre interne Verbreitung jetzt die größte aller großen Familien ist. Daran ist nichts Zufall – es ist ein Routing-Pitch.
Gemini 3.1 Flash-Kosten $36 auf dieser Arbeitsbelastung. DeepSeek V4, das ich im Geiste als „die günstige Option“ eingestuft hatte, kostet $98 – fast dreimal mehr. Und GPT-5.5 für 2.200 US-Dollar ist es 122-fache des Preises von Gemini 3.1 Flash-Lite bei 18 $ für die Bewegung des gleichen Token-Volumens.
Ich hatte ein zwei Jahre altes mentales Preisranking mit mir herumgetragen. Es war in beide Richtungen falsch. Der Ruf der Billiganbieter hinkt den tatsächlichen Preislisten um etwa ein Jahr hinterher, und die Zahlen ändern sich schneller als die Folklore.
1. Ich überprüfe den Tier-Gap, bevor ich den Router baue. Wenn Flaggschiff-zu-Mini weniger als 2× beträgt, ist eine Kaskade weder die Komplexität noch das Evaluierungsbudget wert – ich nehme das Flaggschiff und investiere den Aufwand stattdessen in sofortiges Caching, was mehr spart.
2. Wenn der Abstand 20x beträgt, route ich aggressiv. Die günstige Stufe übernimmt die Klassifizierung, Extraktion, Kennzeichnung und Weiterleitung. Das Flaggschiff sieht nur, was eine Vertrauensprüfung nicht besteht. Auf dem Google-Spread, der aus 880 US-Dollar bei einer Eskalationsrate von 10 % etwa 60 US-Dollar macht – die Rechnung ist in Ordnung Rechner für LLM-Kaskadeneinsparungen und die Sparrechner für Modellrouten.
3. Ich ändere vierteljährlich den Preis für das gesamte Sortiment. Durch die Neupreisgestaltung von Opus änderte sich, welche Optimierungen sich lohnten, und ich erfuhr dies erst Wochen später. Das ist es, was die Preisänderungs-Tracker ist vorerst.
4. Ich vergleiche nie nur anhand des Input-Preises. Bei den 97 von mir überprüften First-Party-Chat-Modellen beträgt die Ausgabe die 4-fache Eingabe und bei GPT-5.5 und Gemini 3.1 Pro die 6-fache. Ein gesprächiges Model mit einem günstigen Tarif verliert häufiger als erwartet gegen ein lapidares Model mit einem teuren Tarif. Wenn Ihre App das Modell wechselt, spielen auch die Migrationskosten eine Rolle – siehe Kostenrechner für die Modellmigration.
Legen Sie Ihren eigenen Token-Split in den KI-API-Kostenrechner →, oder modellieren Sie ein vollständiges Produkt im Kostenschätzer für KI-Apps und die Chatbot-Kostenrechner. Neu bei der Token-Preisgestaltung? Beginnen Sie bei Erfahren Sie, wie die API-Preisgestaltung funktioniert.
Referenzschätzungen, August 2026, entnommen aus unserem verfolgten Modellregister. Die Preise können ohne Vorankündigung geändert werden und schließen Caching, Mengen- und Mengenrabatte aus – erkundigen Sie sich beim Anbieter, bevor Sie ein Budget festlegen. Nicht verbunden mit OpenAI, Anthropic, Google, xAI, DeepSeek oder Mistral.