Der Grenzpreisverfall, visualisiert
Eingabepreis pro 1 Mio. Token für das beste allgemein verfügbare „Frontier-Class“-Modell zu jedem Datum. Gleiche Leistungsstufe im Abstand von drei Jahren.
Nicht das gleiche Modell – das gleiche Klasse der Fähigkeit. Diese Unterscheidung ist die ganze Geschichte: Modelle werden nicht billiger, Leistungsstufen schon, da neuere Modelle die Grenzen von gestern zur Ware machen.
Zeitleiste aller wichtigen Preisereignisse
Der Preis, der „teure KI“ definiert. Eine einzige intensive Chat-Sitzung könnte Dollar kosten. GPT-3.5 Turbo war mit 2 $/2 $ das volumenstarke Arbeitstier.
Anthropic unterbietet GPT-4 mit einem 100.000-Kontextfenster um ~60 % – der erste echte Preisdruck im Grenzbereich.
OpenAIs erster großer Schnitt. Schneller, 128.000 Kontext und ein Drittel des Preises. Das Muster ist vorgegeben: Jede Generation liefert besser Und günstiger.
Das dreistufige Menü wird zur Branchenvorlage. Haiku für 0,25 US-Dollar macht Workloads im Wert von Millionen Token lässig; Opus steckt die Prämienobergrenze ab.
Nahezu grenzwertige Qualität, zwei Größenordnungen unter dem Einführungspreis von GPT-4. Löst einen sofortigen Preiskampf unter chinesischen Anbietern aus (Alibaba, ByteDance kürzen innerhalb weniger Tage) und setzt die Bedeutung von „billig“ dauerhaft zurück.
Die Hälfte des Turbo-Preises, inklusive Multimodalität. Der Frontier-Input ist jetzt sechsmal günstiger als 14 Monate zuvor.
Besser als GPT-3.5 Turbo zu weniger als einem Drittel seines Preises. Die „Budgetstufe“ übertrifft nun bei den meisten Aufgaben die Grenze von 2023.
Zweite Halbierung in vier Monaten. Der Frontier-Input ist seit dem Start von GPT-4 – 17 Monate – um das Zwölffache gesunken.
Gemini 1.5 Flash fällt von 0,35 $ auf 0,075 $ Input; 1.5 Pro von 3,50 $ bis 1,25 $. Google erwirbt Marktanteile mit den stärksten nachhaltigen Kürzungen aller großen Anbieter.
Das Gegenbeispiel, an das man sich erinnern sollte: Anthropic hat den Preis des neuen Haiku um das 3,2-Fache über dem seines Vorgängers angesetzt und argumentiert, dass die Leistungsfähigkeit dies rechtfertige. Deflation ist ein Trend, kein Gesetz – Budgetstufen können und werden nach oben korrigiert, wenn ein Modell zu viel liefert.
Argumentationsmodelle setzen die Obergrenze neu – und führen unsichtbare „Denk-Token“-Kosten ein, bei denen Sie für eine Gedankenkette bezahlen, die Sie nie sehen. Zu den Preisen von 2023 entsteht eine neue Premiumstufe.
Der zweite DeepSeek-Schock: Argumentation der O1-Klasse zu einem Bruchteil des Preises, Gewichte offen. Verringert kurzzeitig etwa 600 Milliarden US-Dollar an Nvidias Marktkapitalisierung – in dem Moment, in dem die Märkte diese Schlussfolgerung eingepreist hatten, wurde es günstiger.
Der größte einzelne prozentuale Rückgang bei einem Flaggschiff-Argumentationsmodell – o3 fällt über Nacht auf 2 $/8 $, unterbietet damit sein eigenes kleineres Geschwistermodell und bestätigt, dass die Reasoning-Stufe der gleichen Deflationskurve folgt, nur schneller.
Die von Together, Fireworks, Groq und DeepInfra bereitgestellten Llama-4-Klasse-, Qwen- und DeepSeek-Modelle bringen die GPT-4-Level-Fähigkeit unter 1 US-Dollar pro Million Token. Geschlossene Frontier-Modelle (GPT-5,5 für 5 US-Dollar, Claude-Opus-Stufe) bieten Premium-Preise – aber der Abstand, den sie rechtfertigen müssen, wird immer größer.
Was die Daten aus drei Jahren tatsächlich aussagen
1. Fähigkeitsstufen verringern sich um etwa das Zehnfache pro Jahr; Einzelne Modelle werden selten günstiger. Der Listenpreis des GPT-4o wurde zweimal gesenkt, aber der größere Mechanismus ist ein Ersatz: Das neue Modell wird auf der niedrigeren Stufe des alten Modells ausgeliefert. Budget für die Stufe, nicht den Modellnamen.
2. Die Outputpreise fallen langsamer als die Inputpreise. Der GPT-4-Startoutput war doppelt so hoch wie der Input (60 $ vs. 30 $); Heutzutage sind 4–5-fache Verhältnisse Standard (GPT-4o: 10 $ vs. 2,50 $). Anbieter schützen die Marge bei der Erzeugung. Wenn Ihre Arbeitslast ausgabeintensiv ist – lange Antworten, Codegenerierung – ist Ihre effektive Deflation deutlich langsamer, als die Schlagzeilen vermuten lassen.
3. Es kommt zu Preiserhöhungen. Claude 3,5 Haiku (+220 %) ist das berühmteste. Wenn ein „kleines“ Modell mit einem Mittelklassemodell vergleichbar ist, richtet sich sein Preis nach der Leistungsfähigkeit und nicht nach der Abstammung. Gehen Sie niemals davon aus, dass die günstige Variante auch weiterhin günstig ist.
4. Erschütterungen kommen von außen. Beide diskontinuierlichen Drops (Mai 2024, Januar 2025) kamen von DeepSeek, nicht von der etablierten Konkurrenz. Die nächste Neupreisgestaltung kommt wahrscheinlich auch von irgendwoher Unerwartetes – was für eine anbieterunabhängige Installation gegenüber einer tiefen Integration einzelner Anbieter spricht.
Was das für Ihr Budget bedeutet
Ermäßigung langfristiger Prognosen. Eine Funktion, die heute bei API-Aufrufen 10.000 $/Monat kostet, kostet in 18 Monaten bei gleicher Qualität plausibel 1–3.000 $/Monat. Ökonomische KI-Einheiten, die marginal erscheinen, funktionieren heute oft gut auf der Deflationskurve – und feste Jahresverträge zu den heutigen Zinssätzen bekämpfen diese Kurve.
Vierteljährlich neu einkaufen. Der Vergleichstabelle mit über 300 Modellen ordnet jedes Modell anhand Ihres tatsächlichen Token-Mix neu. Bei „Fünfzehn Minuten pro Quartal“ werden regelmäßig Einsparungen von 30–60 % durch den Wechsel um eine Workload-Stufe erzielt. Der Preisnachlass-Sparrechner Preise genau das, was eine Migration wert ist.
Route nach Schwierigkeitsgrad. Die 100-fache Spanne zwischen Rohstoffpreisen und Grenzpreisen ist die Chance: Die meisten Produktionsabfragen benötigen keinen Grenzpreis. Der Modell-Routing-Rechner zeigt die Berechnung der Mischkosten.