Veröffentlicht am 10.08.2026 · Referenznummern, vor der Budgetierung überprüfen
Führen Sie den gleichen Chain-of-Thinking-Workload über o1 von OpenAI aus und es kostet das 27-fache dessen, was DeepSeek R1 kostet. Lassen Sie es stattdessen über o3 laufen – gleicher Anbieter, gleiche Argumentationsebene, gleiches „Nachdenken vor Antworten“-Verhalten – und der Abstand sinkt auf das 3,6-fache. Das ist keine Rundungsdifferenz. Das bedeutet, dass es auf die Frage „Wie viel kostet ein Argumentationsmodell im Vergleich zu einem Modell mit offener Gewichtung“ keine eindeutige Antwort gibt. Für jedes Modell, das OpenAI ausliefert, gibt es eine andere Antwort, da die eigene Argumentationspalette von OpenAI einen 7,5-fachen Bereich abdeckt, bevor Sie überhaupt außerhalb ihres Katalogs geschaut haben.
Direkt aus unserer Preistabelle entnommen (387 Modelle verfolgt, zuletzt anhand der Anbieterdokumente aktualisiert): Die vier aktuellen Argumentations-SKUs von OpenAI sowie DeepSeeks R1 und seine destillierten Varianten pro 1 Mio. Token.
| Modell | Anbieter | Eingabe /1M | Ausgabe /1M | vs. DeepSeek R1 (gemischt) |
|---|---|---|---|---|
| o1 | OpenAI | $15.00 | $60.00 | 27.4× |
| o3 | OpenAI | $2.00 | $8.00 | 3.7× |
| o4-mini / o3-mini / o1-mini | OpenAI | $1.10 | $4.40 | 2.0× |
| Grok 4 Argumentation | xAI | $3.00 | $15.00 | 6.2× |
| DeepSeek R1 | DeepSeek | $0.55 | $2.19 | 1.0× |
| DeepSeek R1 Distill Llama 70B | DeepSeek | $0.23 | $0.69 | 0.35× |
| DeepSeek R1 Destillation Qwen 32B | DeepSeek | $0.18 | $0.18 | 0.11× |
| Referenzpreise aus unserer nachverfolgten Tabelle, 387 Modelle. „vs DeepSeek R1“ verwendet ein gemischtes Eingabe-Ausgabe-Token-Verhältnis von 3:8, das dem unten aufgeführten Beispiel entspricht. Führen Sie Ihr eigenes Verhältnis aus Kostenrechner für Reasoning-Tokens. | ||||
Beachten Sie die Form dieser Kurve. Es ist keine gerade Linie von teuer nach billig – allein von o1 zu o3 handelt es sich um eine 87-prozentige Senkung des Ausgabepreises innerhalb des OpenAI-eigenen Katalogs, ohne dass ein Konkurrent beteiligt ist. Die destillierten DeepSeek-Varianten unterbieten dann sogar den vollen R1 um ein weiteres 3- bis 5-faches, bei echten Leistungsfähigkeitskosten, die in den Benchmarks ehrlich sind. Vier Punkte auf einer Tabelle, vier völlig unterschiedliche Geschichten darüber, was „die Begründungssteuer“ bedeutet.
Ein Support-Triage-Agent, der überlegt, bevor er antwortet: 1.500 Eingabe-Kontext-Tokens pro Ticket, 4.000 Ausgabe-Tokens, wenn man die versteckten Gedankenketten-Tokens mitzählt, die als Ausgabe abgerechnet werden. 10.000 Tickets pro Monat entsprechen 15 Millionen Input-Tokens und 40 Millionen Output-Tokens, ausgeführt für jedes Modell:
| Modell | Eingabekosten | Ausgabekosten | Monatliche Gesamtsumme |
|---|---|---|---|
| o1 | $225.00 | $2,400.00 | $2,625.00 |
| Grok 4 Argumentation | $45.00 | $600.00 | $645.00 |
| o3 | $30.00 | $320.00 | $350.00 |
| o4-mini | $16.50 | $176.00 | $192.50 |
| DeepSeek R1 | $8.25 | $87.60 | $95.85 |
| 10.000 Tickets/Monat × 1.500 Ein-/4.000 Aus-Token. Illustrativer Arbeitsaufwand – bewerten Sie Ihren eigenen Mix auf der Kostenrechner für Reasoning-Tokens. | |||
2.625 $ pro Monat bei o1 gegenüber 95,85 $ bei DeepSeek R1 für einen Arbeitsaufwand, der auf dem Papier von beiden Modellen dasselbe verlangt. Tauschen Sie stattdessen o1 gegen o3 und allein die OpenAI-Rechnung sinkt um 87 %, von 2.625 $ auf 350 $ – bevor DeepSeek überhaupt in den Vergleich einsteigt. Bei den meisten Horrorgeschichten über die „Begründungssteuer“, die derzeit im Umlauf sind, handelt es sich tatsächlich um O1-Preise, die aus der Zeit übernommen wurden, als es die einzige Grenzbegründungsoption war. Dies ist nicht mehr der Fall, selbst innerhalb der OpenAI-eigenen Produktpalette.
Der Preis für o1 wurde festgelegt, als Argumentations-Schlussfolgerungen rar waren und größtenteils unbewiesen waren – es landete fast an der Spitze des gesamten OpenAI-Katalogs, ob Argumentation hin oder her. o3 und o4-mini kamen, nachdem der Wettbewerb (DeepSeek R1 wurde im Januar eingeführt, die Reasoning-Stufen von Grok und Gemini folgten) die Grenzlabore dazu zwang, die Reasoning-Preise auf die gleiche Weise zu verteidigen, wie sie bereits gezwungen waren, die Flaggschiff-Chat-Preise zu verteidigen. Insbesondere die Mini-Tier-Argumentationsmodelle liegen mittlerweile nahe genug an den nicht-begründenden Mid-Tier-Preisen, sodass die Frage „Sollte ich ein Argumentationsmodell verwenden?“ für viele Workloads nicht mehr in erster Linie eine Kostenfrage ist, sondern vielmehr eine Frage nach Latenz und Gedankenkette, Token-Budget.
Was sich nicht angeglichen hat, ist die Qualität pro Dollar ganz oben. o1 und o3 sind nicht austauschbar – o3 ist das neuere, im Allgemeinen stärkere Modell zu einem Bruchteil des Preises, was ein einfaches Upgrade darstellt. DeepSeek R1 ist ein anderer Kompromiss: offene Gewichtungen, selbsthostbar und preislich ähnlich, aber in den meisten von uns zitierten Bewertungen von Drittanbietern in Bezug auf harte Argumentationsaufgaben deutlich hinter o3 rangiert. Die 27x-Zahl gegen o1 ist real und wissenswert. Es ist nicht die gleiche Behauptung wie „R1 ersetzt o3 für 27x weniger“ – dieser Vergleich liegt eher bei 3,7x und es handelt sich um einen Leistungskompromiss, nicht um ein kostenloses Upgrade.
Halten Sie sich nicht am Preis von o1 fest – es handelt sich um die mit Abstand teuerste SKU auf dem Markt und zunehmend nicht mehr um die Preisgestaltung für Teams. Verankern Sie sich auf o3 oder o4-mini als realistische OpenAI-Basislinie und entscheiden Sie dann, ob der verbleibende 2- bis 4-fache Rabatt von DeepSeek R1 den Selbsthosting- oder Drittanbieter-Inferenz-Overhead wert ist und ob der Leistungsabfall der destillierten Varianten für Ihre Aufgabe akzeptabel ist. Bepreisen Sie Ihren tatsächlichen Token-Mix – Reasoning-Workloads verzerren den Output in einer Weise, wie dies bei Chat-Workloads nicht der Fall ist, sodass das gemischte Verhältnis hier wichtiger ist als fast überall sonst im API-Kostenstapel. Führen Sie die Zahlen aus Kostenrechner für Reasoning-Tokens oder die Rechner für Argumentation-Token-Überlauf Wenn versteckte Gedankenketten-Token der Teil sind, den Sie nicht vorhersagen und sehen können die Reasoning-Token-Steuer für den Vergleich von o3 mit nicht-begründendem GPT-4.1 bei derselben Eingabeaufforderung.
Methodik: Preise aus unserer nachverfolgten Preistabelle (387 Modelle), Stand August 2026, entsprechend den veröffentlichten Tarifen jedes Anbieters pro 1 Mio. Token. Das ausgearbeitete Beispiel verwendet ein konstruiertes Token-Verhältnis von 1.500 in/4.000 out, um die Skalierung zu veranschaulichen, nicht Telemetrie aus einem Produktionssystem – bestätigen Sie den Token-Mix Ihrer eigenen Arbeitslast und die aktuelle Rate jedes Anbieters, bevor Sie eine Budgetierung vornehmen.