HomeBlog › Die Reasoning-Token-Steuer

Die Reasoning-Token-Steuer: Warum o3 bei gleichem Aufkleberpreis 4× GPT-4.1 kostet

Veröffentlicht am 30. Juli 2026 · Referenzpreise, vor der Budgetierung überprüfen

Öffnen Sie das Preisblatt und o3 und GPT-4.1 sehen identisch aus: beide 2,00 $ rein, 8,00 $ raus pro Million Token. Also habe ich bei beiden den gleichen Extraktionsauftrag durchgeführt und die gleiche Rechnung erwartet. o3 kam zurück 4,3× teurer. Gleiche Eingabe, gleiche sichtbare Antwort, gleiche Rate pro Token. Die Lücke ist ein Einzelposten, den die meisten Leute nie auf der Preisseite sehen: Reasoning-Tokens.

Reasoning-Tokens werden in Rechnung gestellt, und zwar als Ausgabe

Argumentationsmodelle (o1, o3, o4-mini von OpenAI und die Argumentationsmodi von GPT-5) führen nicht direkt zu einer Antwort. Sie generieren zunächst eine private Gedankenkette und dann eine kurze sichtbare Antwort. Sie sehen die Kette nie – aber Sie zahlen für jedes Token davon Ausgabe rate. On a task where the model returns 400 visible tokens, it can quietly burn another 2,000 reasoning tokens behind the scenes. Your bill is computed on 2,400 output tokens, not 400.

Das ist der ganze Trick. Der Aufkleberpreis ist ehrlich; es beschreibt lediglich den Preis von Token, und Argumentationsmodelle geben weitaus mehr von der teuren Art ab.

Die Hauptpreise ($ pro 1 Mio. Token)

ModellEingangAusgabeTyp
GPT-4.1$2.00$8.00Standard
o3$2.00$8.00Argumentation
o4-mini billiger$1.10$4.40Argumentation
o1$15.00$60.00Argumentation
GPT-5$1.25$10.00Hybrid
⚠️ Referenzpreise, Juli 2026. Überprüfen Sie immer auf der Seite des Anbieters. Probieren Sie Ihre eigenen Zahlen im aus Kostenrechner. · Veralteten Preis melden →

Die konkrete Mathematik

Nehmen Sie eine real geformte Arbeitsbelastung: 1.000 Anfragen/Tag, jeweils 800 Eingabe-Tokens und 400 sichtbare Ausgabe-Tokens. Führen Sie es einen Monat lang aus (30.000 Anfragen, 24 Millionen Eingabetokens, 12 Millionen sichtbare Ausgabetokens). Fügen Sie nun den versteckten Teil hinzu. In meinen eigenen O-Serie-Läufen landet eine mittelschwere Aufgabe 1.500–2.500 Argumentationsmarken; Ich verwende hier 2.000, wodurch zusätzlich zu den sichtbaren 12 Millionen 60 Millionen in Rechnung gestellte Ausgabetokens hinzukommen.

ModellBegründungs-Tokens/AnforderungKosten/Monat
GPT-4.1 (keine Begründung)0$144
o4-mini~2.000$343
o3~2.000$624

GPT-4.1 und o3 teilen sich ein Preisblatt, jedoch rechnet o3 ab 624 $ gegenüber 144 $ – weil 72 Millionen Ausgabe-Tokens (12 Millionen sichtbar + 60 Millionen Argumente) durch den 8-Dollar-Zähler laufen statt 12 Millionen. o4-mini ist die vernünftige Mitte: billiger pro Token, zahlt immer noch die Argumentationssteuer, sodass es bei 343 $ landet – mehr als das Doppelte eines Modells ohne Argumentation, das die gleiche sichtbare Arbeit leistet.

Der Hebel, den niemand setzt: reasoning_effort

OpenAI enthüllt a reasoning_effort Parameter (minimal / niedrig / mittel / hoch). Es ist der größte Knopf auf dieser Rechnung, und der meiste Code belässt ihn auf der Standardeinstellung. Senken Sie o3 von etwa 2.000 Argumentationstokens auf etwa 400 und derselbe Monat vergeht 624 bis 240 US-Dollar. Gleiches Modell, gleiche Aufgabe, ein Parameter – ein Schnitt von 62 %. Bei allem, was nicht wirklich ein schwieriges mehrstufiges Problem ist, besteht in der Regel ein geringer oder minimaler Aufwand die Prüfung und löscht stillschweigend den Großteil der Steuer.

Was ich jetzt eigentlich mache

1. Greifen Sie nicht reflexartig zu einem Argumentationsmodell. Extraktion, Klassifizierung, Tagging, Weiterleitung und kurze Zusammenfassungen erfordern keine Gedankenkette. Ein Standardmodell zum gleichen Aufkleberpreis kostet ein Viertel so viel, da es keine Denkmarken ausgibt.

2. Wenn ich eine Begründung brauche, setze ich ein reasoning_effort ausdrücklich und beginnen Sie niedrig und eskalieren Sie erst, wenn eine Bewertung beweist, dass die Antwortqualität abnimmt.

3. Ich habe das gelesen completion_tokens_details Feld. Die API-Antwort wird aufgeteilt reasoning_tokens separat – dort versickert das Geld, und es ist in einem mentalen Modell „Es wurden 400 Token pro Anfrage zurückgegeben“ unsichtbar.

4. Ich route. Billige Aufgabe → Standard-Kleinmodell. Schwierige Aufgabe → Argumentationsmodell bei gemessenem Aufwand. Ein einfacher Router amortisiert sich innerhalb weniger Tage; siehe die Zahlen in der Rechner für LLM-Kaskadeneinsparungen.

Möchten Sie die genaue Anzahl für Ihren Token-Mix? Setzen Sie Ihre Eingabe, sichtbare Ausgabe Und eine realistische Begründungs-Token-Schätzung in die KI-API-Kostenrechner →, oder vergleichen Sie Anbieter direkt im Chatbot-Kostenrechner. Neu bei der Token-Preisgestaltung? Beginnen Sie bei Erfahren Sie, wie die API-Preisgestaltung funktioniert.

Referenzschätzungen, Juli 2026. Die Anzahl der Reasoning-Token ist arbeitslastabhängig und stammt aus unseren eigenen Läufen, nicht aus Anbieterzahlen – messen Sie Ihre. Nicht mit OpenAI verbunden.