Veröffentlicht am 30. Juli 2026 · Referenzpreise, vor der Budgetierung überprüfen
Öffnen Sie das Preisblatt und o3 und GPT-4.1 sehen identisch aus: beide 2,00 $ rein, 8,00 $ raus pro Million Token. Also habe ich bei beiden den gleichen Extraktionsauftrag durchgeführt und die gleiche Rechnung erwartet. o3 kam zurück 4,3× teurer. Gleiche Eingabe, gleiche sichtbare Antwort, gleiche Rate pro Token. Die Lücke ist ein Einzelposten, den die meisten Leute nie auf der Preisseite sehen: Reasoning-Tokens.
Argumentationsmodelle (o1, o3, o4-mini von OpenAI und die Argumentationsmodi von GPT-5) führen nicht direkt zu einer Antwort. Sie generieren zunächst eine private Gedankenkette und dann eine kurze sichtbare Antwort. Sie sehen die Kette nie – aber Sie zahlen für jedes Token davon Ausgabe rate. On a task where the model returns 400 visible tokens, it can quietly burn another 2,000 reasoning tokens behind the scenes. Your bill is computed on 2,400 output tokens, not 400.
Das ist der ganze Trick. Der Aufkleberpreis ist ehrlich; es beschreibt lediglich den Preis von Token, und Argumentationsmodelle geben weitaus mehr von der teuren Art ab.
| Modell | Eingang | Ausgabe | Typ |
|---|---|---|---|
| GPT-4.1 | $2.00 | $8.00 | Standard |
| o3 | $2.00 | $8.00 | Argumentation |
| o4-mini billiger | $1.10 | $4.40 | Argumentation |
| o1 | $15.00 | $60.00 | Argumentation |
| GPT-5 | $1.25 | $10.00 | Hybrid |
Nehmen Sie eine real geformte Arbeitsbelastung: 1.000 Anfragen/Tag, jeweils 800 Eingabe-Tokens und 400 sichtbare Ausgabe-Tokens. Führen Sie es einen Monat lang aus (30.000 Anfragen, 24 Millionen Eingabetokens, 12 Millionen sichtbare Ausgabetokens). Fügen Sie nun den versteckten Teil hinzu. In meinen eigenen O-Serie-Läufen landet eine mittelschwere Aufgabe 1.500–2.500 Argumentationsmarken; Ich verwende hier 2.000, wodurch zusätzlich zu den sichtbaren 12 Millionen 60 Millionen in Rechnung gestellte Ausgabetokens hinzukommen.
| Modell | Begründungs-Tokens/Anforderung | Kosten/Monat |
|---|---|---|
| GPT-4.1 (keine Begründung) | 0 | $144 |
| o4-mini | ~2.000 | $343 |
| o3 | ~2.000 | $624 |
GPT-4.1 und o3 teilen sich ein Preisblatt, jedoch rechnet o3 ab 624 $ gegenüber 144 $ – weil 72 Millionen Ausgabe-Tokens (12 Millionen sichtbar + 60 Millionen Argumente) durch den 8-Dollar-Zähler laufen statt 12 Millionen. o4-mini ist die vernünftige Mitte: billiger pro Token, zahlt immer noch die Argumentationssteuer, sodass es bei 343 $ landet – mehr als das Doppelte eines Modells ohne Argumentation, das die gleiche sichtbare Arbeit leistet.
OpenAI enthüllt a reasoning_effort Parameter (minimal / niedrig / mittel / hoch). Es ist der größte Knopf auf dieser Rechnung, und der meiste Code belässt ihn auf der Standardeinstellung. Senken Sie o3 von etwa 2.000 Argumentationstokens auf etwa 400 und derselbe Monat vergeht 624 bis 240 US-Dollar. Gleiches Modell, gleiche Aufgabe, ein Parameter – ein Schnitt von 62 %. Bei allem, was nicht wirklich ein schwieriges mehrstufiges Problem ist, besteht in der Regel ein geringer oder minimaler Aufwand die Prüfung und löscht stillschweigend den Großteil der Steuer.
1. Greifen Sie nicht reflexartig zu einem Argumentationsmodell. Extraktion, Klassifizierung, Tagging, Weiterleitung und kurze Zusammenfassungen erfordern keine Gedankenkette. Ein Standardmodell zum gleichen Aufkleberpreis kostet ein Viertel so viel, da es keine Denkmarken ausgibt.
2. Wenn ich eine Begründung brauche, setze ich ein reasoning_effort ausdrücklich und beginnen Sie niedrig und eskalieren Sie erst, wenn eine Bewertung beweist, dass die Antwortqualität abnimmt.
3. Ich habe das gelesen completion_tokens_details Feld. Die API-Antwort wird aufgeteilt reasoning_tokens separat – dort versickert das Geld, und es ist in einem mentalen Modell „Es wurden 400 Token pro Anfrage zurückgegeben“ unsichtbar.
4. Ich route. Billige Aufgabe → Standard-Kleinmodell. Schwierige Aufgabe → Argumentationsmodell bei gemessenem Aufwand. Ein einfacher Router amortisiert sich innerhalb weniger Tage; siehe die Zahlen in der Rechner für LLM-Kaskadeneinsparungen.
Möchten Sie die genaue Anzahl für Ihren Token-Mix? Setzen Sie Ihre Eingabe, sichtbare Ausgabe Und eine realistische Begründungs-Token-Schätzung in die KI-API-Kostenrechner →, oder vergleichen Sie Anbieter direkt im Chatbot-Kostenrechner. Neu bei der Token-Preisgestaltung? Beginnen Sie bei Erfahren Sie, wie die API-Preisgestaltung funktioniert.
Referenzschätzungen, Juli 2026. Die Anzahl der Reasoning-Token ist arbeitslastabhängig und stammt aus unseren eigenen Läufen, nicht aus Anbieterzahlen – messen Sie Ihre. Nicht mit OpenAI verbunden.