Home › Blog › Grok 4.7 200K-Token-Preisklippe

200.000-Token-Klippe von Grok 4.7: Ein zusätzliches Token verdoppelt die gesamte Rechnung

24. September 2026 · AI & LLMs · 5 Minuten Lesezeit

Jede LLM-API, die ich auf dieser Website berechnet habe, berechnet Token auf die gleiche Weise, wie ein Versorgungsunternehmen Strom abrechnet: Sie zahlen für das, was Sie verwendet haben, und der Preis für Token #1 ändert sich nicht, weil Sie auch Token #500.000 verwendet haben. Grok 4.6 und Grok 4.7 funktionieren so nicht. Ich habe die eigenen Preisdokumente von xAI (docs.x.ai/developers/pricing) gezogen und einen Schwellenwert gefunden: In dem Moment, in dem eine Aufforderung 200.000 Token erreicht, berechnet xAI die zusätzlichen Token nicht zu einem höheren Preis — es klassifiziert die Produktinformationen anfrage-, Eingabe- und Ausgabe- sowie zwischengespeicherte Token auf einmal zu genau dem doppelten Preis. Überschreiten Sie die Grenze mit einem Token und die Rechnung für alles, was Sie gesendet haben, nicht nur den Überschuss, springt 2x. Ich habe eine echte Agenten-Arbeitslast über diese Linie laufen lassen, um zu sehen, was es kostet.

Die Preiskarte, mit der Klippe

EingabeaufforderungsgrößeEingangEingaben zwischengespeichertAusgabe
Unter 200.000 Token$2.00$0.50$6.00
Bei oder über 200.000 Token$4.00$1.00$12.00

That's per million tokens, and it applies identically to Grok 4.6 and Grok 4.7 — both ship a 500K-token context window and both use this same two-tier structure. There's also a US regional endpoint, the only one both models are available on, billed at a flat 1.1x on top of whichever tier you land in: $2.20/$0.55/$6.60 under the line, $4.40/$1.10/$13.20 over it. Every other API I've priced here — Gemini's Flash discount, GPT-6 Astra's Fast/Batch split, Claude's cache tiers — changes the rate for a schneiden, Schnitt, Stück der Nutzung. Die 200K-Marke von Grok ändert die Rate für die gesamte Anfrage, rückwirkend, basierend auf einer Zahl, die Sie nicht immer genau kontrollieren (ein wachsender Konversationsverlauf, ein längerer abgerufener Kontextblock, ein weiteres angehängtes Dokument).

Eine einzige Anfrage, direkt auf der Linie

Nehmen Sie einen Anruf entgegen: eine 190.000-Token-Aufforderung (ein langes Dokument plus Anweisungen), die eine 6.000-Token-Antwort generiert.

EingabeaufforderungsgrößeEingabekostenAusgabekostenGesamt
Unter der Klippe190.000 in / 6.000 out$0.380$0.036$0.416
#1 Über die Klippe210.000 in / 6.000 out$0.840$0.072$0.912

Die Aufforderung wuchs um 10,5 %. Die Rechnung wuchs um 119 %. Das ist kein Rundungseffekt einer größeren Anzahl mal der gleichen Rate — die pro-Token-Rate selbst verdoppelte sich in dem Moment, in dem die Aufforderung 200.000 überschritt, auf jeden Token in der Anfrage, nicht nur auf die 20.000, die sie übertrafen.

Was das für einen 10.000-Anforderungsagenten im Abstand von einem Monat bedeutet

Eine Coding-Agent- oder Long-Document-Pipeline, die 10.000 Anfragen pro Monat mit jeweils durchschnittlich 195.000 Prompt-Token mit einer Antwort von 5.000 Token ausführt — heute bequem unter der Leitung.

Durchschn. EingabeaufforderungKosten pro AnfrageMonatlich (10.000 Anforderungen)
Heute durchschnittlich 195.000195.000 IN / 5.000 out$0.420$4,200
Nächster Monat, durchschnittlich 205.000205.000 IN / 5.000 out$0.880$8,800

Ein Anstieg der durchschnittlichen Eingabeaufforderungslänge um 5 % — die Art, die leise auftritt, wenn eine Systemaufforderung wächst, ein paar weitere Beispiele hinzugefügt werden oder der Konversationsverlauf nicht so aggressiv zugeschnitten wird — fügt 4.600 US-Dollar pro Monat hinzu, was einer Steigerung von 110 % entspricht, ohne dass sich das Anforderungsvolumen oder die Modellauswahl ändert. Leiten Sie die gleiche durchschnittliche Arbeitslast von 205.000 US-Dollar durch den regionalen Endpunkt der USA statt durch den globalen Endpunkt und es sind 9.680 US-Dollar pro Monat, weitere 880 US-Dollar für die regionale Garantie zusätzlich zu einer bereits verdoppelten Rate.

Was ich damit eigentlich machen würde

If you're building on Grok 4.6 or 4.7 and your prompts sit anywhere near 150K-200K tokens, treat 200,000 as a hard budget wall, not a soft one. Log actual prompt token counts per request in production, not estimates — the cliff triggers on the real count xAI measures, and a system prompt plus growing chat history plus retrieved context can cross it without any single change looking like the cause. If you're designing the pipeline, cap context deliberately below 200K (trim history, chunk retrieval tighter) rather than letting it drift up to whatever the model's 500K window allows — the context window and the pricing tier are two different numbers, and only one of them is free to use. And when you're comparing Grok against GPT-6 Astra's Fast/Batch split or Gemini's time-based discount, remember they're not the same shape of pricing risk: those move because you change a setting, Grok's moves because your data did.

Neu bei der nutzungsbasierten LLM-Preisgestaltung? Beginnen Sie mit der kostenlose API-Kostenleitfäden.

Stellen Sie es selbst bereit: DigitalOcean – 200 $ kostenloses Guthaben ↗ - Hostinger VPS ↗

Pricing verified against xAI's official developer pricing docs (docs.x.ai/developers/pricing), checked 2026-09-24. Grok 4.6 and Grok 4.7 both ship a 500K-token context window; the 200K-token tier threshold and the 1.1x US regional endpoint premium apply to both models identically per xAI's docs. Workload figures (request volumes, token counts) are illustrative scenarios computed against real published per-token rates, not vendor-supplied numbers — confirm current pricing in your xAI console before budgeting.