24 septembre 2026 · AI & LLM · 5 min de lecture
Chaque API LLM que j'ai évaluée sur ce site facture des jetons de la même manière qu'un service public facture de l'électricité : vous payez pour ce que vous avez utilisé, et le taux pour le jeton n °1 ne change pas parce que vous avez également utilisé le jeton n °500 000. Grok 4.6 et Grok 4.7 ne fonctionnent pas comme ça. J'ai extrait les propres documents de tarification de xAI (docs.x.ai/developers/pricing) et j'ai trouvé un seuil : au moment où une invite atteint 200 000 jetons, xAI ne facture pas les jetons supplémentaires à un taux plus élevé — il reclasse les entier demande, entrée et sortie et jetons mis en cache en une seule fois, à exactement le double du prix. Traversez la ligne d'un jeton et la facture pour tout ce que vous avez envoyé, pas seulement l'excédent, saute 2 fois. J'ai géré une véritable charge de travail d'agent sur cette ligne pour voir ce que cela coûtait.
| Taille de l'invite | Saisir | Entrée mise en cache | Sortir |
|---|---|---|---|
| Moins de 200 000 jetons | $2.00 | $0.50 | $6.00 |
| Au moins 200 000 jetons | $4.00 | $1.00 | $12.00 |
That's per million tokens, and it applies identically to Grok 4.6 and Grok 4.7 — both ship a 500K-token context window and both use this same two-tier structure. There's also a US regional endpoint, the only one both models are available on, billed at a flat 1.1x on top of whichever tier you land in: $2.20/$0.55/$6.60 under the line, $4.40/$1.10/$13.20 over it. Every other API I've priced here — Gemini's Flash discount, GPT-6 Astra's Fast/Batch split, Claude's cache tiers — changes the rate for a trancher d'utilisation. La marque 200K de Grok modifie le taux de toute la demande, rétroactivement, en fonction d'un nombre que vous ne contrôlez pas toujours avec précision (un historique de conversation croissant, un morceau de contexte récupéré plus long, un document joint de plus).
Prenez un appel : une invite de 190 000 jetons (un long document plus des instructions) générant une réponse de 6 000 jetons.
| Taille de l'invite | Coût des intrants | Coût de sortie | Total | |
|---|---|---|---|---|
| Sous la falaise | 190 000 in / 6 000 out | $0.380 | $0.036 | $0.416 |
| La falaise | 210 000 in / 6 000 out | $0.840 | $0.072 | $0.912 |
L'invite a augmenté de 10,5 %. La facture a augmenté de 119 %. Ce n'est pas un effet d'arrondi d'un plus grand nombre de fois le même taux — le taux par jeton lui-même a doublé à l'instant où l'invite a franchi 200 000, sur chaque jeton de la demande, pas seulement sur les 20 000 qui l'ont poussé.
Un agent de codage ou un pipeline de documents longs exécutant 10 000 demandes par mois, chacune en moyenne 195 000 jetons prompts avec une réponse de 5 000 jetons — confortablement sous la ligne aujourd'hui.
| Invite moyenne | Coût par demande | Mensuel (10 000 reqs) | |
|---|---|---|---|
| Aujourd'hui, env. 195K | 195 000 in / 5 000 out | $0.420 | $4,200 |
| Le mois prochain, en moyenne 205 000 | 205 000 in / 5 000 out | $0.880 | $8,800 |
Un glissement de 5 % de la longueur moyenne de l'invite — le genre qui se produit discrètement à mesure qu'une invite système se développe, que quelques exemples supplémentaires sont ajoutés ou que l'historique des conversations n'est pas aussi agressif — ajoute 4 600 $ par mois, soit une augmentation de 110 %, sans changement de volume de demande ou de choix de modèle. Acheminez cette même charge de travail moyenne de 205 000 $ à travers le point de terminaison régional américain au lieu du point de terminaison mondial et elle est de 9 680 $ / mois, soit 880 $ de plus pour la garantie régionale en plus d'un taux déjà doublé.
If you're building on Grok 4.6 or 4.7 and your prompts sit anywhere near 150K-200K tokens, treat 200,000 as a hard budget wall, not a soft one. Log actual prompt token counts per request in production, not estimates — the cliff triggers on the real count xAI measures, and a system prompt plus growing chat history plus retrieved context can cross it without any single change looking like the cause. If you're designing the pipeline, cap context deliberately below 200K (trim history, chunk retrieval tighter) rather than letting it drift up to whatever the model's 500K window allows — the context window and the pricing tier are two different numbers, and only one of them is free to use. And when you're comparing Grok against GPT-6 Astra's Fast/Batch split or Gemini's time-based discount, remember they're not the same shape of pricing risk: those move because you change a setting, Grok's moves because your data did.
Nouveau dans la tarification LLM basée sur l'utilisation ? Commencez par le guides gratuits sur les coûts des API.
Déployez-le vous-même : DigitalOcean — 200 $ de crédit gratuit ↗ · VPS Hostinger ↗
Pricing verified against xAI's official developer pricing docs (docs.x.ai/developers/pricing), checked 2026-09-24. Grok 4.6 and Grok 4.7 both ship a 500K-token context window; the 200K-token tier threshold and the 1.1x US regional endpoint premium apply to both models identically per xAI's docs. Workload figures (request volumes, token counts) are illustrative scenarios computed against real published per-token rates, not vendor-supplied numbers — confirm current pricing in your xAI console before budgeting.