Home › Blog › Acantilado de precios Grok 4.7 200K-token

Grok 4.7's 200K-Token Cliff: un token adicional duplica la factura total

24 de septiembre de 2026 · AI y LLM · 5 min de lectura

Cada API de LLM que he cotizado en este sitio factura tokens de la misma manera que un servicio público factura la electricidad: pagas por lo que usaste, y la tarifa del token #1 no cambia porque también usaste el token #500,000. Grok 4.6 y Grok 4.7 no funcionan así. Saqué los propios documentos de precios de xAI (docs.x.ai/developers/pricing) y encontré un umbral: en el momento en que un mensaje llega a 200,000 tokens, xAI no factura los tokens adicionales a una tasa más alta: reclasifica el totalidad solicitud, entrada y salida y tokens almacenados en caché, todo a la vez, exactamente al doble del precio. Cruza la línea por un token y la factura por todo lo que enviaste, no solo el excedente, salta 2 veces. Realicé una carga de trabajo de agente real a través de esa línea para ver cuánto cuesta.

La tarjeta de tarifas, con el acantilado

\"indicador, mensaje\"AporteEntrada en cachéProducción
Menos de 200.000 tokens$2.00$0.50$6.00
En o más de 200.000 tokens$4.00$1.00$12.00

That's per million tokens, and it applies identically to Grok 4.6 and Grok 4.7 — both ship a 500K-token context window and both use this same two-tier structure. There's also a US regional endpoint, the only one both models are available on, billed at a flat 1.1x on top of whichever tier you land in: $2.20/$0.55/$6.60 under the line, $4.40/$1.10/$13.20 over it. Every other API I've priced here — Gemini's Flash discount, GPT-6 Astra's Fast/Batch split, Claude's cache tiers — changes the rate for a rebanada de uso. La marca de 200K de Grok cambia la tasa para el solicitud completa, retroactivamente, en función de un número que no siempre controlas con precisión (un historial de conversaciones en crecimiento, un fragmento de contexto recuperado más largo, un documento adjunto más).

Una sola solicitud, directamente en la línea

Tome una llamada: un mensaje de 190.000 tokens (un documento largo más instrucciones) que genera una respuesta de 6.000 tokens.

\"indicador, mensaje\"Costo de insumosCosto de producciónTotal
Debajo del acantilado190.000 entradas/ 6.000 salidas$0.380$0.036$0.416
Nro. 1 Sobre el acantilado210.000 entradas/ 6.000 salidas$0.840$0.072$0.912

La indicación creció un 10,5%. La factura creció un 119%. Ese no es un efecto de redondeo de un número mayor multiplicado por la misma tasa: la tasa por token en sí misma se duplicó en el instante en que el aviso cruzó los 200,000, en cada token de la solicitud, no solo en los 20,000 que lo empujaron.

Lo que eso le hace a un agente de 10.000 solicitudes, con un mes de diferencia

Un canal de agente de codificación o documento largo que ejecuta 10.000 solicitudes al mes, cada una con un promedio de 195.000 tokens de aviso con una respuesta de 5.000 tokens, cómodamente debajo de la línea hoy en día.

Promedio. promptCoste por solicitudMensual (10.000 reqs)
Hoy en día, 195K de media195.000 entradas / 5.000 salidas$0.420$4,200
El próximo mes, un promedio de 205K205.000 entradas / 5.000 salidas$0.880$8,800

Una fluencia del 5% en la duración promedio de las indicaciones, del tipo que ocurre silenciosamente a medida que crece una indicación del sistema, se agregan algunos ejemplos más o el historial de conversaciones no se recorta tan agresivamente, agrega $ 4,600 al mes, un aumento del 110%, con cero cambios en el volumen de solicitudes o en la elección del modelo. Dirija esa misma carga de trabajo promedio de 205K a través del punto de conexión regional de EE. UU. en lugar de global y es de $ 9,680/mes, otros $ 880 para la garantía regional además de una tasa ya duplicada.

Lo que realmente haría con esto

If you're building on Grok 4.6 or 4.7 and your prompts sit anywhere near 150K-200K tokens, treat 200,000 as a hard budget wall, not a soft one. Log actual prompt token counts per request in production, not estimates — the cliff triggers on the real count xAI measures, and a system prompt plus growing chat history plus retrieved context can cross it without any single change looking like the cause. If you're designing the pipeline, cap context deliberately below 200K (trim history, chunk retrieval tighter) rather than letting it drift up to whatever the model's 500K window allows — the context window and the pricing tier are two different numbers, and only one of them is free to use. And when you're comparing Grok against GPT-6 Astra's Fast/Batch split or Gemini's time-based discount, remember they're not the same shape of pricing risk: those move because you change a setting, Grok's moves because your data did.

¿Nuevo en los precios de LLM basados en el uso? Comience con el guías gratuitas de costos de API.

Despliéguelo usted mismo: DigitalOcean — $200 de crédito gratis ↗ · VPS Hostinger ↗

Pricing verified against xAI's official developer pricing docs (docs.x.ai/developers/pricing), checked 2026-09-24. Grok 4.6 and Grok 4.7 both ship a 500K-token context window; the 200K-token tier threshold and the 1.1x US regional endpoint premium apply to both models identically per xAI's docs. Workload figures (request volumes, token counts) are illustrative scenarios computed against real published per-token rates, not vendor-supplied numbers — confirm current pricing in your xAI console before budgeting.