22 de septiembre de 2026 · AI y LLM · 5 min de lectura
Google shipped Gemini 3.7 Flash on September 2 at $0.75 per million input tokens and $3.75 per million output — cheap enough that plenty of teams wired it straight into production without reading the fine print under the price table. That fine print says the rate holds "through December 31, 2026." Starting January 1, 2027 — 100 days from today — the exact same model, same weights, same output, bills $1.50/$7.50. A clean doubling, on both input and output, with no model swap and no separate announcement beyond a line in Google's own pricing docs. I checked that rate card directly, matched it against our own tracked pricing on apicostcalc.com/gemini.html, y ejecutó dos cargas de trabajo reales a ambos lados de la fecha límite para ver lo que la duplicación realmente añade a una factura.
| Modelo | Ahora, hasta el 31 de diciembre de 2026 | A partir del 1 de enero de 2027 | Cambiar |
|---|---|---|---|
| Gemini 3.7 Flash — entrada | $0.75 | $1.50 | 2.00x |
| Gemini 3.7 Flash — output | $3.75 | $7.50 | 2.00x |
| Géminis 3.1 Flash-Lite | $0.25 / $1.50 | $0.25 / $1.50 | no change noted |
| Géminis 2.5 Flash (generación anterior) | $0.30 / $2.50 | $0.30 / $2.50 | no se han observado cambios |
Solo Gemini 3.7 Flash tiene este vencimiento específico: los propios documentos de Google lo marcan como una tasa introductoria, no los otros modelos 3.x. Es el mismo mecanismo que una tasa de lanzamiento promocional en un plan SaaS: conseguir la adopción en la puerta barata, luego aumentar al número que el modelo siempre iba a costar una vez que termine el período de prueba gratuita. Nada sobre el modelo cambia el 1 de enero: la misma ventana de contexto, la misma clase de latencia, las mismas puntuaciones de referencia. Solo la factura lo hace.
Una canalización de moderación de contenido que etiqueta 200 millones de tokens de entrada y genera 20 MILLONES de tokens de salida al mes: una forma típica para un trabajo que lee mucho texto y escribe etiquetas cortas.
| Entrada (200M) | Salida (20M) | Total mensual | |
|---|---|---|---|
| Ahora (hasta el 31 de diciembre) | $150.00 | $75.00 | $225.00 |
| A partir del 1 de enero de 2027 | $300.00 | $150.00 | $450.00 |
Un extra de $ 225 al mes por un trabajo que es fácil de subestimar precisamente porque $ 225 no parece mucho. Sigue siendo una duplicación exacta: se aplica el mismo multiplicador si la factura base es de $ 225 o $ 225.000.
Una aplicación de recuperación aumentada que atiende 500.000 solicitudes al mes, cada una de las cuales extrae aproximadamente 3.000 tokens de contexto recuperado más la consulta del usuario, y escribe una respuesta de 300 tokens. Son 1.500 millones de tokens de entrada y 150 MILLONES de tokens de salida al mes, una carga de trabajo lo suficientemente grande como para que este plazo se muestre como una línea presupuestaria real, no como un error de redondeo.
| Entrada (1.500 M) | Salida (150 M) | Total mensual | |
|---|---|---|---|
| Ahora (hasta el 31 de diciembre) | $1,125.00 | $562.50 | $1,687.50 |
| A partir del 1 de enero de 2027 | $2,250.00 | $1,125.00 | $3,375.00 |
Eso es $ 1,687.50 más cada mes, o un poco más de $ 20,000 más al año, de una línea de precios en lugar de un cambio de modelo, un lanzamiento de funciones o un aumento de uso. Si esta carga de trabajo ya se está ejecutando en 3.7 Flash, ese número pertenece ahora a un presupuesto del primer trimestre de 2027, no descubierto en la factura de enero.
Gemini 3.1 Flash-Lite factura $ 0.25/$ 1.50 sin vencimiento marcado en los documentos de Google. Ejecute los mismos volúmenes de token de la carga de trabajo de RAG (1.500 M de entrada, 150 M de salida) a través de Flash-Lite:
| Entrada (1.500 M) | Salida (150 M) | Total mensual | |
|---|---|---|---|
| Flash de Gemini 3.7, a partir del 1 de enero | $2,250.00 | $1,125.00 | $3,375.00 |
| Géminis 3.1 Flash-Lite | $375.00 | $225.00 | $600.00 |
That's a 5.6x gap, and it's tempting to read this as "just switch." I wouldn't, not blindly. Flash-Lite is a smaller, cheaper-tier model than Flash — it trades away some of the reasoning and instruction-following headroom that made 3.7 Flash worth picking over it in the first place. The honest move is to run your own eval set through Flash-Lite before the deadline and see whether the answer quality holds up for your specific retrieval-and-answer task. If it does, you bank the $2,775 a month. If it doesn't, you now know that with data instead of guessing, and you budget for the doubled Flash rate with your eyes open.
Anything you've shipped on Gemini 3.7 Flash needs a line in the January 2027 budget today — the rate change is already public, so there's no ambiguity to wait out. Before that date, run your real workload against Flash-Lite and measure the quality delta instead of assuming it either "will obviously be fine" or "obviously won't work." And treat every introductory AI API rate the same way going forward: the discounted number gets you evaluating the model, not a permanent price — check the provider's docs for an expiry line before you build a cost model around launch-week pricing.
¿Nuevo en los precios de LLM basados en el uso? Comience con el guías gratuitas de costos de API.
Despliéguelo usted mismo: DigitalOcean — $200 de crédito gratis ↗ · VPS Hostinger ↗
Pricing verified against Google's official Gemini API pricing docs (ai.google.dev/gemini-api/docs/pricing) and our own live rate tracking on apicostcalc.com/gemini.html, checked 2026-09-22. Gemini 3.7 Flash launched September 2, 2026. Reference estimates using Google's published pay-as-you-go rates — Vertex AI pricing, enterprise agreements and future rate changes vary; confirm current pricing at the source before budgeting. Workload figures (request volumes, token counts) are illustrative scenarios computed against real published per-token rates, not vendor-supplied numbers.