El colapso de los precios de frontera, visualizado
Precio de entrada por 1 millón de tokens para el mejor modelo de "clase de frontera" disponible generalmente en cada fecha. Mismo nivel de capacidad, con tres años de diferencia.
No es el mismo modelo, el mismo clase de capacidad. Esa distinción es toda la historia: los modelos no se vuelven más baratos, los niveles de capacidad sí, a medida que los modelos más nuevos hacen de la frontera de ayer una mercancía.
Cronología de cada evento importante de precios
El precio que definió la "IA cara". Una sola sesión de chat intensa podría costar dólares. GPT-3.5 Turbo, a $2/$2, fue el caballo de batalla del volumen.
Anthropic socava GPT-4 en ~60% con una ventana de contexto de 100k: la primera presión real de precios en el nivel de frontera.
El primer gran corte de OpenAI. Más rápido, contexto de 128k y un tercio del precio. El patrón está establecido: cada generación ofrece mejores productos y más económico.
El menú de tres niveles se convierte en la plantilla de la industria. El haiku a 0,25 dólares hace que las cargas de trabajo de millones de tokens sean casuales; Opus marca el límite máximo de primas.
Calidad cercana a la frontera, dos órdenes de magnitud por debajo del precio de lanzamiento de GPT-4. Desencadena una guerra de precios inmediata entre los proveedores chinos (Alibaba, ByteDance recortan en unos días) y restablece permanentemente lo que significa "barato".
La mitad del precio de Turbo, multimodal incluido. Los insumos de Frontier son ahora 6 veces más baratos que 14 meses antes.
Mejor que GPT-3.5 Turbo a menos de un tercio de su precio. El "nivel presupuestario" ahora supera la frontera de 2023 en la mayoría de las tareas.
Segundo halving en cuatro meses. La entrada de Frontier ha caído 12 veces desde el lanzamiento de GPT-4: 17 meses.
Gemini 1.5 Flash cae de $0,35 a $0,075 de entrada; 1.5 Pro de $3,50 a $1,25. Google compra cuota de mercado con los recortes sostenidos más pronunciados de cualquier proveedor importante.
El contraejemplo que vale la pena recordar: Anthropic fijó el precio del nuevo Haiku 3,2 veces más que el de su predecesor, argumentando que la capacidad lo justificaba. La deflación es una tendencia, no una ley: los niveles presupuestarios pueden aumentar sus precios, y de hecho lo hacen, cuando un modelo se excede.
Los modelos de razonamiento restablecen el techo e introducen costos invisibles de "fichas de pensamiento", en los que se paga por una cadena de pensamiento que nunca se ve. Nace un nuevo nivel premium a precios de 2023.
El segundo shock de DeepSeek: razonamiento de clase o1 a una fracción del precio, pesos abiertos. Borra brevemente ~600 mil millones de dólares de la capitalización de mercado de Nvidia, en el momento en que los mercados descontaban esa inferencia se estaba volviendo barata.
El mayor recorte porcentual individual en un modelo de razonamiento emblemático: o3 cae a $2/$8 de la noche a la mañana, subcotizando a su propio hermano menor y confirmando que el nivel de razonamiento sigue la misma curva de deflación, solo que más rápido.
Los modelos Llama-4-class, Qwen y DeepSeek servidos por Together, Fireworks, Groq y DeepInfra sitúan la capacidad de nivel GPT-4 por debajo de 1 dólar por millón de tokens. Los modelos cerrados Frontier (GPT-5.5 a $5, nivel Claude Opus) tienen precios premium, pero la brecha que deben justificar sigue ampliándose.
Lo que realmente dicen tres años de datos
1. Los niveles de capacidad se desinflan ~10 veces por año; Los modelos individuales rara vez son más baratos. El precio de lista del GPT-4o se redujo dos veces, pero el mecanismo más importante es el reemplazo: el nuevo modelo se envía en el nivel inferior del modelo anterior. Presupuesto para el nivel, no para el nombre del modelo.
2. Los precios de los productos caen más lentamente que los de los insumos. La salida de lanzamiento del GPT-4 fue 2× entrada ($60 vs $30); hoy en día, las proporciones de 4 a 5 × son estándar (GPT-4o: 10 dólares frente a 2,50 dólares). Los proveedores protegen el margen de generación. Si su carga de trabajo tiene muchos resultados (respuestas largas, generación de código), su deflación efectiva es significativamente más lenta de lo que sugieren los titulares.
3. Se producen aumentos de precios. Claude 3.5 Haiku (+220%) es el famoso. Cuando un modelo "pequeño" se compara con un modelo de nivel medio, su precio sigue la capacidad, no el linaje. Nunca codifique la suposición de que el nivel económico sigue siendo barato.
4. Los shocks vienen del exterior. Ambas caídas discontinuas (mayo de 2024, enero de 2025) provinieron de DeepSeek, no de la competencia actual. La próxima revisión de precios probablemente también llegue de algún lugar inesperado, lo que aboga por una plomería independiente del proveedor en lugar de una integración profunda de un solo proveedor.
Qué significa esto para tu presupuesto
Descontar proyecciones a largo plazo. Una función que hoy cuesta 10.000 dólares al mes en llamadas API cuesta entre 1.000 y 3.000 dólares al mes con la misma calidad en 18 meses. La economía unitaria de IA que ahora parece marginal a menudo funciona bien en la curva de deflación, y los contratos anuales comprometidos a las tasas actuales luchan contra esa curva.
Vuelva a comprar trimestralmente. El Tabla comparativa de más de 300 modelos Reclasifica cada modelo según su combinación de tokens real. Quince minutos por trimestre suponen habitualmente entre un 30 y un 60 % de ahorro al bajar un nivel de carga de trabajo. El calculadora de ahorro por caída de precio precios exactamente lo que vale una migración.
Ruta por dificultad. La diferencia de 100 veces entre los precios de productos básicos y de frontera es la oportunidad: la mayoría de las consultas de producción no necesitan frontera. El calculadora de enrutamiento de modelos muestra las matemáticas del costo combinado.