O colapso dos preços fronteiriços, visualizado
Preço de entrada por 1 milhão de tokens para o melhor modelo de "classe de fronteira" geralmente disponível em cada data. Mesmo nível de capacidade, com três anos de diferença.
Não é o mesmo modelo - o mesmo aula de capacidade. Essa distinção é toda a história: os modelos não ficam mais baratos, mas sim os níveis de capacidade, à medida que os modelos mais recentes transformam a fronteira de ontem numa mercadoria.
Cronograma de cada grande evento de preços
O preço que definiu a “IA cara”. Uma única sessão de chat pesada pode custar dólares. GPT-3.5 Turbo, a US$ 2/US$ 2, foi o carro-chefe do volume.
A Anthropic reduz o GPT-4 em aproximadamente 60% com uma janela de contexto de 100 mil – a primeira pressão real de preços na camada de fronteira.
O primeiro grande corte da OpenAI. Mais rápido, contexto de 128k e um terço do preço. O padrão está definido: cada geração entrega melhor e mais barato.
O menu de três camadas torna-se o modelo do setor. Haiku a US$ 0,25 torna casuais as cargas de trabalho de um milhão de tokens; A Opus estabelece o teto premium.
Qualidade quase-fronteira duas ordens de magnitude abaixo do preço de lançamento do GPT-4. Desencadeia uma guerra de preços imediata entre os fornecedores chineses (Alibaba, ByteDance cortados em poucos dias) e redefine permanentemente o que significa "barato".
Metade do preço do Turbo, incluindo multimodal. Os insumos fronteiriços são agora 6 vezes mais baratos do que 14 meses antes.
Melhor que o GPT-3.5 Turbo por menos de um terço do preço. O “nível orçamental” ultrapassa agora a fronteira de 2023 na maioria das tarefas.
Segunda redução pela metade em quatro meses. A entrada da Frontier caiu 12× desde o lançamento do GPT-4 – 17 meses.
Gemini 1.5 Flash cai de US$ 0,35 para US$ 0,075 de entrada; 1.5 Pro de US$ 3,50 a US$ 1,25. O Google compra participação de mercado com os cortes sustentados mais acentuados de qualquer grande fornecedor.
O contra-exemplo que vale a pena lembrar: a Anthropic fixou o preço do novo Haiku 3,2× acima de seu antecessor, argumentando que a capacidade o justificava. A deflação é uma tendência, não uma lei – os níveis orçamentais podem e são reavaliados para cima quando um modelo apresenta resultados excessivos.
Os modelos de raciocínio redefinem o teto – e introduzem custos invisíveis de “fichas de pensamento”, onde você paga por uma cadeia de pensamento que nunca viu. Um novo nível premium nasce a preços de 2023.
O segundo choque do DeepSeek: raciocínio de classe o1 por uma fração do preço, pesos em aberto. Elimina brevemente cerca de US$ 600 bilhões da capitalização de mercado da Nvidia – no momento em que os mercados precificados nessa inferência estavam se tornando baratos.
O maior corte percentual em um modelo de raciocínio emblemático – o3 cai para US$ 2/US$ 8 durante a noite, prejudicando seu próprio irmão menor e confirmando que o nível de raciocínio segue a mesma curva de deflação, apenas mais rápido.
Os modelos Llama-4-class, Qwen e DeepSeek atendidos por Together, Fireworks, Groq e DeepInfra colocam a capacidade do nível GPT-4 abaixo de US$ 1 por milhão de tokens. Os modelos fronteiriços fechados (GPT-5,5 a US$ 5, nível Claude Opus) mantêm preços premium – mas a lacuna que eles devem justificar continua aumentando.
O que três anos de dados realmente dizem
1. Os níveis de capacidade diminuem aproximadamente 10× por ano; modelos individuais raramente ficam mais baratos. O preço de tabela do GPT-4o foi reduzido duas vezes, mas o mecanismo maior é a substituição: o novo modelo é enviado no nível inferior do modelo antigo. Orçamento para o nível, não para o nome do modelo.
2. Os preços dos produtos caem mais lentamente do que os dos insumos. A saída de lançamento do GPT-4 foi 2× entrada ($ 60 vs $ 30); hoje as proporções de 4–5× são padrão (GPT-4o: US$ 10 vs US$ 2,50). Os provedores protegem a margem de geração. Se sua carga de trabalho tiver muitos resultados – respostas longas, geração de código – sua deflação efetiva será significativamente mais lenta do que as manchetes sugerem.
3. Aumentos de preços acontecem. Claude 3.5 Haiku (+220%) é o famoso. Quando um modelo “pequeno” é comparado a um modelo intermediário, seu preço segue a capacidade, não a linhagem. Nunca codifique a suposição de que o nível barato permanece barato.
4. Os choques vêm de fora. Ambas as quedas descontínuas (maio de 2024, janeiro de 2025) vieram do DeepSeek, não da concorrência existente. A próxima redefinição de preços provavelmente também chegará de algum lugar inesperado – o que defende um encanamento independente do fornecedor em vez da integração profunda de um único fornecedor.
O que isso significa para o seu orçamento
Desconto nas projeções de longo prazo. Um recurso que custa US$ 10 mil/mês em chamadas de API hoje provavelmente custará US$ 1 a 3 mil/mês com a mesma qualidade em 18 meses. A economia unitária da IA, que hoje parece marginal, muitas vezes funciona bem na curva de deflação – e os contratos anuais comprometidos às taxas de hoje combatem essa curva.
Compre novamente trimestralmente. O Tabela de comparação de mais de 300 modelos reclassifica cada modelo de acordo com seu mix de tokens real. Quinze minutos por trimestre normalmente resultam em economia de 30 a 60% com a redução de um nível de carga de trabalho. O calculadora de economia de queda de preço preços exatamente o que vale uma migração.
Percurso por dificuldade. O spread de 100× entre preços de commodities e preços de fronteira é a oportunidade: a maioria das consultas de produção não precisa de fronteira. O calculadora de roteamento de modelo mostra a matemática do custo combinado.