−97%
Preço de entrada da classe GPT-4 desde março de 2023
~10×
mais barato por ano com capacidade constante
100×
Diferença de preço de lançamento entre DeepSeek V2 e GPT-4
2
aumentos de preços notáveis ​​em três anos

O colapso dos preços fronteiriços, visualizado

Preço de entrada por 1 milhão de tokens para o melhor modelo de "classe de fronteira" geralmente disponível em cada data. Mesmo nível de capacidade, com três anos de diferença.

março de 2023 · GPT-4
$30.00
novembro de 2023 · GPT-4 Turbo
$10.00
Maio de 2024 · GPT-4o
$5.00
Agosto de 2024 · GPT-4o (corte)
$2.50
2025 · GPT-4.1 / Claude 4 nível
$2.00
2026 · anfitriões de peso aberto
<US$ 1,00

Não é o mesmo modelo - o mesmo aula de capacidade. Essa distinção é toda a história: os modelos não ficam mais baratos, mas sim os níveis de capacidade, à medida que os modelos mais recentes transformam a fronteira de ontem numa mercadoria.

Cronograma de cada grande evento de preços

março de 2023
GPT-4 é lançado a US$ 30/US$ 60 por 1 milhão

O preço que definiu a “IA cara”. Uma única sessão de chat pesada pode custar dólares. GPT-3.5 Turbo, a US$ 2/US$ 2, foi o carro-chefe do volume.

julho de 2023
Claude 2 chega a US$ 8/US$ 24 por 1 milhão

A Anthropic reduz o GPT-4 em aproximadamente 60% com uma janela de contexto de 100 mil – a primeira pressão real de preços na camada de fronteira.

Novembro de 2023
GPT-4 Turbo: $ 10 / $ 30 −67% de entrada

O primeiro grande corte da OpenAI. Mais rápido, contexto de 128k e um terço do preço. O padrão está definido: cada geração entrega melhor e mais barato.

março de 2024
Família Claude 3: Opus $ 15/$ 75 · Soneto $ 3/$ 15 · Haiku $ 0,25/$ 1,25

O menu de três camadas torna-se o modelo do setor. Haiku a US$ 0,25 torna casuais as cargas de trabalho de um milhão de tokens; A Opus estabelece o teto premium.

Maio de 2024
O choque do DeepSeek: V2 a $ 0,14 / $ 0,28 ~100× abaixo do lançamento do GPT-4

Qualidade quase-fronteira duas ordens de magnitude abaixo do preço de lançamento do GPT-4. Desencadeia uma guerra de preços imediata entre os fornecedores chineses (Alibaba, ByteDance cortados em poucos dias) e redefine permanentemente o que significa "barato".

Maio de 2024
GPT-4o: US$ 5/US$ 15 −50%

Metade do preço do Turbo, incluindo multimodal. Os insumos fronteiriços são agora 6 vezes mais baratos do que 14 meses antes.

julho de 2024
GPT-4o mini: $ 0,15 / $ 0,60 – mata GPT-3.5 −70% vs 3,5T

Melhor que o GPT-3.5 Turbo por menos de um terço do preço. O “nível orçamental” ultrapassa agora a fronteira de 2023 na maioria das tarefas.

agosto de 2024
Corte GPT-4o novamente: $ 2,50 / $ 10 −50%

Segunda redução pela metade em quatro meses. A entrada da Frontier caiu 12× desde o lançamento do GPT-4 – 17 meses.

Agosto a outubro de 2024
Reavaliação agressiva de Gemini: Flash −78%, Pro −64%

Gemini 1.5 Flash cai de US$ 0,35 para US$ 0,075 de entrada; 1.5 Pro de US$ 3,50 a US$ 1,25. O Google compra participação de mercado com os cortes sustentados mais acentuados de qualquer grande fornecedor.

Novembro de 2024
Claude 3.5 Haiku: $ 0,80 / $ 4 +220% contra 3 haicais

O contra-exemplo que vale a pena lembrar: a Anthropic fixou o preço do novo Haiku 3,2× acima de seu antecessor, argumentando que a capacidade o justificava. A deflação é uma tendência, não uma lei – os níveis orçamentais podem e são reavaliados para cima quando um modelo apresenta resultados excessivos.

Dezembro de 2024
o1 lança preço de raciocínio: US$ 15/US$ 60

Os modelos de raciocínio redefinem o teto – e introduzem custos invisíveis de “fichas de pensamento”, onde você paga por uma cadeia de pensamento que nunca viu. Um novo nível premium nasce a preços de 2023.

Janeiro de 2025
DeepSeek R1: raciocínio em US$ 0,55/US$ 2,19 ~25× abaixo de o1

O segundo choque do DeepSeek: raciocínio de classe o1 por uma fração do preço, pesos em aberto. Elimina brevemente cerca de US$ 600 bilhões da capitalização de mercado da Nvidia – no momento em que os mercados precificados nessa inferência estavam se tornando baratos.

Junho de 2025
o3 corte de 80%: $ 10 → $ 2 de entrada −80%

O maior corte percentual em um modelo de raciocínio emblemático – o3 cai para US$ 2/US$ 8 durante a noite, prejudicando seu próprio irmão menor e confirmando que o nível de raciocínio segue a mesma curva de deflação, apenas mais rápido.

2025–2026
O piso de commodities se forma: anfitriões de peso aberto abaixo de US$ 1

Os modelos Llama-4-class, Qwen e DeepSeek atendidos por Together, Fireworks, Groq e DeepInfra colocam a capacidade do nível GPT-4 abaixo de US$ 1 por milhão de tokens. Os modelos fronteiriços fechados (GPT-5,5 a US$ 5, nível Claude Opus) mantêm preços premium – mas a lacuna que eles devem justificar continua aumentando.

O que três anos de dados realmente dizem

1. Os níveis de capacidade diminuem aproximadamente 10× por ano; modelos individuais raramente ficam mais baratos. O preço de tabela do GPT-4o foi reduzido duas vezes, mas o mecanismo maior é a substituição: o novo modelo é enviado no nível inferior do modelo antigo. Orçamento para o nível, não para o nome do modelo.

2. Os preços dos produtos caem mais lentamente do que os dos insumos. A saída de lançamento do GPT-4 foi 2× entrada ($ 60 vs $ 30); hoje as proporções de 4–5× são padrão (GPT-4o: US$ 10 vs US$ 2,50). Os provedores protegem a margem de geração. Se sua carga de trabalho tiver muitos resultados – respostas longas, geração de código – sua deflação efetiva será significativamente mais lenta do que as manchetes sugerem.

3. Aumentos de preços acontecem. Claude 3.5 Haiku (+220%) é o famoso. Quando um modelo “pequeno” é comparado a um modelo intermediário, seu preço segue a capacidade, não a linhagem. Nunca codifique a suposição de que o nível barato permanece barato.

4. Os choques vêm de fora. Ambas as quedas descontínuas (maio de 2024, janeiro de 2025) vieram do DeepSeek, não da concorrência existente. A próxima redefinição de preços provavelmente também chegará de algum lugar inesperado – o que defende um encanamento independente do fornecedor em vez da integração profunda de um único fornecedor.

O que isso significa para o seu orçamento

Desconto nas projeções de longo prazo. Um recurso que custa US$ 10 mil/mês em chamadas de API hoje provavelmente custará US$ 1 a 3 mil/mês com a mesma qualidade em 18 meses. A economia unitária da IA, que hoje parece marginal, muitas vezes funciona bem na curva de deflação – e os contratos anuais comprometidos às taxas de hoje combatem essa curva.

Compre novamente trimestralmente. O Tabela de comparação de mais de 300 modelos reclassifica cada modelo de acordo com seu mix de tokens real. Quinze minutos por trimestre normalmente resultam em economia de 30 a 60% com a redução de um nível de carga de trabalho. O calculadora de economia de queda de preço preços exatamente o que vale uma migração.

Percurso por dificuldade. O spread de 100× entre preços de commodities e preços de fronteira é a oportunidade: a maioria das consultas de produção não precisa de fronteira. O calculadora de roteamento de modelo mostra a matemática do custo combinado.

⚠️ Todos os preços são preços de tabela históricos por 1 milhão de tokens, compilados a partir de anúncios de fornecedores e páginas de preços arquivadas. Valores de referência, verificados pela última vez em julho de 2026. Relatar um erro →