Publicado em 2 de agosto de 2026 · preços de referência do nosso registro de modelos 387, verifique antes de fazer o orçamento
“Basta usar o modelo pequeno” é o conselho de custo padrão. Finalmente defini o preço adequado em todo o nosso registro de modelos e o conselho acabou sendo quase sem sentido por si só. Rebaixar um nível dentro da programação da Anthropic economiza você 40%. Exatamente o mesmo movimento dentro da programação do Google salva 96%. A mesma decisão, a mesma quantidade de trabalho de engenharia, resultados totalmente diferentes – porque a diferença entre o carro-chefe de um fornecedor e seu nível mais barato não é uma constante. Varia de 1,7× a 24×.
Um mês, 200 milhões de tokens de entrada e 40 milhões de tokens de saída. São cerca de 250.000 solicitações com 800 tokens de entrada e 160 de saída – um produto em formato real que faz classificações, resumos e respostas curtas de bate-papo. Sem armazenamento em cache, sem desconto em lote, portanto os números permanecem comparáveis. Cada preço abaixo vem de nosso registro rastreado (387 modelos, preços de referência para julho a agosto de 2026).
| Família | Nível | US$/1 milhão em | $/1 milhão de saída | Mês |
|---|---|---|---|---|
| OpenAI | GPT-5.5 | $5.00 | $30.00 | $2,200 |
| GPT-5 | $1.25 | $10.00 | $650 | |
| GPT-5 mini | $0.40 | $1.60 | $144 | |
| GPT-5 nano mais barato | $0.10 | $0.40 | $36 | |
| Antrópico | Cláudio Opus 4.8 | $5.00 | $25.00 | $2,000 |
| Soneto de Claude 4.6 | $3.00 | $15.00 | $1,200 | |
| Claude Haiku 4.5 | $1.00 | $5.00 | $400 | |
| Gêmeos 3.1 Pró | $2.00 | $12.00 | $880 | |
| Gêmeos 3.1 Flash | $0.10 | $0.40 | $36 | |
| Gêmeos 3.1 Flash-Lite | $0.05 | $0.20 | $18 | |
| xAI | Grok 4 | $3.00 | $15.00 | $1,200 |
| Grok 4 mini | $0.50 | $2.50 | $200 | |
| DeepSeek | DeepSeek V4 | $0.27 | $1.10 | $98 |
| Flash DeepSeek V4 | $0.14 | $0.28 | $39 | |
| Mistral | Mistral Grande | $2.00 | $6.00 | $640 |
| Mistral pequeno | $0.10 | $0.30 | $32 |
Elimine tudo, exceto o movimento que a maioria das equipes realmente considera – carro-chefe para o nível imediatamente abaixo dele:
| Mover | Antes → depois | Salvo |
|---|---|---|
| Opus 4.8 → Soneto 4.6 | US$ 2.000 → US$ 1.200 | 40% |
| DeepSeek V4 → Flash V4 | US$ 98 → US$ 39 | 60% |
| GPT-5.5 → GPT-5 | US$ 2.200 → US$ 650 | 70% |
| Grok 4 → Grok 4 mini | US$ 1.200 → US$ 200 | 83% |
| Mistral Grande → Pequeno | US$ 640 → US$ 32 | 95% |
| Gêmeos 3.1 Pro → Flash | US$ 880 → US$ 36 | 96% |
Quarenta por cento contra noventa e seis por cento. Ambos são "use o modelo menor". Um deles vale um sprint de trabalho de avaliação e uma camada de roteamento; o outro vale, na melhor das hipóteses, uma tarde, porque você gastará mais horas de engenheiro provando que o Sonnet é bom o suficiente do que os US$ 800 que você economiza.
Isso não é que a Anthropic seja mesquinha com descontos. É o oposto: seu carro-chefe ficou dramaticamente mais barato. Claude Opus 4.1 está em nosso registro em $15/$75. Opus 4.5, 4.6 e 4.8 ficam todos em $5/$25 - um corte de 3× no topo da programação, sem alteração no preço do Sonnet ou Haiku. No meu mês de 240 milhões de tokens, o Opus passou de US$ 6.000 para US$ 2.000.
O efeito colateral: a diferença entre o Opus e o Soneto caiu de 5× para 1,67×. O imposto de fronteira na Antrópico deixou de existir em grande parte. OpenAI fez a mesma coisa em um eixo diferente - o1 a US$ 15/US$ 60 foi substituído por GPT-5 a US$ 1,25/US$ 10, então o item de linha do modelo de fronteira caro orçado em 2025 é uma ordem de magnitude diferente agora.
O Google foi para o outro lado. Eles mantiveram o Pro com um preço razoável de US$ 2/US$ 12 e reduziram o Flash-Lite para US$ 0,05/US$ 0,20, de modo que seu spread interno é agora o mais amplo de qualquer grande família. Nada nisso é acidental – é uma questão de roteamento.
Custos do Flash Gemini 3.1 $36 nesta carga de trabalho. DeepSeek V4, que eu arquivei mentalmente como "a opção barata", custa $98 – quase 3× mais. E GPT-5.5 por US$ 2.200 é 122× o preço do Gemini 3.1 Flash-Lite a US$ 18 para movimentar o mesmo volume de token.
Eu carregava uma classificação mental de preços de dois anos atrás. Estava errado em ambas as direções. A reputação dos fornecedores baratos fica cerca de um ano atrás das tabelas de preços reais, e os números avançam mais rápido do que o folclore.
1. Verifico a diferença de níveis antes de construir o roteador. Se o carro-chefe para o mini for inferior a 2×, uma cascata não vale a complexidade ou o orçamento de avaliação - eu pego o carro-chefe e gasto o esforço no cache imediato, o que reduz mais.
2. Se a diferença for de 20×, eu roteio agressivamente. A camada barata lida com classificação, extração, marcação e roteamento. O carro-chefe vê apenas o que falha na verificação de confiança. No spread do Google que transforma US$ 880 em algo próximo a US$ 60 com uma taxa de escalonamento de 10% — a aritmética está no Calculadora de economia em cascata LLM e o calculadora de economia de roteamento de modelo.
3. Eu reavalio toda a linha a cada trimestre. A reavaliação do Opus mudou quais otimizações valiam a pena fazer, e descobri com semanas de atraso. Isso é o que rastreador de mudança de preço é por enquanto.
4. Nunca comparo apenas o preço dos insumos. A saída executa 4× entrada na mediana nos 97 modelos de bate-papo primários que verifiquei e 6× no GPT-5.5 e Gemini 3.1 Pro. Um modelo tagarela com uma taxa de entrada barata perde para um modelo conciso com uma taxa cara com mais frequência do que as pessoas esperam. Se seu aplicativo estiver trocando de modelo, o custo da migração também será importante. Consulte o calculadora de custos de migração de modelo.
Coloque seu próprio token dividido no Calculadora de custos da API AI →ou modele um produto completo no Estimador de custos de aplicativos de IA e o calculadora de custos do chatbot. Novo no preço de tokens? Começar em Aprenda: como funciona o preço da API.
Estimativas de referência, agosto de 2026, retiradas de nosso registro de modelos rastreados. Os preços mudam sem aviso prévio e excluem descontos em cache, lote e volume – verifique com o fornecedor antes de comprometer um orçamento. Não afiliado à OpenAI, Anthropic, Google, xAI, DeepSeek ou Mistral.