HomeBlog › O imposto fronteiriço

O imposto de fronteira: abandonar um nível de modelo economiza 40% ou 96% dependendo do fornecedor

Publicado em 2 de agosto de 2026 · preços de referência do nosso registro de modelos 387, verifique antes de fazer o orçamento

“Basta usar o modelo pequeno” é o conselho de custo padrão. Finalmente defini o preço adequado em todo o nosso registro de modelos e o conselho acabou sendo quase sem sentido por si só. Rebaixar um nível dentro da programação da Anthropic economiza você 40%. Exatamente o mesmo movimento dentro da programação do Google salva 96%. A mesma decisão, a mesma quantidade de trabalho de engenharia, resultados totalmente diferentes – porque a diferença entre o carro-chefe de um fornecedor e seu nível mais barato não é uma constante. Varia de 1,7× a 24×.

A carga de trabalho pela qual avaliei tudo

Um mês, 200 milhões de tokens de entrada e 40 milhões de tokens de saída. São cerca de 250.000 solicitações com 800 tokens de entrada e 160 de saída – um produto em formato real que faz classificações, resumos e respostas curtas de bate-papo. Sem armazenamento em cache, sem desconto em lote, portanto os números permanecem comparáveis. Cada preço abaixo vem de nosso registro rastreado (387 modelos, preços de referência para julho a agosto de 2026).

O que um nível abaixo realmente custa para você

FamíliaNívelUS$/1 milhão em$/1 milhão de saídaMês
OpenAIGPT-5.5$5.00$30.00$2,200
GPT-5$1.25$10.00$650
GPT-5 mini$0.40$1.60$144
GPT-5 nano mais barato$0.10$0.40$36
AntrópicoCláudio Opus 4.8$5.00$25.00$2,000
Soneto de Claude 4.6$3.00$15.00$1,200
Claude Haiku 4.5$1.00$5.00$400
GoogleGêmeos 3.1 Pró$2.00$12.00$880
Gêmeos 3.1 Flash$0.10$0.40$36
Gêmeos 3.1 Flash-Lite$0.05$0.20$18
xAIGrok 4$3.00$15.00$1,200
Grok 4 mini$0.50$2.50$200
DeepSeekDeepSeek V4$0.27$1.10$98
Flash DeepSeek V4$0.14$0.28$39
MistralMistral Grande$2.00$6.00$640
Mistral pequeno$0.10$0.30$32
⚠️ Preços de referência, agosto 2026. Verifique sempre na página do fornecedor antes de fazer o orçamento. Execute seu próprio mix de tokens por meio do Calculadora de custos de API de IA. · Informar preço desatualizado →

A tabela de um passo para baixo é a interessante

Elimine tudo, exceto o movimento que a maioria das equipes realmente considera – carro-chefe para o nível imediatamente abaixo dele:

MoverAntes → depoisSalvo
Opus 4.8 → Soneto 4.6US$ 2.000 → US$ 1.20040%
DeepSeek V4 → Flash V4US$ 98 → US$ 3960%
GPT-5.5 → GPT-5US$ 2.200 → US$ 65070%
Grok 4 → Grok 4 miniUS$ 1.200 → US$ 20083%
Mistral Grande → PequenoUS$ 640 → US$ 3295%
Gêmeos 3.1 Pro → FlashUS$ 880 → US$ 3696%

Quarenta por cento contra noventa e seis por cento. Ambos são "use o modelo menor". Um deles vale um sprint de trabalho de avaliação e uma camada de roteamento; o outro vale, na melhor das hipóteses, uma tarde, porque você gastará mais horas de engenheiro provando que o Sonnet é bom o suficiente do que os US$ 800 que você economiza.

Por que a lacuna antrópica é tão estreita

Isso não é que a Anthropic seja mesquinha com descontos. É o oposto: seu carro-chefe ficou dramaticamente mais barato. Claude Opus 4.1 está em nosso registro em $15/$75. Opus 4.5, 4.6 e 4.8 ficam todos em $5/$25 - um corte de 3× no topo da programação, sem alteração no preço do Sonnet ou Haiku. No meu mês de 240 milhões de tokens, o Opus passou de US$ 6.000 para US$ 2.000.

O efeito colateral: a diferença entre o Opus e o Soneto caiu de 5× para 1,67×. O imposto de fronteira na Antrópico deixou de existir em grande parte. OpenAI fez a mesma coisa em um eixo diferente - o1 a US$ 15/US$ 60 foi substituído por GPT-5 a US$ 1,25/US$ 10, então o item de linha do modelo de fronteira caro orçado em 2025 é uma ordem de magnitude diferente agora.

O Google foi para o outro lado. Eles mantiveram o Pro com um preço razoável de US$ 2/US$ 12 e reduziram o Flash-Lite para US$ 0,05/US$ 0,20, de modo que seu spread interno é agora o mais amplo de qualquer grande família. Nada nisso é acidental – é uma questão de roteamento.

O número do fornecedor cruzado que me incomodou

Custos do Flash Gemini 3.1 $36 nesta carga de trabalho. DeepSeek V4, que eu arquivei mentalmente como "a opção barata", custa $98 – quase 3× mais. E GPT-5.5 por US$ 2.200 é 122× o preço do Gemini 3.1 Flash-Lite a US$ 18 para movimentar o mesmo volume de token.

Eu carregava uma classificação mental de preços de dois anos atrás. Estava errado em ambas as direções. A reputação dos fornecedores baratos fica cerca de um ano atrás das tabelas de preços reais, e os números avançam mais rápido do que o folclore.

O que eu faço com isso

1. Verifico a diferença de níveis antes de construir o roteador. Se o carro-chefe para o mini for inferior a 2×, uma cascata não vale a complexidade ou o orçamento de avaliação - eu pego o carro-chefe e gasto o esforço no cache imediato, o que reduz mais.

2. Se a diferença for de 20×, eu roteio agressivamente. A camada barata lida com classificação, extração, marcação e roteamento. O carro-chefe vê apenas o que falha na verificação de confiança. No spread do Google que transforma US$ 880 em algo próximo a US$ 60 com uma taxa de escalonamento de 10% — a aritmética está no Calculadora de economia em cascata LLM e o calculadora de economia de roteamento de modelo.

3. Eu reavalio toda a linha a cada trimestre. A reavaliação do Opus mudou quais otimizações valiam a pena fazer, e descobri com semanas de atraso. Isso é o que rastreador de mudança de preço é por enquanto.

4. Nunca comparo apenas o preço dos insumos. A saída executa 4× entrada na mediana nos 97 modelos de bate-papo primários que verifiquei e 6× no GPT-5.5 e Gemini 3.1 Pro. Um modelo tagarela com uma taxa de entrada barata perde para um modelo conciso com uma taxa cara com mais frequência do que as pessoas esperam. Se seu aplicativo estiver trocando de modelo, o custo da migração também será importante. Consulte o calculadora de custos de migração de modelo.

Coloque seu próprio token dividido no Calculadora de custos da API AI →ou modele um produto completo no Estimador de custos de aplicativos de IA e o calculadora de custos do chatbot. Novo no preço de tokens? Começar em Aprenda: como funciona o preço da API.

Estimativas de referência, agosto de 2026, retiradas de nosso registro de modelos rastreados. Os preços mudam sem aviso prévio e excluem descontos em cache, lote e volume – verifique com o fornecedor antes de comprometer um orçamento. Não afiliado à OpenAI, Anthropic, Google, xAI, DeepSeek ou Mistral.