HomeBlog › O imposto sobre tokens de raciocínio

O imposto do token de raciocínio: por que o3 custa 4 × GPT-4.1 pelo mesmo preço de etiqueta

Publicado em 30 de julho de 2026 · preços de referência, verifique antes de orçamentar

Abra a tabela de preços e o3 e GPT-4.1 parecem idênticos: ambos com entrada de US$ 2,00 e saída de US$ 8,00 por milhão de tokens. Então executei o mesmo trabalho de extração em ambos, esperando a mesma conta. o3 voltou 4,3× mais caro. Mesma entrada, mesma resposta visível, mesma taxa por token. A lacuna é um item de linha que a maioria das pessoas nunca vê na página de preços: tokens de raciocínio.

Os tokens de raciocínio são cobrados e são cobrados como saída

Os modelos de raciocínio (o1, o3, o4-mini do OpenAI e os modos de raciocínio do GPT-5) não vão direto para uma resposta. Eles geram primeiro uma cadeia privada de pensamento e depois uma resposta curta e visível. Você nunca vê a corrente - mas paga por cada ficha dela, no mínimo. saída avaliar. Em uma tarefa em que o modelo retorna 400 tokens visíveis, ele pode queimar silenciosamente outros 2.000 tokens de raciocínio nos bastidores. Sua fatura é calculada em 2.400 tokens de saída, e não em 400.

Esse é o truque. O preço de tabela é honesto; apenas descreve o preço dos tokens, e os modelos de raciocínio emitem muito mais do tipo caro.

Os preços principais ($ por 1 milhão de tokens)

ModeloEntradaSaídaTipo
GPT-4.1$2.00$8.00Padrão
o3$2.00$8.00Raciocínio
o4-mini mais barato$1.10$4.40Raciocínio
o1$15.00$60.00Raciocínio
GPT-5$1.25$10.00Híbrido
⚠️ Preços de referência, julho 2026. Verifique sempre na página do fornecedor. Experimente seus próprios números no calculadora de custos. · Informar preço desatualizado →

A matemática concreta

Considere uma carga de trabalho em formato real: 1.000 solicitações/dia, cada um com 800 tokens de entrada e 400 tokens de saída visíveis. Execute-o por um mês (30 mil solicitações, 24 milhões de tokens de entrada, 12 milhões de tokens de saída visíveis). Agora adicione a parte oculta. Nas minhas próprias execuções da série O, uma tarefa moderadamente difícil surge 1.500–2.500 tokens de raciocínio; Usarei 2.000 aqui, o que adiciona 60 milhões de tokens de saída faturados além dos 12 milhões visíveis.

ModeloTokens/requisição de raciocínioCusto/mês
GPT-4.1 (sem raciocínio)0$144
o4-mini~2.000$343
o3~2.000$624

GPT-4.1 e o3 compartilham uma tabela de preços, mas o3 fatura $ 624 contra $ 144 - porque 72 milhões de tokens de saída (12 milhões visíveis + 60 milhões de raciocínio) percorrem o medidor de US$ 8 em vez de 12 milhões. o4-mini é o meio sensato: mais barato por token, ainda pagando o imposto de raciocínio, então chega a US$ 343 – mais que o dobro de um modelo sem raciocínio que faz o mesmo trabalho visível.

A alavanca que ninguém coloca: reasoning_effort

OpenAI exposes a reasoning_effort parameter (minimal / low / medium / high). It's the single biggest knob on this bill, and most code leaves it at the default. Drop o3 from ~2,000 reasoning tokens to ~400 and the same month goes from $ 624 a $ 240. Mesmo modelo, mesma tarefa, um parâmetro – um corte de 62%. Para qualquer coisa que não seja genuinamente um problema difícil de várias etapas, um esforço baixo ou mínimo geralmente passa na avaliação e exclui silenciosamente a maior parte do imposto.

O que eu realmente faço agora

1. Don't reach for a reasoning model by reflex. Extraction, classification, tagging, routing and short summaries don't need a chain of thought. A standard model at the same sticker price costs a quarter as much because it emits no reasoning tokens.

2. Se eu precisar de raciocínio, eu defino reasoning_effort explicitamente e comece devagar, aumentando apenas quando uma avaliação provar que a qualidade da resposta cai.

3. Eu li o completion_tokens_details campo. A resposta da API se divide reasoning_tokens separadamente - é aí que o dinheiro vaza e fica invisível em um modelo mental por solicitação "devolveu 400 tokens".

4. Eu roteio. Tarefa barata → modelo pequeno padrão. Tarefa difícil → modelo de raciocínio com esforço medido. Um roteador simples se paga em dias; veja os números no Calculadora de economia em cascata LLM.

Quer o número exato para o seu mix de tokens? Coloque sua entrada, saída visível e uma estimativa realista do token de raciocínio para o Calculadora de custos da API AI →, ou compare os fornecedores frente a frente no calculadora de custos do chatbot. Novo no preço de tokens? Começar em Aprenda: como funciona o preço da API.

Estimativas de referência, julho de 2026. As contagens de tokens de raciocínio dependem da carga de trabalho e são obtidas de nossas próprias execuções, não de números do fornecedor – meça as suas. Não afiliado à OpenAI.