Publicado em 30 de julho de 2026 · preços de referência, verifique antes de orçamentar
Abra a tabela de preços e o3 e GPT-4.1 parecem idênticos: ambos com entrada de US$ 2,00 e saída de US$ 8,00 por milhão de tokens. Então executei o mesmo trabalho de extração em ambos, esperando a mesma conta. o3 voltou 4,3× mais caro. Mesma entrada, mesma resposta visível, mesma taxa por token. A lacuna é um item de linha que a maioria das pessoas nunca vê na página de preços: tokens de raciocínio.
Os modelos de raciocínio (o1, o3, o4-mini do OpenAI e os modos de raciocínio do GPT-5) não vão direto para uma resposta. Eles geram primeiro uma cadeia privada de pensamento e depois uma resposta curta e visível. Você nunca vê a corrente - mas paga por cada ficha dela, no mínimo. saída avaliar. Em uma tarefa em que o modelo retorna 400 tokens visíveis, ele pode queimar silenciosamente outros 2.000 tokens de raciocínio nos bastidores. Sua fatura é calculada em 2.400 tokens de saída, e não em 400.
Esse é o truque. O preço de tabela é honesto; apenas descreve o preço dos tokens, e os modelos de raciocínio emitem muito mais do tipo caro.
| Modelo | Entrada | Saída | Tipo |
|---|---|---|---|
| GPT-4.1 | $2.00 | $8.00 | Padrão |
| o3 | $2.00 | $8.00 | Raciocínio |
| o4-mini mais barato | $1.10 | $4.40 | Raciocínio |
| o1 | $15.00 | $60.00 | Raciocínio |
| GPT-5 | $1.25 | $10.00 | Híbrido |
Considere uma carga de trabalho em formato real: 1.000 solicitações/dia, cada um com 800 tokens de entrada e 400 tokens de saída visíveis. Execute-o por um mês (30 mil solicitações, 24 milhões de tokens de entrada, 12 milhões de tokens de saída visíveis). Agora adicione a parte oculta. Nas minhas próprias execuções da série O, uma tarefa moderadamente difícil surge 1.500–2.500 tokens de raciocínio; Usarei 2.000 aqui, o que adiciona 60 milhões de tokens de saída faturados além dos 12 milhões visíveis.
| Modelo | Tokens/requisição de raciocínio | Custo/mês |
|---|---|---|
| GPT-4.1 (sem raciocínio) | 0 | $144 |
| o4-mini | ~2.000 | $343 |
| o3 | ~2.000 | $624 |
GPT-4.1 e o3 compartilham uma tabela de preços, mas o3 fatura $ 624 contra $ 144 - porque 72 milhões de tokens de saída (12 milhões visíveis + 60 milhões de raciocínio) percorrem o medidor de US$ 8 em vez de 12 milhões. o4-mini é o meio sensato: mais barato por token, ainda pagando o imposto de raciocínio, então chega a US$ 343 – mais que o dobro de um modelo sem raciocínio que faz o mesmo trabalho visível.
OpenAI exposes a reasoning_effort parameter (minimal / low / medium / high). It's the single biggest knob on this bill, and most code leaves it at the default. Drop o3 from ~2,000 reasoning tokens to ~400 and the same month goes from $ 624 a $ 240. Mesmo modelo, mesma tarefa, um parâmetro – um corte de 62%. Para qualquer coisa que não seja genuinamente um problema difícil de várias etapas, um esforço baixo ou mínimo geralmente passa na avaliação e exclui silenciosamente a maior parte do imposto.
1. Don't reach for a reasoning model by reflex. Extraction, classification, tagging, routing and short summaries don't need a chain of thought. A standard model at the same sticker price costs a quarter as much because it emits no reasoning tokens.
2. Se eu precisar de raciocínio, eu defino reasoning_effort explicitamente e comece devagar, aumentando apenas quando uma avaliação provar que a qualidade da resposta cai.
3. Eu li o completion_tokens_details campo. A resposta da API se divide reasoning_tokens separadamente - é aí que o dinheiro vaza e fica invisível em um modelo mental por solicitação "devolveu 400 tokens".
4. Eu roteio. Tarefa barata → modelo pequeno padrão. Tarefa difícil → modelo de raciocínio com esforço medido. Um roteador simples se paga em dias; veja os números no Calculadora de economia em cascata LLM.
Quer o número exato para o seu mix de tokens? Coloque sua entrada, saída visível e uma estimativa realista do token de raciocínio para o Calculadora de custos da API AI →, ou compare os fornecedores frente a frente no calculadora de custos do chatbot. Novo no preço de tokens? Começar em Aprenda: como funciona o preço da API.
Estimativas de referência, julho de 2026. As contagens de tokens de raciocínio dependem da carga de trabalho e são obtidas de nossas próprias execuções, não de números do fornecedor – meça as suas. Não afiliado à OpenAI.