Os tokens de pensamento são cobrados de acordo com a taxa de saída e ocultos da resposta. Uma chamada p50 (típica) e uma chamada p99 (hard) no mesmo modelo executam código idêntico, mas ficam distantes na conta. A diferença – e não a média – é o que destrói o orçamento mensal.

imposto de raciocínio (parcela de pensamento oculto)
custo/chamada (típico)
mensalmente (p50 típico)
mensalmente (cauda p99)

Estimativa ingênua vs típica vs cauda

A linha "ingênua" é o que uma calculadora simbólica simples lhe diz - ela ignora totalmente o pensamento oculto. A diferença em relação à linha típica é o prêmio que você realmente pagará; a lacuna em relação à linha final é o risco orçamentário.

CenárioFichas de pensamentoCusto / chamadaCusto/mêsvs ingênuo

Faixa de orçamento por gravidade final

A amplitude da sua fatura mensal pode variar dependendo do peso da cauda do prompt. Escolha o múltiplo final que corresponda à variação real dos seus prompts.

Cauda múltiplatokens de pensamento p99Custo / chamadaCusto/mês
⚠️ Modelo de referência, julho de 2026. Os tokens de pensamento (raciocínio) são cobrados em cada provedor saída taxa de token e não são retornados na resposta. A contagem de pensamento p50 e o múltiplo final são suas estimativas – extraia números reais do painel de uso do seu provedor, que relata tokens de raciocínio separadamente. Os preços apresentados são taxas de referência editáveis; confirme as taxas ao vivo na página de preços do provedor. · Informar preço desatualizado →

Por que um único número de custo por chamada mente sobre modelos de raciocínio

Um modelo sem raciocínio é quase determinístico em termos de custo: você envia N tokens de entrada, recebe de volta M tokens de saída, multiplica pelas taxas e pronto. Os modelos de raciocínio quebram isso. Entre o prompt e a resposta, o modelo executa uma cadeia privada de pensamento - o fichas de pensamento - e você será cobrado por cada um deles de acordo com a taxa de saída, mesmo que eles nunca apareçam na resposta. Fundamentalmente, a contagem é dependente de dados: uma classificação fácil pode custar algumas centenas, uma prova complexa de várias etapas ou uma mudança de planejamento de ferramenta de agente pode custar dezenas de milhares. Portanto, o verdadeiro custo por chamada não é um número, é uma distribuição, e citar apenas a sua mediana (p50) esconde a parte da distribuição que realmente estoura os orçamentos: a cauda.

O spread p50/p99 e o imposto de raciocínio

O custo por chamada é entrada×preço_de_entrada + (saída_visível + pensamento)×preço_de_saída. Mantenha tudo fixo, exceto o pensamento, e tudo gira em torno dessa variável. Na contagem típica, você obtém seu custo de p50; multiplique o pensamento por um fator de cauda para o caso de prompt rígido e você obterá p99. Com um raciocínio pesado, os dois podem ficar separados por 3 a 5 vezes, o que significa que o mesmo volume mensal pode ser cobrado em qualquer lugar nessa faixa, dependendo apenas de quão difíceis foram os prompts do mês. O imposto de raciocínio — a fração da fatura que está sendo pensada, e não a contribuição que você enviou ou a resposta que recebeu — compensa rotineiramente 70–80% em cargas de trabalho pesadas. Você está pagando principalmente por trabalho temporário. Ver essa participação geralmente é o momento em que as equipes adicionam uma capacidade de raciocínio.

Como encolher a banda

Três alavancas o movem. Limite o esforço de raciocínio ou os tokens de pensamento máximo para que a cauda fisicamente não possa fugir - isso troca um pouco de qualidade de resposta nas solicitações mais difíceis por um teto rígido de custo. Rota por dificuldade: envie a maioria fácil para um modelo barato e sem raciocínio e reserve o modelo de raciocínio para instruções que realmente precisam dele. E monitore o p99, não a média, porque um lote de prompts rígidos levanta a cauda muito antes de mover a média. Observe que cache de prompt corta o lado da entrada, mas não o lado do pensamento, portanto, no tráfego com muito raciocínio, a capacidade de raciocínio é a alavanca que importa - combine isso com o calculadora de token de raciocínio simples para a estimativa pontual e o calculadora de orçamento de loop de agente para o caso de múltiplas etapas.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Custo do token de raciocínioOrçamento do Loop do AgenteCusto do token LLMCompare preços de modelos de IA

Trocas

BybitBinânciaOKXKuCoinBitgetPortão.ioMéxico

Ferramentas e hospedagem

📈 Visualização de Negociação🔒NordVPN💳 RevoluçãoHospedeiro

Como funciona esta calculadora

Ele precifica uma chamada de raciocínio como entrada×preço_de_entrada + (saída_visível + pensamento)×preço_de_saída por milhão de tokens, computando três pontos: uma estimativa ingênua que ignora o pensamento, uma chamada típica (p50) em sua contagem de pensamento típica e uma chamada de cauda (p99) em p50 pensando × seu múltiplo de cauda. Ele relata o imposto de raciocínio (parcela do pensamento na conta p50), os totais mensais típicos e finais em seu volume de chamadas e uma tabela de sensibilidade entre múltiplos finais para que você possa ver toda a faixa do orçamento.

Perguntas frequentes

Por que os modelos de raciocínio são tão imprevisíveis no orçamento?

Eles emitem tokens de pensamento oculto cobrados como saída, e a contagem varia de algumas centenas em um prompt fácil para dezenas de milhares em um prompt difícil. Dimensione o orçamento para uma ligação típica e a cauda poderá faturar de 3 a 5 vezes mais por ligação.

Como calculo o custo do token de raciocínio?

Custo por chamada = entrada×preço_de_entrada + (saída_visível + pensamento)×preço_de_saída, por milhão de tokens. O pensamento é cobrado de acordo com a taxa de produção e é invisível e variável – estime um valor típico e um múltiplo de cauda e defina o preço de ambos.

Qual é o imposto de raciocínio?

A parcela da sua conta que é o pensamento oculto, e não a contribuição ou a resposta. Em chamadas de raciocínio pesado, excede rotineiramente 70-80% – você paga mais pelo trabalho rascunho do que pela conversa visível.