Os tokens de pensamento são cobrados de acordo com a taxa de saída e ocultos da resposta. Uma chamada p50 (típica) e uma chamada p99 (hard) no mesmo modelo executam código idêntico, mas ficam distantes na conta. A diferença – e não a média – é o que destrói o orçamento mensal.
Estimativa ingênua vs típica vs cauda
A linha "ingênua" é o que uma calculadora simbólica simples lhe diz - ela ignora totalmente o pensamento oculto. A diferença em relação à linha típica é o prêmio que você realmente pagará; a lacuna em relação à linha final é o risco orçamentário.
| Cenário | Fichas de pensamento | Custo / chamada | Custo/mês | vs ingênuo |
|---|
Faixa de orçamento por gravidade final
A amplitude da sua fatura mensal pode variar dependendo do peso da cauda do prompt. Escolha o múltiplo final que corresponda à variação real dos seus prompts.
| Cauda múltipla | tokens de pensamento p99 | Custo / chamada | Custo/mês |
|---|
Por que um único número de custo por chamada mente sobre modelos de raciocínio
Um modelo sem raciocínio é quase determinístico em termos de custo: você envia N tokens de entrada, recebe de volta M tokens de saída, multiplica pelas taxas e pronto. Os modelos de raciocínio quebram isso. Entre o prompt e a resposta, o modelo executa uma cadeia privada de pensamento - o fichas de pensamento - e você será cobrado por cada um deles de acordo com a taxa de saída, mesmo que eles nunca apareçam na resposta. Fundamentalmente, a contagem é dependente de dados: uma classificação fácil pode custar algumas centenas, uma prova complexa de várias etapas ou uma mudança de planejamento de ferramenta de agente pode custar dezenas de milhares. Portanto, o verdadeiro custo por chamada não é um número, é uma distribuição, e citar apenas a sua mediana (p50) esconde a parte da distribuição que realmente estoura os orçamentos: a cauda.
O spread p50/p99 e o imposto de raciocínio
O custo por chamada é entrada×preço_de_entrada + (saída_visível + pensamento)×preço_de_saída. Mantenha tudo fixo, exceto o pensamento, e tudo gira em torno dessa variável. Na contagem típica, você obtém seu custo de p50; multiplique o pensamento por um fator de cauda para o caso de prompt rígido e você obterá p99. Com um raciocínio pesado, os dois podem ficar separados por 3 a 5 vezes, o que significa que o mesmo volume mensal pode ser cobrado em qualquer lugar nessa faixa, dependendo apenas de quão difíceis foram os prompts do mês. O imposto de raciocínio — a fração da fatura que está sendo pensada, e não a contribuição que você enviou ou a resposta que recebeu — compensa rotineiramente 70–80% em cargas de trabalho pesadas. Você está pagando principalmente por trabalho temporário. Ver essa participação geralmente é o momento em que as equipes adicionam uma capacidade de raciocínio.
Como encolher a banda
Três alavancas o movem. Limite o esforço de raciocínio ou os tokens de pensamento máximo para que a cauda fisicamente não possa fugir - isso troca um pouco de qualidade de resposta nas solicitações mais difíceis por um teto rígido de custo. Rota por dificuldade: envie a maioria fácil para um modelo barato e sem raciocínio e reserve o modelo de raciocínio para instruções que realmente precisam dele. E monitore o p99, não a média, porque um lote de prompts rígidos levanta a cauda muito antes de mover a média. Observe que cache de prompt corta o lado da entrada, mas não o lado do pensamento, portanto, no tráfego com muito raciocínio, a capacidade de raciocínio é a alavanca que importa - combine isso com o calculadora de token de raciocínio simples para a estimativa pontual e o calculadora de orçamento de loop de agente para o caso de múltiplas etapas.
Trocas
Ferramentas e hospedagem
Como funciona esta calculadora
Ele precifica uma chamada de raciocínio como entrada×preço_de_entrada + (saída_visível + pensamento)×preço_de_saída por milhão de tokens, computando três pontos: uma estimativa ingênua que ignora o pensamento, uma chamada típica (p50) em sua contagem de pensamento típica e uma chamada de cauda (p99) em p50 pensando × seu múltiplo de cauda. Ele relata o imposto de raciocínio (parcela do pensamento na conta p50), os totais mensais típicos e finais em seu volume de chamadas e uma tabela de sensibilidade entre múltiplos finais para que você possa ver toda a faixa do orçamento.
Perguntas frequentes
Por que os modelos de raciocínio são tão imprevisíveis no orçamento?
Eles emitem tokens de pensamento oculto cobrados como saída, e a contagem varia de algumas centenas em um prompt fácil para dezenas de milhares em um prompt difícil. Dimensione o orçamento para uma ligação típica e a cauda poderá faturar de 3 a 5 vezes mais por ligação.
Como calculo o custo do token de raciocínio?
Custo por chamada = entrada×preço_de_entrada + (saída_visível + pensamento)×preço_de_saída, por milhão de tokens. O pensamento é cobrado de acordo com a taxa de produção e é invisível e variável – estime um valor típico e um múltiplo de cauda e defina o preço de ambos.
Qual é o imposto de raciocínio?
A parcela da sua conta que é o pensamento oculto, e não a contribuição ou a resposta. Em chamadas de raciocínio pesado, excede rotineiramente 70-80% – você paga mais pelo trabalho rascunho do que pela conversa visível.