Os provedores definem o preço dos tokens de entrada e saída separadamente — e a produção geralmente custa 3 a 5 vezes mais que o insumo. Portanto, uma solicitação curta com uma resposta longa pode custar mais do que uma solicitação longa com uma resposta curta. Insira seus dois números e veja o custo real por chamada em todos os modelos.
Custo por chamada por modelo
Seu token conta, cada modelo classificado como mais barato primeiro. Os preços são por 1 milhão de tokens.
| Modelo | Em US$/1 milhão | Fora $/1 milhão | Custo / chamada |
|---|
Como funciona o custo do token
A fórmula é simples: custo = (tokens de entrada ÷ 1.000.000 × preço de entrada) + (tokens de saída ÷ 1.000.000 × preço de saída). Os dois preços são propositalmente diferentes – gerar texto (saída) é mais caro do que lê-lo (entrada), normalmente de 3 a 5×. É por isso que a maior alavanca na sua conta geralmente é limitando o comprimento da saída, não cortando o prompt. Como um guia aproximado, 1.000 tokens ≈ 750 palavras em inglês, mas o código e outras linguagens são tokenizados de maneira diferente, portanto, meça com o tokenizer do provedor para obter números exatos.
Próximas etapas
Estimando um produto inteiro, não uma ligação? Use o Calculadora de custos de API de IA ou o Estimador de custos de aplicativos de IA. Construindo um agente ou chatbot? Experimente o Calculadora de custos do agente de IA ou calculadora de custos do chatbot. Reutilizando o mesmo contexto em todas as chamadas? Cache de prompt e trabalhos em lote cada corte custa ainda mais.