Tudo é cobrado por token
Os provedores de LLM não cobram por solicitação ou por palavra – eles cobram por ficha. Um token é um pedaço de texto, aproximadamente ¾ de uma palavra em inglês (cerca de 4 caracteres). "APICostCalc é útil" equivale a aproximadamente 5 tokens. Tanto o texto que você envia (entrada) e o texto que o modelo gera (saída) são contados e geralmente têm um preço diferentemente.
Calculadora de custo de token →Entrada vs saída – a saída é cara
Em quase todos os modelos, tokens de saída custam mais do que tokens de entrada - geralmente de 3 a 5 vezes mais - porque gerar texto exige mais computação do que lê-lo. É por isso que um chatbot que escreve respostas longas custa muito mais do que um que classifica o texto em uma única palavra, mesmo com o mesmo volume de solicitações.
| Gerador de custos | Efeito na fatura |
|---|---|
| Prompt longo do sistema enviado a cada chamada | Os tokens de entrada se multiplicam pela contagem de solicitações |
| Respostas detalhadas do modelo | Tokens de saída – o tipo mais caro |
| Contexto grande (pedaços RAG, histórico) | Inserir tokens em balão rapidamente |
| Modelos de raciocínio/"pensamento" | Tokens de raciocínio ocultos cobrados como saída |
A janela de contexto é um teto de custo, não um espaço livre
Um modelo janela de contexto (por exemplo, 128 mil ou 1 milhão de tokens) é o máximo que ele pode ler de uma vez – mas cada token que você coloca nele é cobrado todo chamar. Colocar um documento inteiro no contexto de cada solicitação é conveniente e caro; esse é o problema que o RAG e o cache resolvem.
Custo da janela de contexto →Custo do token de raciocínio →Por que a mesma tarefa varia 50× entre modelos
Os modelos de fronteira podem custar dezenas de dólares por milhão de tokens; modelos pequenos ou abertos alguns centavos. Se um modelo barato realizar a tarefa com qualidade aceitável, você poderá reduzir os custos em uma ordem de grandeza com uma linha de configuração. A habilidade é combinar a força do modelo com a dificuldade da tarefa — veja o guia de corte de custos.
Compare preços de modelos →Perguntas frequentes
O que é um token em uma API LLM?
Um token é um pequeno pedaço de texto que o modelo processa – em inglês, aproximadamente ¾ de uma palavra ou cerca de 4 caracteres. Os provedores cobram por token tanto o texto que você envia (entrada) quanto o texto que o modelo gera (saída).
Por que os tokens de saída custam mais do que os tokens de entrada?
A geração de texto requer mais computação do que sua leitura, portanto, os provedores cobram mais pelos tokens de saída – geralmente de 3 a 5 vezes a taxa de entrada. Isso torna as respostas detalhadas do modelo um importante fator de custo.
Uma janela de contexto maior custa mais?
Apenas para os tokens que você realmente usa. A janela tem capacidade máxima, mas cada token colocado no contexto é cobrado em cada chamada, portanto, enviar prompts grandes repetidamente fica caro rapidamente.
Como a mesma tarefa pode custar 50× mais em um modelo?
Os preços dos modelos por milhão de tokens variam enormemente entre modelos de fronteira e modelos pequenos/abertos. Se um modelo mais barato atender aos seus padrões de qualidade para uma determinada tarefa, mudar para ele pode reduzir custos em uma ordem de magnitude.
Apenas para referência educacional — os preços são estimativas; confirme as taxas atuais na página de preços de cada provedor.