Tudo é cobrado por token
Os provedores de LLM não cobram por solicitação ou por palavra – eles cobram por ficha. Um token é um pedaço de texto, aproximadamente ¾ de uma palavra em inglês (cerca de 4 caracteres). "APICostCalc é útil" equivale a aproximadamente 5 tokens. Tanto o texto que você envia (entrada) e o texto que o modelo gera (saída) são contados e geralmente têm um preço diferentemente.
Calculadora de custo de token →Entrada vs saída – a saída é cara
Em quase todos os modelos, tokens de saída custam mais do que tokens de entrada - geralmente de 3 a 5 vezes mais - porque gerar texto exige mais computação do que lê-lo. É por isso que um chatbot que escreve respostas longas custa muito mais do que um que classifica o texto em uma única palavra, mesmo com o mesmo volume de solicitações.
| Gerador de custos | Efeito na fatura |
|---|---|
| Prompt longo do sistema enviado a cada chamada | Os tokens de entrada se multiplicam pela contagem de solicitações |
| Respostas detalhadas do modelo | Tokens de saída – o tipo mais caro |
| Contexto grande (pedaços RAG, histórico) | Inserir tokens em balão rapidamente |
| Modelos de raciocínio/"pensamento" | Tokens de raciocínio ocultos cobrados como saída |
A janela de contexto é um teto de custo, não um espaço livre
Um modelo janela de contexto (por exemplo, 128 mil ou 1 milhão de tokens) é o máximo que ele pode ler de uma vez – mas cada token que você coloca nele é cobrado todo chamar. Colocar um documento inteiro no contexto de cada solicitação é conveniente e caro; esse é o problema que o RAG e o cache resolvem.
Custo da janela de contexto →Custo do token de raciocínio →Por que a mesma tarefa varia 50× entre modelos
Os modelos de fronteira podem custar dezenas de dólares por milhão de tokens; modelos pequenos ou abertos alguns centavos. Se um modelo barato realizar a tarefa com qualidade aceitável, você poderá reduzir os custos em uma ordem de grandeza com uma linha de configuração. A habilidade é combinar a força do modelo com a dificuldade da tarefa — veja o guia de corte de custos.
Compare preços de modelos →Exemplo resolvido: nano vs carro-chefe na mesma tarefa
Digamos que você esteja classificando 100.000 tickets de suporte por mês. Cada chamada envia aproximadamente 2.000 tokens de entrada (texto do ticket + prompt de alguns disparos) e retorna aproximadamente 500 tokens de saída (rótulo + breve explicação) – 200 milhões de tokens de entrada e 50 milhões de tokens de saída no total.
| Modelo | Custo de entrada | Custo de produção | Total/mês |
|---|---|---|---|
| GPT-5 nano (US$ 0,10 / US$ 0,40 por 1 milhão) | 200 milhões × US$ 0,10 = US$ 20 | 50 milhões × US$ 0,40 = US$ 20 | $40 |
| GPT-5.5 (US$ 5,00 / US$ 30,00 por 1 milhão) | 200 milhões × US$ 5,00 = US$ 1.000 | 50 milhões × $ 30,00 = $ 1.500 | $2,500 |
Mesma tarefa, mesmo volume – o modelo principal custa 62× mais do que o modelo nano, puramente a partir do preço por token. Para uma tarefa limitada como a classificação, testar se a precisão de um modelo barato supera sua barreira geralmente vale mais do que qualquer outra otimização de custos.
Calculadora de custos GPT-5 →Duas maneiras de reduzir a conta sem mudar de modelo
Nem toda economia vem da escolha de um modelo mais barato. Dois mecanismos do lado do fornecedor descontam o mesmo modelo no mesmo tarefa, apenas mudando como você a chama:
| Técnica | Desconto típico | Troca |
|---|---|---|
| Cache de prompt | ~90% de desconto na parte armazenada em cache da entrada | Apenas o prefixo repetido (prompt do sistema, documento fixo) é descontado — a cauda única de cada solicitação é cobrada normalmente |
| API de lote | ~50% de desconto em toda a chamada | Os resultados chegam em minutos ou horas, não em segundos – ótimo para relatórios e rotulagem em massa, não para um chatbot ao vivo |
Eles se acumulam com a escolha do modelo, não contra ela: um classificador de tickets de suporte que já roda em um modelo barato pode muitas vezes adicionar processamento em lote, já que a rotulagem noturna não tem nenhum requisito de latência - veja o calculadora de economia de cache imediata e guia de API em lote para obter a matemática exata da sua carga de trabalho.
Erros comuns ao estimar custos de LLM
- Média de entrada e saída em uma contagem de tokens. Como o preço da produção é 3 a 5 vezes mais alto, combiná-los esconde quanto custa realmente um estilo de resposta detalhado.
- Esquecer o prompt do sistema é cobrado por cada chamada. Um longo prompt do sistema ou histórico de conversa conta como tokens de entrada em cada solicitação, não uma vez por sessão.
- Comparação com o lançamento do ponto errado. "GPT-5" e "GPT-5.5" podem ter preços diferenciados - sempre verifique o ID exato do modelo para o qual você realmente ligará, não o sobrenome.
- Ignorando tokens de raciocínio ocultos. Os modelos de "pensamento" consideram o raciocínio interno como tokens de saída, mesmo que ele nunca apareça na resposta visível - veja o calculadora de token de raciocínio.
Perguntas frequentes
O que é um token em uma API LLM?
Um token é um pequeno pedaço de texto que o modelo processa – em inglês, aproximadamente ¾ de uma palavra ou cerca de 4 caracteres. Os provedores cobram por token tanto o texto que você envia (entrada) quanto o texto que o modelo gera (saída).
Por que os tokens de saída custam mais do que os tokens de entrada?
A geração de texto requer mais computação do que sua leitura, portanto, os provedores cobram mais pelos tokens de saída – geralmente de 3 a 5 vezes a taxa de entrada. Isso torna as respostas detalhadas do modelo um importante fator de custo.
Uma janela de contexto maior custa mais?
Apenas para os tokens que você realmente usa. A janela tem capacidade máxima, mas cada token colocado no contexto é cobrado em cada chamada, portanto, enviar prompts grandes repetidamente fica caro rapidamente.
Como a mesma tarefa pode custar 50× mais em um modelo?
Os preços dos modelos por milhão de tokens variam enormemente entre modelos de fronteira e modelos pequenos/abertos. Se um modelo mais barato atender aos seus padrões de qualidade para uma determinada tarefa, mudar para ele pode reduzir custos em uma ordem de magnitude.
Posso cortar custos sem mudar de modelo?
Sim – o cache imediato desconta o prefixo repetido de uma solicitação em cerca de 90%, e a API em lote desconta um trabalho não urgente inteiro em cerca de 50%. Ambos se aplicam exatamente ao mesmo modelo, portanto, acumulam qualquer economia na escolha do modelo.
Apenas para referência educacional — os preços são estimativas; confirme as taxas atuais na página de preços de cada provedor.