Como funciona o preço da API LLM

Tokens, entrada versus saída, janelas de contexto - por que a mesma tarefa pode custar 50 vezes mais em um modelo do que em outro, explicado de forma simples.

LarAprender › Como funciona o preço da API LLM

Tudo é cobrado por token

Os provedores de LLM não cobram por solicitação ou por palavra – eles cobram por ficha. Um token é um pedaço de texto, aproximadamente ¾ de uma palavra em inglês (cerca de 4 caracteres). "APICostCalc é útil" equivale a aproximadamente 5 tokens. Tanto o texto que você envia (entrada) e o texto que o modelo gera (saída) são contados e geralmente têm um preço diferentemente.

Calculadora de custo de token →

Entrada vs saída – a saída é cara

Em quase todos os modelos, tokens de saída custam mais do que tokens de entrada - geralmente de 3 a 5 vezes mais - porque gerar texto exige mais computação do que lê-lo. É por isso que um chatbot que escreve respostas longas custa muito mais do que um que classifica o texto em uma única palavra, mesmo com o mesmo volume de solicitações.

Gerador de custosEfeito na fatura
Prompt longo do sistema enviado a cada chamadaOs tokens de entrada se multiplicam pela contagem de solicitações
Respostas detalhadas do modeloTokens de saída – o tipo mais caro
Contexto grande (pedaços RAG, histórico)Inserir tokens em balão rapidamente
Modelos de raciocínio/"pensamento"Tokens de raciocínio ocultos cobrados como saída

A janela de contexto é um teto de custo, não um espaço livre

Um modelo janela de contexto (por exemplo, 128 mil ou 1 milhão de tokens) é o máximo que ele pode ler de uma vez – mas cada token que você coloca nele é cobrado todo chamar. Colocar um documento inteiro no contexto de cada solicitação é conveniente e caro; esse é o problema que o RAG e o cache resolvem.

Custo da janela de contexto →Custo do token de raciocínio →

Por que a mesma tarefa varia 50× entre modelos

Os modelos de fronteira podem custar dezenas de dólares por milhão de tokens; modelos pequenos ou abertos alguns centavos. Se um modelo barato realizar a tarefa com qualidade aceitável, você poderá reduzir os custos em uma ordem de grandeza com uma linha de configuração. A habilidade é combinar a força do modelo com a dificuldade da tarefa — veja o guia de corte de custos.

Compare preços de modelos →

Exemplo resolvido: nano vs carro-chefe na mesma tarefa

Digamos que você esteja classificando 100.000 tickets de suporte por mês. Cada chamada envia aproximadamente 2.000 tokens de entrada (texto do ticket + prompt de alguns disparos) e retorna aproximadamente 500 tokens de saída (rótulo + breve explicação) – 200 milhões de tokens de entrada e 50 milhões de tokens de saída no total.

ModeloCusto de entradaCusto de produçãoTotal/mês
GPT-5 nano (US$ 0,10 / US$ 0,40 por 1 milhão)200 milhões × US$ 0,10 = US$ 2050 milhões × US$ 0,40 = US$ 20$40
GPT-5.5 (US$ 5,00 / US$ 30,00 por 1 milhão)200 milhões × US$ 5,00 = US$ 1.00050 milhões × $ 30,00 = $ 1.500$2,500

Mesma tarefa, mesmo volume – o modelo principal custa 62× mais do que o modelo nano, puramente a partir do preço por token. Para uma tarefa limitada como a classificação, testar se a precisão de um modelo barato supera sua barreira geralmente vale mais do que qualquer outra otimização de custos.

Calculadora de custos GPT-5 →

Duas maneiras de reduzir a conta sem mudar de modelo

Nem toda economia vem da escolha de um modelo mais barato. Dois mecanismos do lado do fornecedor descontam o mesmo modelo no mesmo tarefa, apenas mudando como você a chama:

TécnicaDesconto típicoTroca
Cache de prompt~90% de desconto na parte armazenada em cache da entradaApenas o prefixo repetido (prompt do sistema, documento fixo) é descontado — a cauda única de cada solicitação é cobrada normalmente
API de lote~50% de desconto em toda a chamadaOs resultados chegam em minutos ou horas, não em segundos – ótimo para relatórios e rotulagem em massa, não para um chatbot ao vivo

Eles se acumulam com a escolha do modelo, não contra ela: um classificador de tickets de suporte que já roda em um modelo barato pode muitas vezes adicionar processamento em lote, já que a rotulagem noturna não tem nenhum requisito de latência - veja o calculadora de economia de cache imediata e guia de API em lote para obter a matemática exata da sua carga de trabalho.

Erros comuns ao estimar custos de LLM

Continuar aprendendo

Como reduzir sua conta LLM →Tokens vs Solicitações →Como escolher um LLM →

Perguntas frequentes

O que é um token em uma API LLM?

Um token é um pequeno pedaço de texto que o modelo processa – em inglês, aproximadamente ¾ de uma palavra ou cerca de 4 caracteres. Os provedores cobram por token tanto o texto que você envia (entrada) quanto o texto que o modelo gera (saída).

Por que os tokens de saída custam mais do que os tokens de entrada?

A geração de texto requer mais computação do que sua leitura, portanto, os provedores cobram mais pelos tokens de saída – geralmente de 3 a 5 vezes a taxa de entrada. Isso torna as respostas detalhadas do modelo um importante fator de custo.

Uma janela de contexto maior custa mais?

Apenas para os tokens que você realmente usa. A janela tem capacidade máxima, mas cada token colocado no contexto é cobrado em cada chamada, portanto, enviar prompts grandes repetidamente fica caro rapidamente.

Como a mesma tarefa pode custar 50× mais em um modelo?

Os preços dos modelos por milhão de tokens variam enormemente entre modelos de fronteira e modelos pequenos/abertos. Se um modelo mais barato atender aos seus padrões de qualidade para uma determinada tarefa, mudar para ele pode reduzir custos em uma ordem de magnitude.

Posso cortar custos sem mudar de modelo?

Sim – o cache imediato desconta o prefixo repetido de uma solicitação em cerca de 90%, e a API em lote desconta um trabalho não urgente inteiro em cerca de 50%. Ambos se aplicam exatamente ao mesmo modelo, portanto, acumulam qualquer economia na escolha do modelo.

Apenas para referência educacional — os preços são estimativas; confirme as taxas atuais na página de preços de cada provedor.

Tools & Hosting

📈 TradingView🔒 NordVPN💳 RevolutDigitalOcean $200Hostinger