Como funciona o preço da API LLM

Tokens, entrada versus saída, janelas de contexto - por que a mesma tarefa pode custar 50 vezes mais em um modelo do que em outro, explicado de forma simples.

LarAprender › Como funciona o preço da API LLM

Tudo é cobrado por token

Os provedores de LLM não cobram por solicitação ou por palavra – eles cobram por ficha. Um token é um pedaço de texto, aproximadamente ¾ de uma palavra em inglês (cerca de 4 caracteres). "APICostCalc é útil" equivale a aproximadamente 5 tokens. Tanto o texto que você envia (entrada) e o texto que o modelo gera (saída) são contados e geralmente têm um preço diferentemente.

Calculadora de custo de token →

Entrada vs saída – a saída é cara

Em quase todos os modelos, tokens de saída custam mais do que tokens de entrada - geralmente de 3 a 5 vezes mais - porque gerar texto exige mais computação do que lê-lo. É por isso que um chatbot que escreve respostas longas custa muito mais do que um que classifica o texto em uma única palavra, mesmo com o mesmo volume de solicitações.

Gerador de custosEfeito na fatura
Prompt longo do sistema enviado a cada chamadaOs tokens de entrada se multiplicam pela contagem de solicitações
Respostas detalhadas do modeloTokens de saída – o tipo mais caro
Contexto grande (pedaços RAG, histórico)Inserir tokens em balão rapidamente
Modelos de raciocínio/"pensamento"Tokens de raciocínio ocultos cobrados como saída

A janela de contexto é um teto de custo, não um espaço livre

Um modelo janela de contexto (por exemplo, 128 mil ou 1 milhão de tokens) é o máximo que ele pode ler de uma vez – mas cada token que você coloca nele é cobrado todo chamar. Colocar um documento inteiro no contexto de cada solicitação é conveniente e caro; esse é o problema que o RAG e o cache resolvem.

Custo da janela de contexto →Custo do token de raciocínio →

Por que a mesma tarefa varia 50× entre modelos

Os modelos de fronteira podem custar dezenas de dólares por milhão de tokens; modelos pequenos ou abertos alguns centavos. Se um modelo barato realizar a tarefa com qualidade aceitável, você poderá reduzir os custos em uma ordem de grandeza com uma linha de configuração. A habilidade é combinar a força do modelo com a dificuldade da tarefa — veja o guia de corte de custos.

Compare preços de modelos →

Perguntas frequentes

O que é um token em uma API LLM?

Um token é um pequeno pedaço de texto que o modelo processa – em inglês, aproximadamente ¾ de uma palavra ou cerca de 4 caracteres. Os provedores cobram por token tanto o texto que você envia (entrada) quanto o texto que o modelo gera (saída).

Por que os tokens de saída custam mais do que os tokens de entrada?

A geração de texto requer mais computação do que sua leitura, portanto, os provedores cobram mais pelos tokens de saída – geralmente de 3 a 5 vezes a taxa de entrada. Isso torna as respostas detalhadas do modelo um importante fator de custo.

Uma janela de contexto maior custa mais?

Apenas para os tokens que você realmente usa. A janela tem capacidade máxima, mas cada token colocado no contexto é cobrado em cada chamada, portanto, enviar prompts grandes repetidamente fica caro rapidamente.

Como a mesma tarefa pode custar 50× mais em um modelo?

Os preços dos modelos por milhão de tokens variam enormemente entre modelos de fronteira e modelos pequenos/abertos. Se um modelo mais barato atender aos seus padrões de qualidade para uma determinada tarefa, mudar para ele pode reduzir custos em uma ordem de magnitude.

Apenas para referência educacional — os preços são estimativas; confirme as taxas atuais na página de preços de cada provedor.