Tokens versus solicitações explicadas

O que realmente é um token, como ele difere de uma solicitação de API e como estimar ambos antes de compilar.

LarAprender › Tokens versus solicitações explicadas

Uma solicitação e um token não são a mesma coisa

Um Solicitação de API é uma chamada para o endpoint. Fichas são as unidades de texto dentro dessa chamada. Uma solicitação pode conter alguns tokens ou centenas de milhares. Os provedores de LLM cobram por tokens; muitas outras APIs (pagamentos, mapas, SMS) cobram por solicitação ou por ação. Misturar os dois é o erro orçamentário mais comum.

Onde cada modelo se aplica

Tipo de APIFaturado por
LLM / AI (OpenAI, Antrópico, etc.)Tokens (entrada + saída)
IncorporaçõesTokens (somente entrada)
Geração de imagemPor imagem/por etapa
Mapas, pesquisa, SMS, pagamentosPor solicitação/por ação
Custo de toda a sua pilha de API →

Como estimar antes de construir

Para um recurso LLM, estime: tokens por chamada × chamadas por usuário × usuários. Uma resposta de bate-papo pode ter aproximadamente 500 tokens de entrada + aproximadamente 300 tokens de saída; multiplique por conversas mensais para obter o volume de tokens e, em seguida, defina o preço. Isso é muito mais preciso do que adivinhar "por solicitação", porque a contagem de tokens por solicitação varia muito. Mantenha a entrada e a saída separadas o tempo todo - os provedores fixam preços diferentes, geralmente com uma diferença de 3 a 5 vezes, de modo que uma estimativa combinada de "token médio" pode estar errada por uma grande margem.

Custo do token →Custo da janela de contexto →

A mesma divisão aparece novamente nos limites de taxa

A maioria dos provedores de LLM limita o uso ambos eixos de uma só vez: um teto de solicitações por minuto (RPM) e um teto de tokens por minuto (TPM). Qual deles você acertar primeiro depende inteiramente de quantos tokens sua chamada média carrega – o número exato sobre o qual esta página se trata.

Saber qual limite você atingirá altera a solução: uma carga de trabalho vinculada a RPM se beneficia lote várias chamadas pequenas em uma solicitação maior (menos solicitações, mesmo total de tokens), enquanto uma carga de trabalho vinculada ao TPM se beneficia de aparar contexto ou comprimento de saída em vez de reduzir a frequência da chamada. Ver Limites de taxa de API explicados para os níveis concretos de RPM/TPM por provedor.

Exemplo resolvido: dimensionando um recurso de chatbot

Digamos que você esteja planejando um chatbot de suporte para 5.000 usuários ativos mensais, cada uma em média 2 sessões/mês de 3 voltas cada um. Cada turno carrega aproximadamente 900 tokens de entrada (prompt do sistema + histórico de conversas recentes + mensagem do usuário) e 250 tokens de saída.

Execute os totais de entrada e saída por meio de uma calculadora de custo de token separadamente para o modelo escolhido - como a produção tem um preço mais alto, os 10 milhões de tokens de saída podem custar tanto quanto os 24,5 milhões de tokens de entrada, mesmo que seja um terço do volume.

Calculadora de custos do chatbot →

Erros comuns que explodem uma estimativa

Continuar aprendendo

Como funciona o preço da API LLM →Limites de taxa de API →Glossário de custos de IA e API →

Perguntas frequentes

Qual é a diferença entre um token e uma solicitação de API?

Uma solicitação de API é uma chamada única para o endpoint; tokens são as unidades de texto dentro dele. Uma solicitação pode conter poucos ou centenas de milhares de tokens. LLMs cobram por token, enquanto muitas outras APIs cobram por solicitação.

Quantos tokens tem uma mensagem típica de chatbot?

Uma mensagem curta do usuário mais um prompt do sistema costuma ter algumas centenas de tokens de entrada e uma resposta, algumas centenas de tokens de saída – aproximadamente 500 a 1.000 tokens por troca, embora varie de acordo com o tamanho do prompt e o detalhamento da resposta.

Como faço para estimar meu uso mensal de tokens?

Multiplique tokens por chamada por chamadas por usuário por número de usuários. Estime os tokens de entrada e saída separadamente, uma vez que eles têm preços diferentes, e depois execute o total por meio de uma calculadora de custo de token para o modelo escolhido.

Um token custa o mesmo, seja como entrada ou saída?

Não – os tokens de saída normalmente têm um preço mais alto do que os tokens de entrada para o mesmo modelo, geralmente de 3 a 5 vezes mais. Manter os totais de entradas e saídas separados, em vez de combiná-los numa média, proporciona uma estimativa de custos muito mais precisa.

O que mais devo orçamentar, além dos tokens do modelo principal?

Em um RAG ou pipeline de agente, o orçamento para incorporação de solicitações, consultas de banco de dados vetoriais e quaisquer chamadas menores de roteamento ou modelo de classificação — cada um é cobrado separadamente dos tokens do modelo principal e pode ser somado em um recurso de alto volume.

Os limites de taxas contam solicitações ou tokens?

Geralmente, os dois ao mesmo tempo – os provedores definem um limite separado de solicitações por minuto (RPM) e de tokens por minuto (TPM), e você atinge o que seu padrão de tráfego satura primeiro. Chamadas curtas de alta frequência tendem a atingir o RPM primeiro; chamadas de contexto longo e de baixa frequência tendem a atingir o TPM primeiro.

Apenas para referência educacional — os preços são estimativas; confirme as taxas atuais na página de preços de cada provedor.

Tools & Hosting

📈 TradingView🔒 NordVPN💳 RevolutDigitalOcean $200Hostinger