Uma solicitação e um token não são a mesma coisa
Um Solicitação de API é uma chamada para o endpoint. Fichas são as unidades de texto dentro dessa chamada. Uma solicitação pode conter alguns tokens ou centenas de milhares. Os provedores de LLM cobram por tokens; muitas outras APIs (pagamentos, mapas, SMS) cobram por solicitação ou por ação. Misturar os dois é o erro orçamentário mais comum.
Onde cada modelo se aplica
| Tipo de API | Faturado por |
|---|---|
| LLM / AI (OpenAI, Antrópico, etc.) | Tokens (entrada + saída) |
| Incorporações | Tokens (somente entrada) |
| Geração de imagem | Por imagem/por etapa |
| Mapas, pesquisa, SMS, pagamentos | Por solicitação/por ação |
Como estimar antes de construir
Para um recurso LLM, estime: tokens por chamada × chamadas por usuário × usuários. Uma resposta de bate-papo pode ter aproximadamente 500 tokens de entrada + aproximadamente 300 tokens de saída; multiplique por conversas mensais para obter o volume de tokens e, em seguida, defina o preço. Isso é muito mais preciso do que adivinhar "por solicitação", porque a contagem de tokens por solicitação varia muito. Mantenha a entrada e a saída separadas o tempo todo - os provedores fixam preços diferentes, geralmente com uma diferença de 3 a 5 vezes, de modo que uma estimativa combinada de "token médio" pode estar errada por uma grande margem.
Custo do token →Custo da janela de contexto →A mesma divisão aparece novamente nos limites de taxa
A maioria dos provedores de LLM limita o uso ambos eixos de uma só vez: um teto de solicitações por minuto (RPM) e um teto de tokens por minuto (TPM). Qual deles você acertar primeiro depende inteiramente de quantos tokens sua chamada média carrega – o número exato sobre o qual esta página se trata.
- Chamadas curtas, alta frequência (por exemplo, um classificador disparando a cada pressionamento de tecla) tendem a acertar o RPM limite primeiro – cada chamada é barata em tokens, mas há muitos deles.
- Chamadas longas, frequência mais baixa (por exemplo, um endpoint de resumo de documento com um contexto de 20 mil tokens) tendem a atingir o TPM limite primeiro – algumas chamadas já podem saturar o orçamento de tokens.
Saber qual limite você atingirá altera a solução: uma carga de trabalho vinculada a RPM se beneficia lote várias chamadas pequenas em uma solicitação maior (menos solicitações, mesmo total de tokens), enquanto uma carga de trabalho vinculada ao TPM se beneficia de aparar contexto ou comprimento de saída em vez de reduzir a frequência da chamada. Ver Limites de taxa de API explicados para os níveis concretos de RPM/TPM por provedor.
Exemplo resolvido: dimensionando um recurso de chatbot
Digamos que você esteja planejando um chatbot de suporte para 5.000 usuários ativos mensais, cada uma em média 2 sessões/mês de 3 voltas cada um. Cada turno carrega aproximadamente 900 tokens de entrada (prompt do sistema + histórico de conversas recentes + mensagem do usuário) e 250 tokens de saída.
- Fichas por turno: 900 + 250 = 1,150
- Turnos por usuário/mês: 3 × 2 = 6
- Tokens por usuário/mês: 1.150 × 6 = 6,900 (≈4.900 entradas / 1.500 saídas)
- Total de tokens mensais: 6.900 × 5.000 = 34,5 milhões (≈24,5M de entrada / ~10M de saída)
Execute os totais de entrada e saída por meio de uma calculadora de custo de token separadamente para o modelo escolhido - como a produção tem um preço mais alto, os 10 milhões de tokens de saída podem custar tanto quanto os 24,5 milhões de tokens de entrada, mesmo que seja um terço do volume.
Calculadora de custos do chatbot →Erros comuns que explodem uma estimativa
- Combinando entrada e saída em um preço. Os tokens de saída são geralmente 3–5× a taxa de entrada – estimar ambos no preço de entrada subestima a conta.
- Esquecendo o histórico de ressentimentos. O bate-papo multiturno que reenvia mensagens anteriores a cada chamada significa que a contagem de tokens por turno aumenta durante uma sessão, não apenas por mensagem.
- Estimativa por caracteres, não por tokens. A contagem de tokens por caractere varia de acordo com o idioma e o conteúdo — código, JSON e texto que não seja em inglês normalmente usam mais tokens por caractere do que o inglês simples.
- Ignorando novas tentativas. Uma chamada com falha que é repetida ainda consome cota de solicitação e, muitas vezes, tokens também, portanto, integrações propensas a erros custam mais do que a matemática do caminho feliz sugere.
- Ignorando o resto do pipeline. Um RAG ou recurso de agente geralmente adiciona solicitações de incorporação, chamadas de pesquisa vetorial e, às vezes, um modelo de roteamento menor – cada um cobrado separadamente, separadamente dos tokens do modelo principal.
Continuar aprendendo
Como funciona o preço da API LLM →Limites de taxa de API →Glossário de custos de IA e API →Perguntas frequentes
Qual é a diferença entre um token e uma solicitação de API?
Uma solicitação de API é uma chamada única para o endpoint; tokens são as unidades de texto dentro dele. Uma solicitação pode conter poucos ou centenas de milhares de tokens. LLMs cobram por token, enquanto muitas outras APIs cobram por solicitação.
Quantos tokens tem uma mensagem típica de chatbot?
Uma mensagem curta do usuário mais um prompt do sistema costuma ter algumas centenas de tokens de entrada e uma resposta, algumas centenas de tokens de saída – aproximadamente 500 a 1.000 tokens por troca, embora varie de acordo com o tamanho do prompt e o detalhamento da resposta.
Como faço para estimar meu uso mensal de tokens?
Multiplique tokens por chamada por chamadas por usuário por número de usuários. Estime os tokens de entrada e saída separadamente, uma vez que eles têm preços diferentes, e depois execute o total por meio de uma calculadora de custo de token para o modelo escolhido.
Um token custa o mesmo, seja como entrada ou saída?
Não – os tokens de saída normalmente têm um preço mais alto do que os tokens de entrada para o mesmo modelo, geralmente de 3 a 5 vezes mais. Manter os totais de entradas e saídas separados, em vez de combiná-los numa média, proporciona uma estimativa de custos muito mais precisa.
O que mais devo orçamentar, além dos tokens do modelo principal?
Em um RAG ou pipeline de agente, o orçamento para incorporação de solicitações, consultas de banco de dados vetoriais e quaisquer chamadas menores de roteamento ou modelo de classificação — cada um é cobrado separadamente dos tokens do modelo principal e pode ser somado em um recurso de alto volume.
Os limites de taxas contam solicitações ou tokens?
Geralmente, os dois ao mesmo tempo – os provedores definem um limite separado de solicitações por minuto (RPM) e de tokens por minuto (TPM), e você atinge o que seu padrão de tráfego satura primeiro. Chamadas curtas de alta frequência tendem a atingir o RPM primeiro; chamadas de contexto longo e de baixa frequência tendem a atingir o TPM primeiro.
Apenas para referência educacional — os preços são estimativas; confirme as taxas atuais na página de preços de cada provedor.