O que é um token? (E por que você é cobrado por isso)
Cada vez que você chama um modelo de IA, você não é cobrado por palavra, caractere ou solicitação. Você é cobrado pelo token. Compreender o que realmente é um token é a coisa mais útil que você pode aprender antes de tentar controlar seus custos de API.
Um token é um pedaço de texto, não uma palavra
Um token é a unidade que um modelo de linguagem lê e escreve. Geralmente é um fragmento de uma palavra, em vez de uma palavra inteira. Palavras curtas comuns como the ou and são um único token, mas palavras mais longas ou mais raras são divididas em vários pedaços. Por exemplo, a palavra tokenization pode ser arrombado token + ization, duas fichas.
Uma regra aproximada amplamente usada para o inglês é que 1 token tem cerca de 4 caracteres ou aproximadamente 0,75 palavras. Isso significa que 1.000 tokens equivalem a algo em torno de 750 palavras, e uma única página de texto (cerca de 500 palavras) equivale a aproximadamente 650-700 tokens. Estas são aproximações, não garantias, porque a divisão exata depende do tokenizer do modelo.
Espaços, pontuação e quebras de linha também contam. Até a estrutura invisível do seu prompt consome tokens.
Por que os modelos usam tokens em vez de palavras
Os modelos de linguagem não entendem letras ou palavras diretamente. Eles convertem texto em números e o token é a ponte. Cada token é mapeado para uma entrada no vocabulário do modelo, e o modelo faz todas as contas nessas peças numeradas.
Este design permite que um modelo lide com qualquer idioma, código, emoji ou palavra inventada sem um dicionário fixo de palavras completas. Um raro termo técnico que o modelo nunca viu como um todo ainda pode ser representado como uma sequência de subpeças familiares. A desvantagem é que textos incomuns, códigos ou idiomas diferentes do inglês geralmente usam mais tokens por palavra do que a prosa simples em inglês.
Os tokens de entrada e os tokens de saída têm preços diferentes
Quase todos os provedores cobram duas taxas distintas: uma para tokens de entrada (tudo que você envia, incluindo seu prompt, instruções do sistema e qualquer histórico de conversa) e um para tokens de saída (tudo o que o modelo gera de volta). Os tokens de saída são normalmente várias vezes mais caros que os tokens de entrada.
Aqui está um exemplo ilustrativo para mostrar a mecânica (números inventados para maior clareza, não preços reais): se a entrada custa $ 1 por milhão de tokens e a saída custa $ 5 por milhão de tokens, então uma chamada enviando 2.000 tokens de entrada e recebendo 500 tokens de saída custaria (2.000 / 1.000.000 x $ 1) + (500 / 1.000.000 x $ 5) = $ 0,002 + US$ 0,0025 = US$ 0,0045. Pequeno por chamada, mas multiplique por centenas de milhares de chamadas e isso importa.
Para ver as taxas reais por modelo lado a lado, a comparação de modelos e as páginas /models listam os preços atuais de entrada e saída para cada fornecedor, para que você não fique adivinhando.
O histórico de conversas é cobrado a cada turno
A surpresa de faturamento mais comum é que os modelos de chat não têm estado. O modelo não se lembra de suas mensagens anteriores entre as chamadas. Para manter o contexto, seu aplicativo reenvia todo o histórico da conversa a cada novo turno.
Isso significa que um bate-papo longo fica mais caro a cada mensagem, porque a transcrição crescente é reenviada como tokens de entrada todas as vezes. Uma conversa de 20 mensagens pode enviar silenciosamente dezenas de milhares de tokens de entrada em seu turno final. Se seus custos aumentarem durante sessões longas, geralmente é esse o motivo. O cache de prompt (abordado em seu próprio guia) é uma maneira de atenuar isso.
Como estimar sua fatura antes de construir
Você pode obter uma estimativa viável com três números: média de tokens de entrada por chamada, média de tokens de saída por chamada e quantas chamadas você espera por dia ou mês. Multiplique cada contagem de token por sua taxa por token e some-os.
- Estimar contagens de tokens obtendo uma amostra realista de prompt e resposta e, em seguida, dividindo a contagem de caracteres por 4 ou usando uma ferramenta tokenizadora para precisão.
- Multiplicar por volume para obter um valor diário ou mensal.
- Adicionar um buffer de 20 a 30% para novas tentativas, resultados mais longos do que o esperado e histórico crescente de bate-papo.
A calculadora de custos do LLM faz essas contas para você: insira a contagem de tokens e o volume de chamadas, escolha um modelo e retorne um custo mensal estimado para que você possa comparar as opções antes de escrever qualquer código.
Maneiras práticas de usar menos tokens
Quando você pensa em tokens, a economia se torna óbvia. Apare os prompts do sistema que repetem as mesmas instruções literalmente em todas as chamadas. Resuma conversas antigas em vez de reenviá-las por completo. Peça resultados concisos quando não precisar de respostas longas, pois os tokens de saída custam mais.
A escolha de um modelo menor para tarefas simples costuma ser a maior alavanca de todas, porque a diferença de preço por token entre um modelo principal e um modelo leve pode ser 10x ou mais. Combine o modelo com a dificuldade do trabalho, em vez de optar pelo mais poderoso.
Continuar aprendendo
Ferramentas relacionadas
Perguntas frequentes
Quantos tokens é uma frase típica?
Uma frase curta em inglês de 15 a 20 palavras geralmente custa cerca de 20 a 30 tokens. Como regra geral, espere cerca de 0,75 palavras por token, de modo que a contagem de tokens seja um pouco maior do que a contagem de palavras.
Pago pelos tokens na resposta do modelo?
Sim. Os tokens de saída são cobrados separadamente dos tokens de entrada e geralmente são os mais caros dos dois, portanto, respostas mais longas custam visivelmente mais.
Por que os textos que não estão em inglês custam mais?
A maioria dos tokenizadores são otimizados para inglês, portanto, outras linguagens e códigos geralmente são divididos em mais tokens por palavra. O mesmo significado pode custar de 1,5 a 2x mais tokens em alguns idiomas.
Apenas educacional – não aconselhamento financeiro.