Como usar este glossário
As páginas de preços de API e IA estão cheias de jargões que escondem o que você realmente pagará. Abaixo estão 40 dos termos mais comuns, agrupados em Preços e tokens LLM, infraestrutura e auto-hospedagem, e modelos de cobrança. Cada definição é neutra em relação ao fornecedor e focada no ângulo de custo. Novo no faturamento LLM? Comece com nosso como funciona o preço da API LLM guia e, em seguida, estime um número real com o calculadora de custo de token.
Calculadora de custo de token →Todos os guias de aprendizagem →Preços e tokens LLM
- Símbolo
- A pequena unidade de texto que um LLM lê e escreve - em inglês, cerca de ¾ de uma palavra, ou aproximadamente 4 caracteres. O faturamento é por token, portanto, a contagem de tokens (não o número de solicitações) orienta sua fatura do LLM.
- Tokens de entrada
- The tokens you send to the model: your prompt, system instructions, conversation history and any attached context. Geralmente são as mais baratas das duas taxas, mas se multiplicam rapidamente quando você reenvia o contexto em cada chamada.
- Tokens de saída
- Os tokens que o modelo gera em sua resposta. A saída quase sempre tem um preço mais alto do que a entrada – geralmente 3–5× – porque gerar texto custa mais computação do que lê-lo.
- Janela de contexto
- O número máximo de tokens que um modelo pode considerar de uma só vez (por exemplo, 128 mil ou 1 milhão). É um limite de capacidade, não de espaço livre: cada token que você coloca na janela é cobrado em cada ligação.
- Custo por milhão de tokens
- Os preços unitários padrão do LLM são cotados em (tokens de $/1 milhão), listados separadamente para entrada e saída. Multiplicar o volume mensal de tokens por essas taxas é a maneira mais rápida de estimar os gastos.
- Cache de prompt
- Armazenar um prefixo de prompt repetido – uma mensagem ou documento longo do sistema – para que não seja reprocessado a cada chamada. A entrada armazenada em cache é cobrada com um grande desconto (geralmente de 75 a 90% de desconto), reduzindo o custo de cargas de trabalho repetitivas.
- Tokens de raciocínio
- Os tokens de "pensamento" ocultos que alguns modelos geram antes de sua resposta visível. Você não os vê, mas eles são cobrados como resultados – um fator de custo importante e facilmente esquecido nos modelos de raciocínio.
- Tokens multimodais
- Imagens, áudio e vídeo são convertidos em equivalentes de token para cobrança. Uma única imagem de alta resolução pode custar centenas ou milhares de tokens de entrada, portanto, os prompts multimodais aumentam mais rapidamente do que apenas o texto.
- Taxa combinada
- Um único preço médio por token que combina taxas de entrada e saída de acordo com seu mix típico. Útil para estimativas rápidas, embora esconda que a produção é a metade cara da conta.
- API de lote
- Um endpoint assíncrono que processa trabalhos grandes dentro de uma janela de atraso (geralmente de até 24 horas) em troca de um desconto, geralmente em torno de 50%. Ideal para trabalhos não urgentes, como classificação em massa ou incorporações.
- Incorporações
- Vetores numéricos que representam o significado de textos, imagens ou outros dados para que possam ser pesquisados por similaridade. Eles são baratos para gerar por token e sustentam a pesquisa semântica e o RAG.
- Afinação
- Treinar ainda mais um modelo básico com seus próprios exemplos para especializar seu comportamento. Ele adiciona um custo inicial de treinamento e, em modelos hospedados, geralmente uma taxa de inferência por token mais alta do que o modelo básico.
- RAG (geração aumentada de recuperação)
- Um padrão que busca apenas os trechos relevantes de uma base de conhecimento e os adiciona ao prompt, em vez de colocar documentos inteiros no contexto. Ele corta tokens de entrada enquanto mantém as respostas baseadas em seus dados.
- Camada de modelo (carro-chefe/médio/nano)
- Os fornecedores oferecem famílias de modelos em diferentes capacidades e níveis de preço – carro-chefe (mais capaz, mais caro), intermediário (equilibrado) e nano/pequeno (mais barato, mais rápido). Combinar o nível com a dificuldade da tarefa é a maior alavanca no custo.
- Temperatura
- Uma configuração de 0 a cerca de 2 que controla a aleatoriedade na saída. Afeta o estilo de resposta, não diretamente o preço, mas valores mais elevados podem produzir respostas mais longas ou mais variadas que alteram o custo do token de produção.
- Chamada de função/ferramenta
- Permitir que o modelo retorne uma solicitação estruturada para executar uma de suas ferramentas ou APIs definidas. As definições de ferramentas são enviadas como tokens de entrada em cada chamada, e os loops de ferramentas de várias etapas multiplicam o uso total de tokens.
- Transmissão
- Entregar o token de saída do modelo por token à medida que ele é gerado, em vez de em um bloco. Ele melhora a velocidade percebida e reduz o tempo até o primeiro token, mas não altera o preço total do token.
- Destilação
- Treinar um modelo menor de “aluno” para imitar um modelo maior de “professor”. O resultado é muito mais barato por token, mantendo grande parte da qualidade em um conjunto específico de tarefas.
- Quantização
- Reduzindo a precisão numérica dos pesos de um modelo (por exemplo, de 16 bits para 4 bits), para que ele precise de menos memória e seja executado mais rapidamente. Para auto-hosters, isso reduz o custo da GPU, geralmente com uma pequena compensação de qualidade.
- Inferência
- Executar um modelo treinado para produzir uma saída — o ato pelo qual você paga em cada chamada de API. O custo de inferência é escalonado com tokens em APIs hospedadas e com tempo de computação em GPUs auto-hospedadas.
Infraestrutura e auto-hospedagem
- Limite de taxa (RPM / TPM)
- Os limites máximos que um provedor impõe por conta: RPM são solicitações por minuto, TPM são tokens por minuto. Exceder retorna um erro 429, portanto a escala requer lote, fila ou um nível superior.
- Limite de simultaneidade
- O número máximo de solicitações permitidas em andamento ao mesmo tempo. Ele limita quantos trabalhos paralelos você pode executar e, em configurações auto-hospedadas ou provisionadas, dimensiona diretamente o hardware pelo qual você deve pagar.
- TTFT / latência
- TTFT (time-to-first-token) é quanto tempo leva para o primeiro token de saída chegar; latência é o tempo total de resposta. Eles moldam a experiência do usuário e, em GPUs alugadas, maior latência significa mais computação cobrada por solicitação.
- Taxa de transferência
- Quantos tokens ou solicitações um sistema processa por segundo. Uma taxa de transferência mais alta atende mais usuários no mesmo hardware, reduzindo o custo por solicitação quando você auto-hospeda ou reserva capacidade.
- Banco de dados de vetores
- Uma loja otimizada para armazenar embeddings e pesquisá-los por similaridade. Ele potencializa o RAG e a pesquisa semântica e geralmente é precificado por vetores, dimensões e consultas armazenadas, e não por token.
- GPU/VRAM
- O processador gráfico e sua memória de vídeo que executam a inferência de modelo. Um modelo deve caber em VRAM para carregar, portanto, modelos maiores exigem GPUs mais caras e com mais memória – o principal custo da auto-hospedagem.
- Auto-hospedagem
- Executar um modelo aberto em seu próprio hardware ou em hardware alugado, em vez de chamar uma API hospedada. Ele remove taxas por token, mas adiciona custos fixos de GPU, engenharia e capacidade ociosa que só compensam em grandes volumes.
- Saída/largura de banda
- A cobrança pelos dados que saem da rede de um provedor de nuvem. Fácil de esquecer nos orçamentos de IA, as taxas de saída podem ser significativas ao mover grandes conjuntos de dados, mídias ou pesos de modelos entre serviços ou regiões.
- Inicialização a frio (sem servidor)
- O atraso quando uma função sem servidor ou contêiner de modelo sai da inatividade antes de poder responder. Ele adiciona latência e, para modelos grandes com longos tempos de carregamento, pode levá-lo a uma capacidade sempre quente que custa mais.
- Taxa de transferência provisionada
- Reservar uma quantidade fixa e garantida de capacidade do modelo por uma taxa fixa por hora ou mensal, em vez de pagar por token. Ele estabiliza o custo e a latência para tráfego constante de alto volume, mas desperdiça dinheiro quando ocioso.
- Spot vs sob demanda
- As instâncias sob demanda estão disponíveis a qualquer momento pelo preço integral; instâncias spot (preemptivas) usam capacidade ociosa com grande desconto, mas podem ser recuperadas sem aviso prévio. O Spot é adequado para trabalhos em lote interrompíveis, e não para serviços com latência crítica.
- Capacidade de uso comprometido/reservada
- Um desconto em troca do compromisso com um gasto mínimo ou hardware específico durante um a três anos. Ele reduz a taxa efetiva para cargas de trabalho previsíveis, mas prende você.
- SLA (tempo de atividade)
- Um acordo de nível de serviço é a promessa contratual de disponibilidade do fornecedor (por exemplo, 99,9%) e os créditos devidos caso ele não cumpra. Níveis mais altos de SLA geralmente custam mais, mas são importantes para a confiabilidade da produção.
Modelos de faturamento e preços
- Preços por assento versus preços baseados no uso
- Por assento cobra uma taxa fixa para cada usuário, independentemente da atividade; cobranças baseadas no uso do que você realmente consome (tokens, chamadas, computação). Os assentos são previsíveis; o uso aumenta com a demanda e pode aumentar inesperadamente.
- Créditos
- Saldo pré-pago que você compra e saca conforme usa um serviço. Os créditos facilitam o faturamento, mas podem expirar, e seu valor por unidade às vezes obscurece o preço real por token ou por chamada.
- Excedente
- Uso além do limite incluído no seu plano, cobrado em uma taxa separada – geralmente mais alta. Cobranças excedentes são uma fonte comum de contas surpresa quando o tráfego excede o nível no qual você se inscreveu.
- Nível gratuito
- Um subsídio gratuito (crédito mensal, chamadas limitadas ou uma janela de teste) para permitir que você avalie um serviço. É útil para testes, mas raramente é suficiente para produção, e aplicam-se limites ou datas de validade.
- TCO (custo total de propriedade)
- O custo total de execução de uma solução — não apenas taxas de API ou GPU, mas engenharia, monitoramento, armazenamento, saída e despesas gerais. Comparar hospedado com auto-hospedado só faz sentido no TCO, não nas taxas de manchete.
- Custo por usuário
- Seu gasto total com IA ou API dividido por usuários ativos. Ele transforma o uso bruto em uma unidade econômica que você pode comparar com a receita ou o preço da assinatura para verificar se um recurso é lucrativo.
- Marcação de gateway/roteador
- A taxa que um gateway de IA ou roteador modelo adiciona ao preço do provedor subjacente para roteamento, fallback, análise ou faturamento unificado. Conveniente, mas a marcação pode aumentar significativamente o custo efetivo por token.
Perguntas frequentes
O que é um token?
Um token é o pequeno pedaço de texto que um LLM lê e gera – em inglês, aproximadamente ¾ de uma palavra, ou cerca de 4 caracteres. Os provedores cobram por token tanto o texto que você envia (entrada) quanto o texto que o modelo produz (saída), e é por isso que a contagem de tokens, e não a contagem de solicitações, gera uma fatura LLM.
O que é cache imediato?
O cache de prompt permite que um provedor armazene um prefixo repetido – como um longo prompt ou documento do sistema – para que ele não seja reprocessado em todas as chamadas. Os tokens de entrada armazenados em cache são cobrados com um grande desconto (geralmente de 75 a 90% de desconto), reduzindo custos para cargas de trabalho que reenviam o mesmo contexto.
O que TPM e RPM significam em um limite de taxa?
RPM são solicitações por minuto e TPM são tokens por minuto – os dois limites máximos que um provedor impõe à sua conta. Acertar um deles retorna um erro 429, portanto, os aplicativos de alto volume devem agrupar, enfileirar ou solicitar um nível mais alto, em vez de assumir uma taxa de transferência ilimitada.
Apenas para referência educacional – os termos de preços e descontos variam de acordo com o fornecedor; confirme os detalhes atuais na página de preços de cada fornecedor.