Janelas de contexto e por que prompts longos ficam caros
A janela de contexto é a quantidade máxima de texto que um modelo pode considerar de uma vez e é uma das partes mais incompreendidas da precificação de IA. Uma janela grande parece um recurso gratuito, mas cada token colocado nela é cobrado em cada chamada. Este guia explica como a janela funciona e por que avisos longos aumentam silenciosamente sua conta.
O que é uma janela de contexto
A janela de contexto é a memória de trabalho do modelo para uma única solicitação, medida em tokens. Ele deve conter tudo o que o modelo considera de uma vez: o prompt do sistema, quaisquer documentos ou exemplos que você incluir, o histórico da conversa, a pergunta atual e o espaço reservado para a resposta do modelo. Juntos, eles devem caber dentro do limite de tokens da janela.
Os modelos anunciam janelas de tamanhos variados, desde alguns milhares de tokens até centenas de milhares ou mais. Uma janela maior permite que você insira mais de uma vez, um livro inteiro, uma grande base de código, mas isso não altera a regra fundamental de cobrança: você paga pelo que investe.
Você paga por toda a janela que usar, por cada chamada
Aqui está a parte que surpreende as pessoas. Ter uma janela de 200.000 tokens não significa que você pague por 200.000 tokens. Isso significa que você pode use até esse número e você será cobrado por quantos realmente incluir, em cada chamada.
Portanto, se você colocar 150.000 tokens de documentos na janela e fizer 10 perguntas, pagará cerca de 150.000 tokens de entrada dez vezes, 1,5 milhão de tokens, e não uma vez. A janela é um teto, não uma assinatura. O contexto longo é poderoso, mas é cobrado incansavelmente por chamada.
Por que prompts longos ficam caros rapidamente
Como os tokens de entrada são cobrados por chamada, a duração do prompt se multiplica pelo volume da chamada. Um prompt 10 vezes mais longo custa aproximadamente 10 vezes mais em tokens de entrada para o mesmo número de chamadas. Dois hábitos enviam avisos por muito tempo sem que as pessoas percebam:
- Crescente histórico de bate-papo, são reenviados integralmente a cada passo, de modo que as mensagens atrasadas em uma longa conversa carregam a transcrição inteira.
- Recuperação (RAG), onde você cola grandes documentos recuperados no prompt para fornecer contexto ao modelo. Recupere muito e cada consulta paga por tudo isso.
Nenhum dos dois está errado, mas ambos precisam de disciplina, pois o custo fica silencioso até a chegada da fatura.
Uma ilustração trabalhada
Exemplo ilustrativo (taxa inventada de US$ 3 por milhão de tokens de entrada). Suponha que cada consulta inclua um contexto recuperado de 50.000 tokens. Uma consulta custa 50.000/1.000.000 x US$ 3 = US$ 0,15 somente na entrada. Execute 100.000 dessas consultas por mês e isso equivale a US$ 15.000 apenas para o contexto que você está reenviando, antes dos custos de produção.
Agora reduza o contexto recuperado para 10.000 tokens, recuperando de forma mais seletiva. As mesmas 100.000 consultas custam US$ 3.000, um quinto desse valor, para um contexto que muitas vezes é igualmente útil porque, de qualquer maneira, o modelo estava se afogando nos 40.000 tokens extras. É por isso que a disciplina de contexto é um dos controles de custos de maior alavancagem que você possui.
Contexto longo também pode prejudicar a qualidade
Mais contexto nem sempre significa melhores respostas. Os modelos podem perder o controle de detalhes ocultos no meio de um prompt muito longo, um padrão em que as informações no início e no final são bem utilizadas, mas o meio é negligenciado. Portanto, uma janela de contexto inchada pode custar mais e produzir resultados piores.
Alimentar o modelo apenas com o material mais relevante geralmente melhora tanto a conta quanto a resposta. A precisão supera o volume: um contexto restrito e bem escolhido de 4.000 tokens frequentemente supera um amplo despejo de 100.000 tokens.
Como manter o contexto enxuto
Táticas práticas para controlar o custo do contexto:
- Recuperar seletivamente. No RAG, retorne apenas os trechos mais relevantes, e não tudo o que corresponde vagamente.
- Resuma curvas antigas. Substitua conversas antigas por um breve resumo em vez de reenviar a transcrição completa.
- Armazene em cache a parte fixa. Se uma grande parte do contexto se repetir nas chamadas, o cache de prompt (consulte esse guia) pode reduzir o custo de reenviá-lo.
- Dimensione a janela corretamente. Escolha um modelo cuja janela corresponda às suas reais necessidades em vez de optar pela maior disponível.
Para ver como o comprimento imediato é mapeado para dinheiro real para cada modelo, coloque suas contagens de tokens na calculadora de custos LLM e verifique o preço da janela por modelo nas páginas de comparação de modelos e /models.
Continuar aprendendo
Ferramentas relacionadas
Perguntas frequentes
Pago pela janela de contexto completa do modelo?
Não. Você paga apenas pelos tokens que realmente incluir em cada solicitação, até o limite da janela. A janela tem capacidade máxima e cada token que você usa dentro dela é cobrado em cada chamada.
Uma janela de contexto maior custa mais por token?
Não necessariamente por token, mas uma janela maior tenta incluir muito mais texto e, como cada token é cobrado por chamada, prompts maiores aumentam o total. Alguns provedores também cobram taxas mais altas acima de determinados períodos de contexto.
Mais contexto é sempre melhor para a qualidade?
Não. Os modelos podem ignorar detalhes ocultos em prompts muito longos, portanto, o excesso de contexto pode aumentar os custos e diminuir a qualidade da resposta. Um contexto menor e bem escolhido geralmente tem melhor desempenho.
Apenas educacional – não aconselhamento financeiro.