Publicado em 08/07/2026 · números de referência, verifique antes de orçamentar
Quando você cria um chatbot com qualquer API LLM, cada mensagem enviada inclui o histórico completo de conversas como entrada. Não apenas a última pergunta do usuário – todos os turnos anteriores, cada resposta do assistente, tudo. É assim que os LLMs mantêm o contexto. É também como seus custos se transformam silenciosamente em algo surpreendente.
Na mensagem 30 em uma única conversa, a contagem de tokens de entrada cresceu de aproximadamente 1.150 tokens para mais de 11.000. No Tokens de entrada de US$ 5/1 milhão (preço GPT-4o), essa resposta custa quase 7 vezes mais do que a primeira.
Digamos que seu chatbot tenha um prompt de sistema de 1.000 tokens, os usuários enviam mensagens com uma média de 150 tokens e o modelo responde com cerca de 200 tokens de cada vez. Por sua vez k:
entrada (k) = 1.000 (sistema) + (k−1) × (150 + 200) (turnos anteriores) + 150 (mensagem atual)
Isso simplifica para 800 + 350 mil. O custo aumenta linearmente a cada turno – porque cada turno adiciona 350 fichas a cada chamada futura para sempre.
| Vez | Tokens de entrada | Custo de entrada (US$ 5/1 milhão) | Custo total de giro |
|---|---|---|---|
| 1 | 1,150 | $0.0058 | $0.009 |
| 5 | 2,550 | $0.0128 | $0.016 |
| 10 | 4,300 | $0.0215 | $0.025 |
| 20 | 7,800 | $0.039 | $0.042 |
| 30 | 11,300 | $0.0565 | $0.060 |
Os preços são estimativas de referência, julho de 2026. Informar preço desatualizado →
Resultado: 200 tokens × US$ 15/1 milhão = US$ 0,003 por turno. Modelo: GPT-4o (preço de referência de US$ 5/US$ 15).
O turno 30 custa $ 0,060, o turno 1 custa $ 0,009 - um 6,8× diferença para a mesma pergunta do usuário com 150 tokens e resposta com 200 tokens.
Somando todos os 30 turnos: a entrada total na conversa é 186.750 fichas. Custo total:
Se a API fosse sem estado e cada chamada enviasse apenas o turno atual (1.150 tokens), os mesmos 30 turnos custariam 30 × US$ 0,009 = $0.27. O histórico de conversas adiciona $ 0,75 em custo extra de insumos — dinheiro gasto na releitura do que o modelo já processou.
10.000 usuários por dia, cada um com média de 15 turnos:
| Custo diário | Custo mensal | |
|---|---|---|
| Conversas de 15 turnos (com histórico) | $1,840 | $55,200 |
| Apátrida (hipotético, sem história) | $810 | $24,300 |
| Sobrecarga de histórico | $1,030 | $30,900 |
A sobrecarga do histórico não é um bug de faturamento. É o custo estrutural de construir IA conversacional em uma API que precifica cada token em cada chamada. A maioria das equipes descobre isso quando chega a fatura do final do mês.
1. Remova mensagens antigas. Mantenha apenas os últimos N turnos (por exemplo, 5–8). Funciona bem para assistentes de perguntas e respostas factuais, onde o contexto antigo raramente importa. Correção mais barata, implementada em uma tarde. Trade-off: o modelo esquece o contexto inicial.
2. Compress with a summary. Após cada 5 a 10 turnos, ligue para o modelo uma vez para resumir a conversa até agora. Substitua o histórico bruto pelo resumo. Custo: uma chamada extra por N turnos. Benefício: a sobrecarga do histórico permanece praticamente estável, independentemente da duração da conversa.
3. Janela deslizante com filtragem semântica. Mantenha sempre os turnos recentes e inclua seletivamente apenas os turnos mais antigos semanticamente relevantes usando embeddings. Mais complexo, mas preserva o contexto principal sem custo histórico completo. Vale a pena implementar em escala para suporte ou assistentes de pesquisa.
4. Cache de prompt. No Claude e no Gemini, marcar o prompt estático do sistema como armazenável em cache oferece 50–90% de desconto nessa parte. Não ajuda no histórico crescente (que é sempre único), mas reduz a sobrecarga fixa. Custando US$ 0,0050 a partir de um prompt do sistema de 1.000 tokens por chamada, o armazenamento em cache economiza aproximadamente US$ 0,0045 por turno – o que é significativo em milhões de chamadas. Veja o calculadora de economia de cache imediata.
A maioria dos chatbots de produção deveria usar uma janela contínua de 6 a 10 voltas mais uma passagem de compressão em algum limite. "Enviar todo o histórico para sempre" é um padrão razoável para protótipos. É um padrão caro para produção.
Coloque seus próprios números no calculadora de custo do histórico de conversas para ver exatamente onde seu custo vai nas curvas, comparar modelos e estimar economias de compressão. A diferença entre o histórico de 30 giros e uma janela de 5 giros costuma ser um custo 60–70% menor para a mesma experiência de produto.
Cada chamada de API reenvia o histórico completo da conversa como tokens de entrada. Cada turno adiciona a mensagem do usuário e a resposta do assistente a tudo o que se segue – de modo que o tamanho da entrada cresce linearmente com o número de turnos.
A solução mais prática é uma janela contínua: mantenha apenas os últimos 5 a 10 turnos em vez de todo o histórico. Para assistentes onde o contexto é importante, o resumo periódico permite compactar trechos antigos em um parágrafo curto, mantendo o custo estável. Use o calculadora de custo do histórico de conversas para modelar a poupança.
Somente para a parte estática (prompt do sistema, definições de ferramentas). O histórico crescente é único por conversa, por isso não pode ser armazenado em cache. O cache ajuda a reduzir a sobrecarga fixa – a parte do histórico variável pela qual você paga independentemente.
Com GPT-4o a US$ 5/US$ 15 por 1 milhão de tokens, um prompt do sistema de 1.000 tokens, turnos de usuário de 150 tokens e respostas do assistente de 200 tokens: cerca de US$ 1,02 no total. A primeira rodada custa US$ 0,009, a última custa US$ 0,060 — quase 7× mais.
Números de referência baseados nos preços do GPT-4o, junho de 2026 — verifique as taxas atuais na página de preços do provedor.