conversa completa
última curva sozinho
versus custo fixo
com janela/cache

O custo acelera com a contagem de turnos

A entrada por turno continua subindo à medida que o histórico se acumula, de modo que a curva de custo cumulativo se curva para cima – dobrando os turnos mais do que dobrando a conta.

Por sua vezEste turno custaCumulativo

Você paga pelo histórico a cada passo

Um modelo de linguagem não tem estado: ele não se lembra de nada entre as chamadas de API, portanto, para continuar uma conversa, seu aplicativo reenvia toda a transcrição — prompt do sistema, todas as mensagens anteriores do usuário e todas as respostas anteriores — como entrada de cada nova solicitação. Isso significa que a entrada cresce uma troca de cada vez, e o custo de toda a conversa cresce aproximadamente com o quadrado do número de voltas, e não linearmente. O último turno de um chat longo é o mais caro porque contém mais histórico, e o prompt fixo do sistema é cobrado uma vez por turno no topo. Três alavancas trazem-no de volta para baixo: uma janela deslizante que mantém apenas os turnos recentes (o custo torna-se linear, ao custo da memória), cache de prompt que cobra o prefixo repetido com um grande desconto, e resumir o antigo se transforma em uma breve recapitulação. Compare uma única janela no calculadora de custos da janela de contexto, dimensione a vitória do cache no calculadora de economia de cache imediata, e custou um assistente completo no calculadora de custos do chatbot.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Calculadora de rendimento provisionado (PTU)Calculadora de marcação do AI GatewayCalculadora de preços de assento versus usoEstimador de custos de aplicativos de IAPreço do wrapper AI