—última curva sozinho
—versus custo fixo
—com janela/cache
O custo acelera com a contagem de turnos
A entrada por turno continua subindo à medida que o histórico se acumula, de modo que a curva de custo cumulativo se curva para cima – dobrando os turnos mais do que dobrando a conta.
| Por sua vez | Este turno custa | Cumulativo |
|---|
Você paga pelo histórico a cada passo
Um modelo de linguagem não tem estado: ele não se lembra de nada entre as chamadas de API, portanto, para continuar uma conversa, seu aplicativo reenvia toda a transcrição — prompt do sistema, todas as mensagens anteriores do usuário e todas as respostas anteriores — como entrada de cada nova solicitação. Isso significa que a entrada cresce uma troca de cada vez, e o custo de toda a conversa cresce aproximadamente com o quadrado do número de voltas, e não linearmente. O último turno de um chat longo é o mais caro porque contém mais histórico, e o prompt fixo do sistema é cobrado uma vez por turno no topo. Três alavancas trazem-no de volta para baixo: uma janela deslizante que mantém apenas os turnos recentes (o custo torna-se linear, ao custo da memória), cache de prompt que cobra o prefixo repetido com um grande desconto, e resumir o antigo se transforma em uma breve recapitulação. Compare uma única janela no calculadora de custos da janela de contexto, dimensione a vitória do cache no calculadora de economia de cache imediata, e custou um assistente completo no calculadora de custos do chatbot.
Calculadora de rendimento provisionado (PTU)Calculadora de marcação do AI GatewayCalculadora de preços de assento versus usoEstimador de custos de aplicativos de IAPreço do wrapper AI
Como funciona esta calculadora
Calculadora gratuita de custo de bate-papo multiturno - como cada turno reenvia todo o histórico, o custo da conversa LLM aumenta com o quadrado da contagem de turnos, não linearmente.
Perguntas frequentes
Por que um bate-papo longo custa mais do que sugere o número de mensagens?
Como um LLM não tem memória entre chamadas, cada turno deve reenviar toda a conversa anterior como entrada para que o modelo possa ver o contexto. No turno dez, o modelo relê todas as nove trocas anteriores mais o prompt do sistema, no turno vinte ele relê dezenove e assim por diante. Os tokens de entrada, portanto, aumentam a cada turno, e o custo cumulativo de toda a conversa cresce aproximadamente com o quadrado da contagem de turnos, em vez de linearmente. Uma conversa de cem voltas pode custar muito mais do que cem chamadas de uma só vez com o mesmo tamanho de mensagem – o histórico é o que você paga, indefinidamente.
Como posso impedir que o custo da conversa exploda?
Três alavancas. Uma janela deslizante mantém apenas as últimas voltas do histórico, limitando a entrada a um tamanho fixo para que o custo cresça linearmente em vez de quadraticamente – ao preço do modelo esquecer o contexto mais antigo. O cache de prompt permite que o provedor armazene o prefixo repetido e fature-o com um grande desconto em cada reutilização, o que é ideal quando o histórico inicial e o prompt do sistema permanecem idênticos. E o resumo comprime as curvas antigas em uma breve recapitulação para que você mantenha o significado sem guardar os tokens. Esta calculadora mostra o custo ingênuo do histórico completo junto com uma versão em janela e em cache para que você possa ver qual alavanca compensa para a duração da sua conversa.
Um prompt maior do sistema é importante em uma conversa longa?
Sim, mais do que as pessoas esperam, porque o prompt do sistema é reenviado a cada turno. Um prompt do sistema de 2.000 tokens em uma conversa de cinquenta voltas é cobrado cinquenta vezes – cem mil tokens de entrada antes que qualquer mensagem do usuário seja contada. Em bate-papos longos ou de alto volume, o prompt fixo do sistema costuma representar uma parcela maior da conta do que a conversa real, que é exatamente o tipo de custo que o cache de prompt foi projetado para remover. A calculadora separa a contribuição do prompt do sistema para que você possa ver se vale a pena cortá-la ou armazená-la em cache.