Como funciona esta calculadora
O Calculadora de custos da janela de contexto estima quanto custa preencher uma grande janela de contexto em cada chamada de modelo - o cenário por trás pano pipelines e prompts de documentos longos. Multiplica seu tokens de contexto por chamada pelo preço de entrada por milhão de tokens, adiciona seu tokens de saída por chamada vezes o preço de produção por milhãoe dimensiona o total pelo seu ligações por mês para mostrar números por chamada e mensais. O driver dominante é quase sempre o tamanho do contexto: os tokens de entrada se repetem em cada chamada, portanto, uma carga útil de recuperação pesada ou um prompt longo do sistema definem o custo da linha de base muito mais do que a resposta que você recebe.
A principal compensação é a profundidade do contexto versus gastos. Duplicar passagens recuperadas ou preencher o prompt com documentos extras pode multiplicar sua conta sem melhorar as respostas. Use a calculadora para testar se contexto de corte, restringir a recuperação ou mudar para um nível de entrada mais barato reduz o total mensal e observa o número por chamada quando o volume é alto – pequenos valores por chamada aumentam rapidamente em milhares de solicitações.
Perguntas frequentes
Por que uma grande janela de contexto custa tanto?
Você paga o preço de entrada em cada token no contexto, em cada chamada. Um prompt de 32 mil tokens a US$ 2,50/1 milhão equivale a US$ 0,08 de entrada antes que o modelo escreva qualquer coisa – e isso se repete em cada solicitação.
Como posso reduzir o custo do contexto?
Recupere pedaços cada vez menores, resuma o histórico e armazene em cache a parte estática do prompt. O tamanho do contexto é geralmente a maior alavanca em um RAG ou projeto de lei de documento longo.