—
sobrecarga de compactação—compactações
—custo indireto
—custo total de execução
Onde a compactação compensa – acionando o gatilho
Compacte muito cedo e você disparará muitos eventos; compacte tarde demais (ou nunca) e cada etapa relê um contexto enorme. A coluna de custo total geralmente tem um mínimo no meio.
| Compacto em | Compactações | Despesas gerais | Custo total de execução |
|---|
A limpeza que ninguém orçamenta
An autonomous agent has no long-term memory of its own run, so it keeps the whole working context in the prompt: the system instructions, the tool definitions, every tool result it has seen and every step it has taken. Esse contexto cresce monotonicamente e muito antes de transbordar a janela do modelo o agente tem que compactar - entregue todo o contexto ao modelo, receba um resumo compactado e continue a partir do resumo. A compactação é o que mantém um agente de várias horas ativo, mas não é gratuita: resumir um contexto de 150.000 tokens fatura 150.000 tokens de entrada para aquele evento, e uma execução que compacta três ou quatro vezes pode gastar de um quinto a um terço de seu total de tokens apenas nisso. É um custo que nunca aparece no preço por chamada e nunca aparece em uma estimativa simbólica ingênua, e é exatamente por isso que as contas dos agentes são mais altas do que a matemática no verso do envelope. A maneira de controlá-lo é ajustar quando você compacta e quão pequeno você reinicia, e cobrar a releitura com desconto com cache ou um resumidor mais barato. Dimensione o lado multivoltas no calculadora de custos de conversação multivoltas, todo o loop no calculadora de orçamento de loop de agente, e a vitória do cache no calculadora de economia de cache imediata.
Calculadora de orçamento de loop de agenteCusto de conversa em várias voltasCusto da etapa do agente AICusto da janela de contextoEconomia imediata de cache
Como funciona esta calculadora
Simula a corrida passo a passo. O contexto começa no tamanho base e cresce a cada passo; quando ele cruza o gatilho, uma compactação é acionada — todo o contexto é cobrado como entrada mais uma saída resumida — e o contexto é redefinido. Ele soma o custo produtivo (lendo o contexto para executar cada etapa) e a sobrecarga de compactação separadamente e, em seguida, varre o gatilho para encontrar o custo total mínimo.
Perguntas frequentes
O que é compactação de contexto e por que custa dinheiro?
Um agente de longa duração acumula contexto – resultados de ferramentas, mensagens, raciocínio – até se aproximar da janela de contexto do modelo. Para continuar, ele compacta: ele alimenta todo o contexto atual no modelo e pede um resumo compactado, depois continua a partir desse resumo em vez do histórico completo. O problema é que resumir significa reler tudo, então cada evento de compactação cobra todo o contexto como tokens de entrada mais uma pequena saída para o resumo. Uma única compactação de um contexto de 150.000 tokens custa o mesmo que 150.000 tokens de entrada, e um agente longo que compacta várias vezes pode gastar de um quinto a um terço de seu total de tokens apenas nessa manutenção.
Quantas vezes meu agente irá compactar?
Depende de quão rápido o contexto cresce e onde está o gatilho. Se cada etapa adicionar alguns milhares de tokens de saída da ferramenta e o agente compactar quando atingir, digamos, 140.000 tokens e depois redefinir para um resumo de 25.000 tokens, ele compactará aproximadamente toda vez que subir essa lacuna novamente. Uma execução que adiciona 8.000 tokens por etapa e compacta a 140k disparará uma compactação a cada quinze etapas. Esta calculadora simula a execução passo a passo, conta as compactações e separa o custo produtivo das despesas gerais de compactação para que você possa ver a divisão.
Como posso reduzir a sobrecarga de compactação?
Três alavancas o movem. Compactar mais tarde (um gatilho mais alto) significa compactações menores e maiores, mas etapas produtivas mais caras porque o contexto que você releia a cada curva é maior - há um ponto ideal genuíno em vez de sempre que mais alto é melhor. Redefinir para um resumo menor compra mais espaço entre as compactações. E encaminhar o próprio resumo para um modelo mais barato, ou usar o cache imediato para que o prefixo de releitura seja cobrado com desconto, reduz diretamente o custo por evento. A tabela nesta página varre o limite do acionador para que você possa ver como o custo total se curva, e também é mostrada a nunca compactação - geralmente a pior opção porque o contexto cresce sem limites e cada etapa compensa.
A compactação é mais barata do que apenas usar uma janela de contexto maior?
Muitas vezes sim, porque a alternativa à compactação é carregar o histórico completo em cada etapa, e o custo dos insumos aumenta com o quadrado do comprimento do trecho quando nada é aparado. A compactação limita esse crescimento: após cada resumo, o contexto por etapa volta a diminuir, de modo que o custo produtivo permanece aproximadamente linear em vez de quadrático. Você paga uma quantia fixa em cada evento de compactação, mas evita reler milhares de vezes uma transcrição cada vez maior. Para tiragens muito curtas, a sobrecarga não vale a pena; para agentes autônomos de longa duração, geralmente se paga muitas vezes, o que esta calculadora permite confirmar para seus próprios números.