Como funciona esta calculadora
O Calculadora de economia de compressão imediata estima quanto você economiza em custos de entrada de API ao reduzir um prompt repetido. Você insere seu tokens de prompt atuais por chamada, o tokens de prompt compactados por chamada depois de cortar o prompt do sistema e alguns exemplos, seu número de ligações por mês, e seu preço de entrada por milhão de tokens. Ele multiplica a redução de token por chamada pelo volume mensal de chamadas e pela taxa de entrada para mostrar o custo mensal que você evita e, em seguida, anualiza-o. Como um prompt do sistema e seus exemplos são enviados cada pedido, mesmo uma modesta redução por chamada se transforma em um número significativo em escala, que é o que esta ferramenta torna visível.
A principal compensação a observar é que menos tokens podem significar menos contexto para o modelo. Cortar instruções ou descartar exemplos de poucos disparos pode diminuir a precisão, aumentar novas tentativas ou produzir resultados mais longos - e os tokens de saída geralmente têm preços mais altos e são não contados aqui, uma vez que esta calculadora apenas modela a economia de insumos. Use-o para priorizar a compactação nos endpoints de maior volume, onde a mesma edição compensa mais, mas validar a qualidade após cada corte antes de assumir que a poupança é real. Um prompt que é mais barato por chamada, mas que precisa de uma segunda tentativa, pode custar mais no geral, portanto, meça a qualidade da resposta junto com a contagem de tokens, em vez de otimizar os tokens isoladamente.
Perguntas frequentes
Quanto o corte do meu prompt realmente economiza?
Cada token removido de um prompt é removido de cada chamada que o utiliza. Multiplique os tokens economizados por chamada pelo seu volume mensal de chamadas e pelo preço de entrada por milhão de tokens. Um corte de 1.000 tokens em um prompt executado um milhão de vezes por mês a US$ 3 por milhão economiza US$ 3.000 mensais – o tamanho do prompt é muito mais importante do que a maioria das equipes supõe, porque ele se repete em todas as solicitações.
A compactação imediata afeta o custo ou a qualidade da produção?
A compactação afeta apenas o lado de entrada – os tokens de saída e seu preço permanecem inalterados. Cortar instruções redundantes, exemplos detalhados de poucas cenas e contexto duplicado geralmente mantém a qualidade intacta, mas cortar de forma muito agressiva pode prejudicar a precisão. Combine o corte com o cache de prompt para prefixos estáveis para que o contexto fixo restante seja cobrado com desconto na taxa de leitura de cache.