Cache de prompt, o API de lote e um desconto de gasto comprometido cada um deles reduziu sua conta - mas empilhados ingenuamente, eles parecem economizar mais do que você gasta. Eles compõem: o lote desconta o preço em cache já mais barato e o desconto comprometido é descontado do que sobrou. Isso precifica o custo combinado verdadeiro por milhão de tokens, o verdadeiro fatura mensal, e um cachoeira de onde realmente vem cada dólar economizado.
—
empilhado / mês
—preço de tabela / mês
—economia total
—misturado $/1 milhão
Cachoeira de poupança – cada alavanca atua sobre o que sobrou da última
Comece com o preço de tabela, aplique o cache imediato ao lado da entrada, depois a API do lote ao compartilhamento em lote e, em seguida, o desconto comprometido a toda a fatura restante. A coluna do degrau é o que aquela alavanca removeu sozinha; a coluna em execução é o que resta.
Estágio
Salvei esta etapa
Executando mensalmente
Aditivo vs multiplicativo – a armadilha
Adicionar os três descontos principais exagera a economia, às vezes ultrapassando 100%. A pilha real multiplica o que você guarda em cada etapa. Isso mostra a lacuna entre seus números.
Método
Poupança reivindicada
Mensal
Três descontos raramente o tornam gratuito
Cada guia de corte de custos LLM lista as mesmas alavancas - armazenar em cache seus prompts, agrupar o que pode esperar, comprometer-se a gastar para obter um desconto por volume - e cada uma delas cita uma porcentagem do título. O erro é empilhar essas porcentagens somando-as. Os descontos não somam, eles aumentam: cada um só trabalha com o dinheiro que o anterior deixou. Um desconto de cache de 90% que atinge apenas o lado de entrada, um desconto de lote de 50% na parcela de tráfego que tolera latência e um desconto comprometido de 15% na fatura não somam 155% de desconto — eles se multiplicam até um número real que é sempre menos impressionante que a soma e sempre maior que zero. Esta calculadora os aplica na ordem em que acontecem (armazenamento em cache no momento da solicitação, lote no envio, confirmação no faturamento) e conduz a fatura em cascata para que você possa ver o que cada alavanca realmente removeu, em vez do que seu folheto prometia. Ele também explica as armadilhas que os números das manchetes escondem: o armazenamento em cache apenas desconta os tokens de entrada, de modo que uma carga de trabalho com saída pesada mal sente isso; o lote só se aplica ao tráfego que pode esperar, portanto, um produto interativo direciona pouco do seu volume através dele; e alguns provedores não permitem armazenar em cache e agrupar a mesma solicitação. Avalie cada alavanca individualmente com o calculadora de cache imediata, o calculadora API em lote e o calculadora de gastos comprometidos - então venha aqui para ver o que eles realmente fazem juntos e compare o resultado com o total calculadora de otimização de custos.
O preço de tabela começa na divisão do token: tokens de entrada vezes o preço de entrada mais tokens de saída vezes o preço de saída, dividido por um milhão, vezes as solicitações por mês. O cache de prompt atua apenas no lado da entrada - o preço de entrada efetivo se torna o preço de entrada vezes um menos a fração armazenável em cache e reutilizada vezes o desconto de leitura do cache, portanto, se 70% da entrada for reutilizada e as leituras em cache forem 90% mais baratas, você economiza 63% do custo de entrada enquanto a saída permanece com o preço total. O desconto da API em lote se aplica à parcela do volume em lote: a parte em lote da conta pós-cache é multiplicada por um menos o desconto em lote, o restante permanece intacto, porque o tráfego em tempo real não pode ser agrupado. Finalmente, o desconto no gasto comprometido é um multiplicador fixo em toda a conta restante. O total empilhado é o preço de tabela executado em todos os três nessa ordem; o custo combinado por milhão de tokens é o total dividido pelo total de tokens processados. A tabela aditiva versus multiplicativa contrasta a poupança composta honesta com a soma ingénua das percentagens principais, que pode exceder 100% e está sempre errada. O cache toca apenas na entrada, o lote toca apenas no compartilhamento tolerante à espera, e alguns provedores bloqueiam o cache em solicitações em lote – portanto, trate o número combinado como o melhor caso para o tráfego onde todos os três se aplicam genuinamente.
Perguntas frequentes
Por que as economias acumuladas do LLM simplesmente não somam?
Cada alavanca desconta o que sobrou da última, então elas compõem em vez de somar. Mantenha 60% após o armazenamento em cache, 50% disso após o lote, 80% disso após o desconto comprometido e você terá 24% da lista - uma economia de 76%, não os 110% que você obtém adicionando 40, 50 e 20. Você nunca pode economizar mais do que gasta, e é por isso que somar as porcentagens dos títulos é sempre errado.
O cache de prompt apenas desconta tokens de entrada?
Sim. O cache reutiliza um prefixo de tokens que você já enviou; a saída é gerada sempre e nunca é armazenada em cache. Portanto, uma carga de trabalho RAG com muita entrada parece difícil de armazenar em cache, enquanto uma carga de trabalho de desenho com muita saída mal percebe isso. Esta ferramenta aplica o desconto de cache apenas à parte de entrada e apenas à fração reutilizada.
A ordem dos descontos altera o total?
Para porcentagens fixas, não - a multiplicação é comutativa, então 0,6 × 0,5 × 0,8 é o mesmo em qualquer ordem. A ordem só muda a história que a cachoeira conta. Começa a importar quando um desconto não é fixo – um nível comprometido que desbloqueia acima de um limite ou um prêmio de gravação em cache – que esta ferramenta sinaliza em vez de modelar exatamente.
Posso realmente empilhar todos os três em produção?
O armazenamento em cache e os descontos comprometidos são empilhados de forma limpa. A API Batch é o problema: os trabalhos em lote são assíncronos, portanto, apenas o tráfego tolerante à latência pode usá-los, e alguns provedores não oferecem armazenamento em cache para solicitações em lote. Defina a parcela do lote abaixo de 100% para modelar a divisão e verifique se seu provedor permite as alavancas juntas antes de prometer financiar o número combinado.