As três alavancas e por que elas se acumulam
A maioria dos conselhos de "cortar seus custos de LLM em 90%" é real - só se aplica a papel do seu tráfego, e os números do título assumem o melhor caso. Esta calculadora torna o compartilhamento explícito. Cache de prompt desconta o prefixo repetido de sua entrada (prompt do sistema, contexto RAG, um documento longo) para 10–50% da taxa de entrada; não faz nada para tokens de saída ou para entradas que alteram cada chamada. Processamento em lote oferece 50% fixos em qualquer solicitação que possa ser executada de forma assíncrona - ótimo para classificação, resumo e geração de relatórios, inútil para um chat ao vivo. Roteamento de modelo envia as solicitações fáceis para um modelo menor e muito mais barato e mantém o modelo de fronteira para as difíceis. Aplicados às fatias de tráfego que cada um pode realmente alcançar, resultam numa redução genuinamente grande.
Por que o desconto efetivo é inferior às manchetes
Se 90% de cache, 50% de lote e 85% de roteamento atingirem toda a sua conta, você não pagará quase nada, mas isso não acontece. O cache toca apenas na entrada armazenável em cache; o lote toca apenas no tráfego assíncrono; o roteamento atende apenas a solicitações que um modelo mais barato pode atender. Defina essas ações honestamente e a calculadora retornará o misturado desconto em sua carga de trabalho real. Esse número combinado – muitas vezes 40-70% em vez de 90% – é aquele que deve ser incluído no orçamento. Valide as alavancas individuais com o calculadora de cache imediata, o calculadora de economia em lote e o calculadora de roteamento de modelo.
A ordem das operações é importante
As alavancas interagem: o cache reduz primeiro o custo de entrada, depois o lote e o roteamento se aplicam ao que resta, portanto, empilhá-los não é uma simples adição. Essa ferramenta aplica o armazenamento em cache à fatia de entrada armazenável em cache e, em seguida, aplica descontos em lote e roteamento aos seus compartilhamentos do restante gastar, por isso o desconto combinado é menor que a soma das partes. Antes de otimizar, acerte sua linha de base com o Calculadora de custo de token LLM e encontre o modelo básico mais barato com API LLM mais barata.
Como usar
1. Insira seu gasto mensal atual de LLM e aproximadamente qual parcela é de tokens de entrada versus saída.
2. Defina quanto de sua entrada é repetida/armazenável em cache e o preço de acerto do cache do seu provedor (10% Antrópico, 25–50% OpenAI).
3. Defina a parcela de tráfego que você pode agrupar e a parcela que pode rotear para um modelo mais barato.
4. Leia a fatura otimizada e o desconto efetivo e, em seguida, implemente primeiro as alavancas com as maiores linhas "Economiza".
Perguntas frequentes
O cache e o lote são empilhados?
Sim — uma solicitação em lote também pode usar um prefixo em cache. Essa ferramenta aplica o cache primeiro à entrada e, em seguida, descontos em lote/roteamento aos gastos restantes, de modo que o efeito combinado seja multiplicativo, não aditivo.
Qual preço de acerto de cache devo usar?
Leituras de cache de notas antrópicas a 10% da taxa de entrada; OpenAI em 25–50% dependendo do modelo; Cache de contexto do Google em aproximadamente 10%. Use o valor do seu provedor para a fatia de entrada em cache.
O roteamento é arriscado para a qualidade?
Somente se você encaminhar solicitações difíceis para um modelo fraco. O padrão seguro é um classificador ou camada de regras que envia solicitações simples/curtas para o modelo barato e escala o restante. Modele a divisão de gastos com o calculadora de roteamento.
Estimativa apenas. Os descontos dependem do mix exato de tráfego e dos preços do provedor – verifique as taxas atuais antes de fazer o orçamento.