HomeToolsLearn › Otimização de Custos LLM
fatura mensal otimizada
poupança mensal
desconto efetivo
economizado por ano

De onde vêm as economias

AlavancaAplica-se aSalva

As três alavancas e por que elas se acumulam

A maioria dos conselhos de "cortar seus custos de LLM em 90%" é real - só se aplica a papel do seu tráfego, e os números do título assumem o melhor caso. Esta calculadora torna o compartilhamento explícito. Cache de prompt desconta o prefixo repetido de sua entrada (prompt do sistema, contexto RAG, um documento longo) para 10–50% da taxa de entrada; não faz nada para tokens de saída ou para entradas que alteram cada chamada. Processamento em lote oferece 50% fixos em qualquer solicitação que possa ser executada de forma assíncrona - ótimo para classificação, resumo e geração de relatórios, inútil para um chat ao vivo. Roteamento de modelo envia as solicitações fáceis para um modelo menor e muito mais barato e mantém o modelo de fronteira para as difíceis. Aplicados às fatias de tráfego que cada um pode realmente alcançar, resultam numa redução genuinamente grande.

Por que o desconto efetivo é inferior às manchetes

Se 90% de cache, 50% de lote e 85% de roteamento atingirem toda a sua conta, você não pagará quase nada, mas isso não acontece. O cache toca apenas na entrada armazenável em cache; o lote toca apenas no tráfego assíncrono; o roteamento atende apenas a solicitações que um modelo mais barato pode atender. Defina essas ações honestamente e a calculadora retornará o misturado desconto em sua carga de trabalho real. Esse número combinado – muitas vezes 40-70% em vez de 90% – é aquele que deve ser incluído no orçamento. Valide as alavancas individuais com o calculadora de cache imediata, o calculadora de economia em lote e o calculadora de roteamento de modelo.

A ordem das operações é importante

As alavancas interagem: o cache reduz primeiro o custo de entrada, depois o lote e o roteamento se aplicam ao que resta, portanto, empilhá-los não é uma simples adição. Essa ferramenta aplica o armazenamento em cache à fatia de entrada armazenável em cache e, em seguida, aplica descontos em lote e roteamento aos seus compartilhamentos do restante gastar, por isso o desconto combinado é menor que a soma das partes. Antes de otimizar, acerte sua linha de base com o Calculadora de custo de token LLM e encontre o modelo básico mais barato com API LLM mais barata.

Como usar

1. Insira seu gasto mensal atual de LLM e aproximadamente qual parcela é de tokens de entrada versus saída.
2. Defina quanto de sua entrada é repetida/armazenável em cache e o preço de acerto do cache do seu provedor (10% Antrópico, 25–50% OpenAI).
3. Defina a parcela de tráfego que você pode agrupar e a parcela que pode rotear para um modelo mais barato.
4. Leia a fatura otimizada e o desconto efetivo e, em seguida, implemente primeiro as alavancas com as maiores linhas "Economiza".

Perguntas frequentes

O cache e o lote são empilhados?

Sim — uma solicitação em lote também pode usar um prefixo em cache. Essa ferramenta aplica o cache primeiro à entrada e, em seguida, descontos em lote/roteamento aos gastos restantes, de modo que o efeito combinado seja multiplicativo, não aditivo.

Qual preço de acerto de cache devo usar?

Leituras de cache de notas antrópicas a 10% da taxa de entrada; OpenAI em 25–50% dependendo do modelo; Cache de contexto do Google em aproximadamente 10%. Use o valor do seu provedor para a fatia de entrada em cache.

O roteamento é arriscado para a qualidade?

Somente se você encaminhar solicitações difíceis para um modelo fraco. O padrão seguro é um classificador ou camada de regras que envia solicitações simples/curtas para o modelo barato e escala o restante. Modele a divisão de gastos com o calculadora de roteamento.

Estimativa apenas. Os descontos dependem do mix exato de tráfego e dos preços do provedor – verifique as taxas atuais antes de fazer o orçamento.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Economia de custos com IAEconomia imediata de cachePista de nível gratuitoCalculadora de economia de deflexão de suporte de IANíveis de API gratuitos