prompt do sistema / mês
fatura total/mês
é o preâmbulo
cache salva / mês

Para onde vão seus tokens de entrada

A fatura mensal é dividida no preâmbulo fixo que você sempre reenvia, nos tokens dinâmicos de usuário e de contexto e na saída. A primeira linha é o imposto – ele não diminui quando os usuários falam menos.

PapelTokens/solicitaçãoCusto / mêsCompartilhar

Como o tamanho imediato dimensiona o imposto

Cada linha tem um comprimento diferente de prompt do sistema no volume atual. A coluna sem cache é o custo ingênuo; a coluna em cache aplica sua taxa de acerto e desconto. É por isso que um prompt que cresceu de 500 para 4.000 tokens multiplicou silenciosamente sua conta.

Alerta do sistemaSem cache / mêsEm cache / mêscontra o seu

A solicitação que você escreveu uma vez, você paga um milhão de vezes

Um prompt do sistema parece livre porque você o escreve uma vez e esquece, mas a API não tem estado, de modo que o preâmbulo acompanha cada chamada e é cobrado como tokens de entrada a cada vez. A armadilha são solicitações curtas e de alto volume: um classificador ou roteador que recebe vinte tokens de texto do usuário e um bloco de instruções de dois mil tokens está gastando 99% de seu orçamento de entrada em palavras que o usuário nunca enviou. A correção é enfadonha e eficaz – leia o prompt do sistema como se estivesse pagando por palavra, porque você está pagando, e elimine o preenchimento educado, as regras duplicadas e os esquemas de ferramentas que você quase nunca invoca. Em seguida, armazene em cache o que sobreviver, já que um preâmbulo estável é exatamente o motivo pelo qual o cache de prompt foi criado e uma leitura em cache custa aproximadamente um décimo de uma nova. A razão pela qual o corte vem em primeiro lugar é que ele ajuda incondicionalmente, tanto em erros quanto em acertos de cache, enquanto o cache só compensa nas solicitações que chegam enquanto o cache está quente e somente se o prefixo permanecer idêntico byte por byte - um carimbo de data / hora próximo ao topo e o desconto evapora. Dimensione a alavanca de cache precisamente no calculadora de economia de cache imediata, verifique o ponto de equilíbrio de gravação versus leitura no calculadora de ponto de equilíbrio de gravação em cachee conte os tokens em seu prompt atual com o contador de tokens.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Economia imediata de cachePonto de equilíbrio de gravação em cacheCusto de chamada de funçãoContador de fichasOtimização de custos LLM