—fatura total/mês
—é o preâmbulo
—cache salva / mês
Para onde vão seus tokens de entrada
A fatura mensal é dividida no preâmbulo fixo que você sempre reenvia, nos tokens dinâmicos de usuário e de contexto e na saída. A primeira linha é o imposto – ele não diminui quando os usuários falam menos.
| Papel | Tokens/solicitação | Custo / mês | Compartilhar |
|---|
Como o tamanho imediato dimensiona o imposto
Cada linha tem um comprimento diferente de prompt do sistema no volume atual. A coluna sem cache é o custo ingênuo; a coluna em cache aplica sua taxa de acerto e desconto. É por isso que um prompt que cresceu de 500 para 4.000 tokens multiplicou silenciosamente sua conta.
| Alerta do sistema | Sem cache / mês | Em cache / mês | contra o seu |
|---|
A solicitação que você escreveu uma vez, você paga um milhão de vezes
Um prompt do sistema parece livre porque você o escreve uma vez e esquece, mas a API não tem estado, de modo que o preâmbulo acompanha cada chamada e é cobrado como tokens de entrada a cada vez. A armadilha são solicitações curtas e de alto volume: um classificador ou roteador que recebe vinte tokens de texto do usuário e um bloco de instruções de dois mil tokens está gastando 99% de seu orçamento de entrada em palavras que o usuário nunca enviou. A correção é enfadonha e eficaz – leia o prompt do sistema como se estivesse pagando por palavra, porque você está pagando, e elimine o preenchimento educado, as regras duplicadas e os esquemas de ferramentas que você quase nunca invoca. Em seguida, armazene em cache o que sobreviver, já que um preâmbulo estável é exatamente o motivo pelo qual o cache de prompt foi criado e uma leitura em cache custa aproximadamente um décimo de uma nova. A razão pela qual o corte vem em primeiro lugar é que ele ajuda incondicionalmente, tanto em erros quanto em acertos de cache, enquanto o cache só compensa nas solicitações que chegam enquanto o cache está quente e somente se o prefixo permanecer idêntico byte por byte - um carimbo de data / hora próximo ao topo e o desconto evapora. Dimensione a alavanca de cache precisamente no calculadora de economia de cache imediata, verifique o ponto de equilíbrio de gravação versus leitura no calculadora de ponto de equilíbrio de gravação em cachee conte os tokens em seu prompt atual com o contador de tokens.
Economia imediata de cachePonto de equilíbrio de gravação em cacheCusto de chamada de funçãoContador de fichasOtimização de custos LLM
Como funciona esta calculadora
Ele conta suas solicitações mensais como solicitações por dia multiplicadas por 30,4. Cada solicitação paga pelo prompt do sistema mais a entrada dinâmica na taxa de entrada e a saída na taxa de saída. O custo do prompt do sistema é a contagem de tokens vezes as solicitações mensais na taxa de entrada; o cache reduz a parcela da taxa de acerto para a taxa de desconto, enquanto a parcela perdida permanece com o preço total. A conta total soma o preâmbulo fixo, a entrada dinâmica e a saída. A parcela é o custo do prompt do sistema sobre esse total, e a economia de cache é o custo do preâmbulo não armazenado em cache menos o custo armazenado em cache. A tabela de dimensionamento executa novamente o custo do preâmbulo em vários comprimentos de prompt para que você possa ver como ele cresce, e o valor de corte aplica seu corte percentual ao prompt atual.
Perguntas frequentes
Por que o aviso do sistema custa dinheiro em cada solicitação?
Como a API não tem estado – ela não se lembra da sua chamada anterior – então, tudo o que você deseja que o modelo saiba a cada vez deve ser enviado a cada vez. O prompt do sistema, a persona, os exemplos de poucas tentativas e os esquemas de ferramentas residem nesse preâmbulo fixo e cada um é contado como tokens de entrada em cada solicitação. Um usuário que digita uma única palavra ainda paga por todo o preâmbulo que a acompanha, e é por isso que um prompt de sistema inchado se comporta como um imposto fixo cobrado integralmente nas menores e maiores solicitações.
Quanto da minha fatura o sistema solicita?
Depende da proporção entre o seu preâmbulo fixo e o conteúdo variável de cada solicitação. Um prompt de dois mil tokens contra um turno de usuário de quinhentos tokens é a maior parte de seus tokens de entrada e pode dominar a conta - especialmente em chamadas curtas e de alto volume, como classificação, onde quase não há texto do usuário para diluí-lo. Se suas solicitações contiverem documentos longos ou históricos de bate-papo, o preâmbulo será uma fatia menor. O caso perigoso é o alto volume, mais solicitações curtas e um prompt longo.
O cache de prompt remove o custo de prompt do sistema?
Ele remove a maior parte nas chamadas que atingem o cache. O cache armazena um prefixo estável – o prompt do sistema é o candidato perfeito – e as faturas são lidas com ele com um grande desconto, geralmente em torno de 90% de desconto, portanto, um prompt do sistema em cache custa cerca de um décimo de um não armazenado em cache. O problema é que apenas as solicitações que chegam enquanto o cache está quente recebem o desconto, às vezes há um pequeno prêmio de gravação e o prefixo deve ser idêntico byte por byte, portanto, um carimbo de data / hora próximo ao topo o interrompe.
É melhor cortar o prompt do sistema ou armazená-lo em cache?
Faça as duas coisas, mas elas resolvem problemas diferentes. O corte corta os tokens no preâmbulo, reduzindo o custo de cada solicitação, incluindo falhas de cache, e libera a janela de contexto. O cache deixa o prompt longo, mas torna as leituras repetidas baratas em chamadas quentes. O corte é a vitória mais robusta porque ajuda incondicionalmente, enquanto o armazenamento em cache depende de seu tráfego manter o cache aquecido. Retire primeiro tudo o que não está ganhando seus tokens e, em seguida, armazene em cache o que resta.