Cache de prompt explicado

Como a reutilização de um prefixo de prompt estável reduz a parte repetida de sua conta de LLM em cerca de 90% - quando compensa e quando não compensa.

LarAprender › Explicação do cache de prompt

O que realmente é o cache de prompt

A maioria dos aplicativos LLM envia o mesmo bloco de texto no início de cada solicitação – um longo prompt do sistema, um conjunto de definições de ferramentas, alguns exemplos rápidos ou um pedaço de contexto de referência. Normalmente você paga integralmente token de entrada preço desse bloco em cada chamada, mesmo que nunca mude.

Cache de prompt permite que o provedor armazene esse estável prefixo após a primeira ligação e, em ligações posteriores que começam exatamente com o mesmo texto, cobram uma pequena fração da tarifa normal - geralmente em torno de 10% (um desconto de aproximadamente 90%). Você ainda paga o preço total pela parte que altera cada chamada (a verdadeira dúvida do usuário), mas a sobrecarga fixa torna-se quase gratuita.

Calculadora de economia de cache imediata →

Como funciona entre provedores

Existem dois sabores amplos, e a diferença é importante para sua conta.

Cache explícito (por exemplo, antrópico)

Você marca onde termina o prefixo armazenável em cache. A primeira chamada escreve o cache e custa um pouco mais do que um token de entrada normal - geralmente cerca de 1.25× a taxa de entrada — porque o provedor precisa armazenar o prefixo processado. Cada chamada posterior que a reutiliza é uma leitura de cache, faturado em aproximadamente 0.1× a taxa de entrada. A cache tem um tempo de vida (TTL) - geralmente alguns minutos - que é atualizado cada vez que é atingido, de modo que um fluxo constante de tráfego o mantém aquecido.

Cache automático (por exemplo, OpenAI e outros)

O provedor detecta prefixos repetidos para você e aplica um desconto sem prêmio de gravação em cache e sem alterações de código. É mais simples, mas você tem menos controle: você não pode forçar um cache de longa duração, e as regras de desconto e elegibilidade são definidas pelo provedor (normalmente entrando em ação quando um prefixo ultrapassa um comprimento mínimo).

Cache explícitoCache automático
Quem decide o que é armazenado em cacheVocê (marque o prefixo)Provedor (detecta repetições)
Custo de gravação em cache~1,25× entrada, uma vezNenhum
Custo de leitura de cache~0,1× entradaCom desconto (conjunto do provedor)
Controle sobre TTLSimNão

Os multiplicadores são valores típicos publicados e variam de acordo com o modelo e o fornecedor – confirme sempre na página de preços do fornecedor.

A compensação entre gravação e leitura – quando compensa

Com um cache explícito, você paga um pequeno prêmio único para gravar e, em seguida, obtém um grande desconto em cada leitura. Portanto, o armazenamento em cache compensa quando você reutilize o prefixo vezes suficientes para compensar o custo de gravação. O ponto de equilíbrio é rápido: o prêmio de gravação é de apenas cerca de 0,25× de entrada extra, enquanto cada leitura economiza cerca de 0,9× de entrada – então você está à frente depois de aproximadamente duas reutilizações do mesmo prefixo. Depois disso, cada acerto é quase pura economia.

Os ingredientes que tornam o cache uma vitória clara:

Aplicativos com recuperação aumentada, assistentes de codificação com grandes prompts do sistema e bate-papo multiturno se ajustam a esse formato. Veja as táticas mais amplas no guia para reduzir sua conta de API LLM.

Um exemplo trabalhado

Digamos que você tenha um Prompt do sistema de 2.000 tokens (instruções + definições de ferramentas + alguns exemplos) que acompanha cada solicitação, e você faz 100.000 chamadas. Suponha um preço de entrada de US$ 3 por milhão de tokens, uma taxa de leitura de cache de 0,1× (US$ 0,30/M) e uma taxa de gravação de cache de 1,25× (US$ 3,75/M). Iremos ignorar a pergunta e a saída do usuário por chamada aqui, já que o cache não as altera.

Sem cache

Cada chamada paga o preço total por todos os 2.000 tokens de prefixo:

100.000 × 2.000 = 200.000.000 tokens × US$ 3/M = $600.

Com cache

O prefixo é escrito uma vez e lido nas outras 99.999 chamadas (na prática, é reescrito sempre que o TTL expira, mas com tráfego constante isso é insignificante):

Total ≈ $60 versus US$ 600 – um ~90% de corte na parte repetida da nota, pelo preço de uma linha marcando onde termina o prefixo. Em cargas de trabalho reais, o prefixo costuma ser maior e as chamadas mais frequentes, portanto a economia absoluta é ainda maior.

Calculadora de custo de token →Estime suas economias →

Armadilhas para assistir

Perguntas frequentes

Quanto o cache de prompt economiza?

Em uma leitura de cache, a maioria dos provedores cobra os tokens em cache em aproximadamente 10% da taxa de entrada normal – um desconto de 90% na parte repetida do seu prompt. O valor exato varia de acordo com o provedor, mas um prefixo grande e estável reutilizado em muitas chamadas é onde as economias são maiores.

O cache imediato custa mais para configurar?

Com caches explícitos (como o da Anthropic), a primeira chamada que grava o cache custa um pouco mais do que um token de entrada normal — normalmente cerca de 1,25x a taxa de entrada. Você recupera esse prêmio de gravação assim que reutiliza o prefixo algumas vezes, após o que cada hit é cobrado com uma taxa de leitura com grande desconto.

Quando o cache imediato não vale a pena?

O cache só ajuda quando um prefixo grande é idêntico nas chamadas e reutilizado antes que o cache expire. Um prefixo curto, um prompt que muda a cada chamada ou um baixo volume de chamadas significam que o custo de gravação nunca é recuperado — nesses casos, o cache adiciona sobrecarga em vez de economizar dinheiro.

Apenas para referência educacional — taxas de cache, TTLs e comprimentos mínimos são estimativas; confirme os termos atuais na página de preços de cada provedor.