O que realmente é o cache de prompt
A maioria dos aplicativos LLM envia o mesmo bloco de texto no início de cada solicitação – um longo prompt do sistema, um conjunto de definições de ferramentas, alguns exemplos rápidos ou um pedaço de contexto de referência. Normalmente você paga integralmente token de entrada preço desse bloco em cada chamada, mesmo que nunca mude.
Cache de prompt permite que o provedor armazene esse estável prefixo após a primeira ligação e, em ligações posteriores que começam exatamente com o mesmo texto, cobram uma pequena fração da tarifa normal - geralmente em torno de 10% (um desconto de aproximadamente 90%). Você ainda paga o preço total pela parte que altera cada chamada (a verdadeira dúvida do usuário), mas a sobrecarga fixa torna-se quase gratuita.
Calculadora de economia de cache imediata →Como funciona entre provedores
Existem dois sabores amplos, e a diferença é importante para sua conta.
Cache explícito (por exemplo, antrópico)
Você marca onde termina o prefixo armazenável em cache. A primeira chamada escreve o cache e custa um pouco mais do que um token de entrada normal - geralmente cerca de 1.25× a taxa de entrada — porque o provedor precisa armazenar o prefixo processado. Cada chamada posterior que a reutiliza é uma leitura de cache, faturado em aproximadamente 0.1× a taxa de entrada. A cache tem um tempo de vida (TTL) - geralmente alguns minutos - que é atualizado cada vez que é atingido, de modo que um fluxo constante de tráfego o mantém aquecido.
Cache automático (por exemplo, OpenAI e outros)
O provedor detecta prefixos repetidos para você e aplica um desconto sem prêmio de gravação em cache e sem alterações de código. É mais simples, mas você tem menos controle: você não pode forçar um cache de longa duração, e as regras de desconto e elegibilidade são definidas pelo provedor (normalmente entrando em ação quando um prefixo ultrapassa um comprimento mínimo).
| Cache explícito | Cache automático | |
|---|---|---|
| Quem decide o que é armazenado em cache | Você (marque o prefixo) | Provedor (detecta repetições) |
| Custo de gravação em cache | ~1,25× entrada, uma vez | Nenhum |
| Custo de leitura de cache | ~0,1× entrada | Com desconto (conjunto do provedor) |
| Controle sobre TTL | Sim | Não |
Os multiplicadores são valores típicos publicados e variam de acordo com o modelo e o fornecedor – confirme sempre na página de preços do fornecedor.
A compensação entre gravação e leitura – quando compensa
Com um cache explícito, você paga um pequeno prêmio único para gravar e, em seguida, obtém um grande desconto em cada leitura. Portanto, o armazenamento em cache compensa quando você reutilize o prefixo vezes suficientes para compensar o custo de gravação. O ponto de equilíbrio é rápido: o prêmio de gravação é de apenas cerca de 0,25× de entrada extra, enquanto cada leitura economiza cerca de 0,9× de entrada – então você está à frente depois de aproximadamente duas reutilizações do mesmo prefixo. Depois disso, cada acerto é quase pura economia.
Os ingredientes que tornam o cache uma vitória clara:
- Um grande prefixo repetido — quanto mais tokens fixos, maior será o desconto em termos absolutos.
- Alto volume de chamadas — muitas solicitações compartilham o mesmo prefixo na janela TTL.
- Um prefixo estável - o bloco reutilizado é idêntico byte por byte em todas as chamadas.
Aplicativos com recuperação aumentada, assistentes de codificação com grandes prompts do sistema e bate-papo multiturno se ajustam a esse formato. Veja as táticas mais amplas no guia para reduzir sua conta de API LLM.
Um exemplo trabalhado
Digamos que você tenha um Prompt do sistema de 2.000 tokens (instruções + definições de ferramentas + alguns exemplos) que acompanha cada solicitação, e você faz 100.000 chamadas. Suponha um preço de entrada de US$ 3 por milhão de tokens, uma taxa de leitura de cache de 0,1× (US$ 0,30/M) e uma taxa de gravação de cache de 1,25× (US$ 3,75/M). Iremos ignorar a pergunta e a saída do usuário por chamada aqui, já que o cache não as altera.
Sem cache
Cada chamada paga o preço total por todos os 2.000 tokens de prefixo:
100.000 × 2.000 = 200.000.000 tokens × US$ 3/M = $600.
Com cache
O prefixo é escrito uma vez e lido nas outras 99.999 chamadas (na prática, é reescrito sempre que o TTL expira, mas com tráfego constante isso é insignificante):
- 1 gravação: 2.000 tokens × US$ 3,75/M ≈ $0.0075
- 99.999 leituras: ~200.000.000 tokens × US$ 0,30/M ≈ $60
Total ≈ $60 versus US$ 600 – um ~90% de corte na parte repetida da nota, pelo preço de uma linha marcando onde termina o prefixo. Em cargas de trabalho reais, o prefixo costuma ser maior e as chamadas mais frequentes, portanto a economia absoluta é ainda maior.
Calculadora de custo de token →Estime suas economias →Armadilhas para assistir
- Tudo antes da peça mutável deve ser idêntico. O cache corresponde a um prefixo exato. Um carimbo de data/hora, um nome de usuário ou um exemplo de pedido embaralhado próximo ao topo invalida a correspondência e você paga silenciosamente o preço total.
- Expiração do TTL. Se o tráfego for escasso e o intervalo entre as chamadas exceder o tempo de vida do cache, o prefixo expira e a próxima chamada paga novamente o custo de gravação. Cargas de trabalho intensas e de baixo volume são menos beneficiadas.
- Prefixos pequenos não valem a pena. Abaixo do comprimento mínimo armazenável em cache de um provedor – ou quando o bloco fixo tem apenas algumas centenas de tokens – a economia é pequena e o prêmio de gravação pode deixar você em uma situação um pouco pior.
- Coloque o material estável primeiro. Estruture os prompts para que o prompt, as ferramentas e o contexto imutáveis do sistema venham antes da entrada volátil do usuário; o cache só pode cobrir a execução principal de tokens idênticos.
Perguntas frequentes
Quanto o cache de prompt economiza?
Em uma leitura de cache, a maioria dos provedores cobra os tokens em cache em aproximadamente 10% da taxa de entrada normal – um desconto de 90% na parte repetida do seu prompt. O valor exato varia de acordo com o provedor, mas um prefixo grande e estável reutilizado em muitas chamadas é onde as economias são maiores.
O cache imediato custa mais para configurar?
Com caches explícitos (como o da Anthropic), a primeira chamada que grava o cache custa um pouco mais do que um token de entrada normal — normalmente cerca de 1,25x a taxa de entrada. Você recupera esse prêmio de gravação assim que reutiliza o prefixo algumas vezes, após o que cada hit é cobrado com uma taxa de leitura com grande desconto.
Quando o cache imediato não vale a pena?
O cache só ajuda quando um prefixo grande é idêntico nas chamadas e reutilizado antes que o cache expire. Um prefixo curto, um prompt que muda a cada chamada ou um baixo volume de chamadas significam que o custo de gravação nunca é recuperado — nesses casos, o cache adiciona sobrecarga em vez de economizar dinheiro.
Apenas para referência educacional — taxas de cache, TTLs e comprimentos mínimos são estimativas; confirme os termos atuais na página de preços de cada provedor.