Um cache só ajuda se a próxima solicitação vencer o relógio. Se o intervalo médio de inatividade entre solicitações for g minutos e o TTL do cache é T minutos, a taxa de acerto em estado estacionário é 1-e−T/g. Um cache de 5 minutos e um cache de 1 hora exatamente no mesmo código podem ter taxas de acerto totalmente diferentes puramente por causa do tempo - e uma falha paga o prêmio de gravação em vez da leitura barata.
Sem cache versus TTL de 5 minutos versus 1 hora
Mesmo tráfego, três estratégias. A taxa de acerto é calculada a partir do seu intervalo ocioso; um erro paga o prêmio de gravação (1,25× por 5 minutos, 2,0× por 1 hora), um acerto paga a taxa de leitura.
| Estratégia | Taxa de acerto do cache | Custo/solicitação | Custo/mês | vs sem cache |
|---|
Por que a taxa de acerto é um problema de tempo, não uma suposição
Prompt de contas de cache em três estados: a gravação em cache (primeira vez que um prefixo é visto ou após sua expiração) com um prêmio sobre o preço base do token, um leitura de cache (o prefixo ainda está ativo) com um grande desconto e tokens simples sem cache pelo preço total. O estado em que você chega em qualquer solicitação é decidido por uma coisa: a solicitação anterior aconteceu recentemente o suficiente para que o prefixo em cache ainda esteja ativo? Modele o intervalo ocioso entre as solicitações como sem memória — a suposição padrão para chegadas independentes — e a probabilidade de o intervalo ser menor que o TTL T é exatamente 1-e−T/g, onde g é a sua lacuna média. Essa é a sua taxa de acerto. É por isso que um bot de suporte que lida com uma mensagem a cada poucos minutos obtém uma ótima taxa de acertos em um cache de 1 hora, mas uma baixa taxa de acertos em um cache de 5 minutos, executando o código idêntico.
A compensação de 5 minutos versus 1 hora
O cache de 1 hora não é estritamente melhor — custa mais para escrever (cerca de 2,0× base versus 1,25× para o nível de 5 minutos). A questão é se a vida útil mais longa economiza perdas caras o suficiente para pagar pelas gravações mais caras. Quando seu intervalo de inatividade é pequeno em relação a cinco minutos (rajadas curtas), a gravação barata de 5 minutos já oferece uma taxa de acerto de quase 100% e o prêmio de 1 hora é puro desperdício. Quando o intervalo dura alguns minutos, o cache de 5 minutos expira constantemente e paga novamente a gravação em quase todas as solicitações, enquanto o cache de 1 hora permanece aquecido – portanto, apesar do multiplicador de gravação mais alto, o nível de 1 hora acaba sendo mais barato. O crossover depende inteiramente do seu g, e é por isso que adivinhar uma taxa de acerto fixa engana você. Esta ferramenta encontra o cruzamento para seus números.
O que mudou em 2026 e como responder
Quando um provedor reduz a vida útil do cache padrão – a mudança amplamente sentida de aproximadamente uma hora para cinco minutos – qualquer carga de trabalho com solicitações espaçadas passa silenciosamente de leituras para gravações, e as contas sobem de 30 a 60% sem alteração de código. Duas respostas funcionam: manter o cache aquecido com uma solicitação de pulsação leve dentro da janela mais curta ou optar explicitamente por um nível TTL mais longo quando o prêmio de gravação se pagar. Decida qual executando seu intervalo real de inatividade e volume de solicitação acima e compare com o calculadora de economia de cache imediata para a visualização de taxa de acerto fixa e o calculadora de ponto de equilíbrio de gravação em cache para o caso de reutilização única.
Trocas
Ferramentas e hospedagem
Como funciona esta calculadora
Ele calcula sua taxa de acertos de cache em estado estacionário como 1 − e^(−T/g) a partir de seu intervalo ocioso médio ge o TTL T de cada camada (5 minutos ou 60 minutos) e, em seguida, precifica cada solicitação como uma mistura de leituras de cache (acertos) e gravações de cache (erras) no prefixo em cache, além de tokens não armazenados em cache de preço integral. Ele compara o nível sem cache, o nível de 5 minutos e o nível de 1 hora, e relata o mais barato para seu tráfego e volume.
Perguntas frequentes
Como posso saber minha taxa real de acertos no cache de prompt?
Você deriva da frequência com que as solicitações chegam versus quanto tempo o cache dura. Com um intervalo ocioso médio de g minutos e um TTL de cache de T minutos, a taxa de acerto em estado estacionário é 1 − e^(−T/g). O mesmo código pode ter uma taxa de acerto de 10% em um cache de 5 minutos e uma taxa de acerto de 95% em um cache de 1 hora puramente por causa do tempo.
O cache de prompt de 1 hora vale o custo de gravação mais alto?
Depende da sua lacuna ociosa. O cache de 1 hora grava em ~2× base versus ~1,25× por 5 minutos, mas um TTL mais longo evita perdas dispendiosas. Solicitações com intervalo de minutos geralmente favorecem o nível de 1 hora; rajadas apertadas com alguns segundos de intervalo são adequadas para a gravação mais barata de 5 minutos.
Por que minha conta de cache imediato aumentou em 2026?
Porque a vida útil do cache padrão ficou mais curta. Mover o TTL padrão de aproximadamente 1 hora para aproximadamente 5 minutos faz com que qualquer tráfego com intervalos ociosos superiores a alguns minutos perca o cache e pague novamente o prêmio de gravação, aumentando silenciosamente as contas de 30 a 60% para cargas de trabalho espaçadas.