Um cache só ajuda se a próxima solicitação vencer o relógio. Se o intervalo médio de inatividade entre solicitações for g minutos e o TTL do cache é T minutos, a taxa de acerto em estado estacionário é 1-e−T/g. Um cache de 5 minutos e um cache de 1 hora exatamente no mesmo código podem ter taxas de acerto totalmente diferentes puramente por causa do tempo - e uma falha paga o prêmio de gravação em vez da leitura barata.

nível mais barato
custo / solicitação
custo/mês
salvo vs sem cache

Sem cache versus TTL de 5 minutos versus 1 hora

Mesmo tráfego, três estratégias. A taxa de acerto é calculada a partir do seu intervalo ocioso; um erro paga o prêmio de gravação (1,25× por 5 minutos, 2,0× por 1 hora), um acerto paga a taxa de leitura.

EstratégiaTaxa de acerto do cacheCusto/solicitaçãoCusto/mêsvs sem cache
⚠️ Modelo de referência, julho de 2026. Usa multiplicadores de cache de prompt padrão: cache escrever = 1,25× base para TTL de 5 minutos e 2,0× base para TTL de 1 hora; esconderijo ler = 0,10× base (ajustável acima). A taxa de acertos pressupõe solicitações com um intervalo ocioso distribuído exponencialmente (chegadas sem memória) — o tráfego intermitente ou perfeitamente periódico será diferente, e a primeira solicitação após uma inicialização a frio é sempre uma gravação. Confirme os multiplicadores ativos nos documentos de cache imediato do seu provedor. · Informar preço desatualizado →

Por que a taxa de acerto é um problema de tempo, não uma suposição

Prompt de contas de cache em três estados: a gravação em cache (primeira vez que um prefixo é visto ou após sua expiração) com um prêmio sobre o preço base do token, um leitura de cache (o prefixo ainda está ativo) com um grande desconto e tokens simples sem cache pelo preço total. O estado em que você chega em qualquer solicitação é decidido por uma coisa: a solicitação anterior aconteceu recentemente o suficiente para que o prefixo em cache ainda esteja ativo? Modele o intervalo ocioso entre as solicitações como sem memória — a suposição padrão para chegadas independentes — e a probabilidade de o intervalo ser menor que o TTL T é exatamente 1-e−T/g, onde g é a sua lacuna média. Essa é a sua taxa de acerto. É por isso que um bot de suporte que lida com uma mensagem a cada poucos minutos obtém uma ótima taxa de acertos em um cache de 1 hora, mas uma baixa taxa de acertos em um cache de 5 minutos, executando o código idêntico.

A compensação de 5 minutos versus 1 hora

O cache de 1 hora não é estritamente melhor — custa mais para escrever (cerca de 2,0× base versus 1,25× para o nível de 5 minutos). A questão é se a vida útil mais longa economiza perdas caras o suficiente para pagar pelas gravações mais caras. Quando seu intervalo de inatividade é pequeno em relação a cinco minutos (rajadas curtas), a gravação barata de 5 minutos já oferece uma taxa de acerto de quase 100% e o prêmio de 1 hora é puro desperdício. Quando o intervalo dura alguns minutos, o cache de 5 minutos expira constantemente e paga novamente a gravação em quase todas as solicitações, enquanto o cache de 1 hora permanece aquecido – portanto, apesar do multiplicador de gravação mais alto, o nível de 1 hora acaba sendo mais barato. O crossover depende inteiramente do seu g, e é por isso que adivinhar uma taxa de acerto fixa engana você. Esta ferramenta encontra o cruzamento para seus números.

O que mudou em 2026 e como responder

Quando um provedor reduz a vida útil do cache padrão – a mudança amplamente sentida de aproximadamente uma hora para cinco minutos – qualquer carga de trabalho com solicitações espaçadas passa silenciosamente de leituras para gravações, e as contas sobem de 30 a 60% sem alteração de código. Duas respostas funcionam: manter o cache aquecido com uma solicitação de pulsação leve dentro da janela mais curta ou optar explicitamente por um nível TTL mais longo quando o prêmio de gravação se pagar. Decida qual executando seu intervalo real de inatividade e volume de solicitação acima e compare com o calculadora de economia de cache imediata para a visualização de taxa de acerto fixa e o calculadora de ponto de equilíbrio de gravação em cache para o caso de reutilização única.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Economia imediata de cachePonto de equilíbrio de gravação em cacheCusto da janela de contextoCusto do token LLM

Trocas

BybitBinânciaOKXKuCoinBitgetPortão.ioMéxico

Ferramentas e hospedagem

📈 Visualização de Negociação🔒NordVPN💳 RevoluçãoHospedeiro

Como funciona esta calculadora

Ele calcula sua taxa de acertos de cache em estado estacionário como 1 − e^(−T/g) a partir de seu intervalo ocioso médio ge o TTL T de cada camada (5 minutos ou 60 minutos) e, em seguida, precifica cada solicitação como uma mistura de leituras de cache (acertos) e gravações de cache (erras) no prefixo em cache, além de tokens não armazenados em cache de preço integral. Ele compara o nível sem cache, o nível de 5 minutos e o nível de 1 hora, e relata o mais barato para seu tráfego e volume.

Perguntas frequentes

Como posso saber minha taxa real de acertos no cache de prompt?

Você deriva da frequência com que as solicitações chegam versus quanto tempo o cache dura. Com um intervalo ocioso médio de g minutos e um TTL de cache de T minutos, a taxa de acerto em estado estacionário é 1 − e^(−T/g). O mesmo código pode ter uma taxa de acerto de 10% em um cache de 5 minutos e uma taxa de acerto de 95% em um cache de 1 hora puramente por causa do tempo.

O cache de prompt de 1 hora vale o custo de gravação mais alto?

Depende da sua lacuna ociosa. O cache de 1 hora grava em ~2× base versus ~1,25× por 5 minutos, mas um TTL mais longo evita perdas dispendiosas. Solicitações com intervalo de minutos geralmente favorecem o nível de 1 hora; rajadas apertadas com alguns segundos de intervalo são adequadas para a gravação mais barata de 5 minutos.

Por que minha conta de cache imediato aumentou em 2026?

Porque a vida útil do cache padrão ficou mais curta. Mover o TTL padrão de aproximadamente 1 hora para aproximadamente 5 minutos faz com que qualquer tráfego com intervalos ociosos superiores a alguns minutos perca o cache e pague novamente o prêmio de gravação, aumentando silenciosamente as contas de 30 a 60% para cargas de trabalho espaçadas.